DeepMind研究人员研发出了一种解决机器人控制问题的混合方案
2020/01/10 13:21AI云资讯11207
机器人技术的基本问题既涉及离散变量(比如控制模式或齿轮切换的选择),又涉及连续变量(比如速度设定点和控制增益)。通常来说,由于算法或控制策略并不总是适合的,因此这些问题很难解决。这就是为什么谷歌母公司Alphabet的DeepMind的研究人员最近提出了一种技术:连续-离散混合学习,即可以同时优化离散和连续动作,以其本来的形式处理混合问题。

在预印本服务器Arxiv.org上发表的一篇论文详细介绍了他们的工作,这篇论文也在去年10月日本大阪的第三届机器人学习会议上被人接受。作者写道:“许多先进的方法都进行了优化,它们能很好处理离散的或是连续的动作空间,但是却很少有方法能同时处理。能够使用同一算法强大地处理离散和连续动作空间,使我们能够针对任何给定问题都能选择最自然的解决方案策略,而不是让算法上的便利性来决定做出哪种选择。”
团队研发的无模型算法,是指利用强化学习或者奖励实现目标的自主代理人的培训技术,通过连续和离散动作空间来解决控制问题,并通过受控和自主切换来解决混合最优控制问题。此外,这种算法通过使用“元动作”或其他类似方案来扩大动作空间(分别定义了代理人可能感知和采取的状态和动作的范围),从而为解决现有的机器人问题提供了新颖的解决方案,并使策略可以解决类似人工智能训练期间的机械磨损等挑战 。

来源:DeepMind
DeepMind机器人技术
研究人员在一系列模拟和现实基准测试中验证了他们的方法,包括Rethink Robotics公司的Sawyer机器人手臂。据称,基于给定的到达、抓取和拿起魔方的任务,其中奖励是三个子任务的总和,因此他们的算法要优于无法解决任务的现有方法。
那是因为到达魔方需要代理人打开手臂的抓具,而抓取方块需要关闭抓具。作者写道:“一开始,基线将大部分概率集中在较小的动作值上,因此很难移动抓具的手指来看到任何奖励,从而解释了学习曲线上的平稳期。另一方面,这个算法能始终以全速操作抓具,因此改进了探查性,使机器人可以完全完成任务。”
在一个单独的实验中,团队将其算法设置为参数化动作空间马尔可夫决策过程(PAMDP)或一个分层问题,其中,代理人首先选择离散动作,然后为该动作选择一组连续的参数集。在这种情况下,代理人的任务是操纵机器人手臂,以便将钉子插入孔中,然后根据孔的位置和运动学来计算奖励。
研究人员表示,他们的方法比精细方法和粗略方法获得了更大的回报,并且这种算法将来可以作为基础应用到更多的混合强化学习中。论文中写道:“对于专业设计师而言,事先选择合适的模式可能很困难。而我们的方法是很有用的,因为它只需要一个实验,而别的方法都需要通过消融来进行验证。”
相关文章
- 2026世界机器人大会 | 联通在线多款机器人及智能终端产品亮相,赋能智慧生活新体验
- 艾图科技承办2026世界机器人大会专题分论坛 落地场景引爆WRC
- 当过手机电池大王,又跻身具身机器人电池领导品牌! 飞毛腿凭什么?
- 机器人“指挥”机器人 2026世界机器人大会现场,当虹科技展出真实场景“多机协同”
- 越疆闪耀WRC 2026,新一代具身全栖机器人线下首次亮相
- 2026世界机器人大会|知行全新灵巧手系列首发,展台人气持续高涨
- 明略科技吴明辉WRC主论坛演讲:机器人的下半场,需要两个“大脑”
- 瑞芯微亮相2026世界机器人博览会 全栈端侧方案服务全品类机器人
- 2026 世界机器人大会观察:告别展厅特效泡沫,合十思维用 “真活儿” 验证机器人落地能力
- 当机器人开始“懂工”:卡诺普双足人形机器人亮相,工业Know-how成为具身智能新资产
- 从“炫技”到“上岗”,WRC见证七腾机器人领跑特种赛道“价值兑现”
- 游仞智能携“诊脉灵巧手”亮相2026世界机器人大会
- Moxy摸喜亮相WRC展:告别语音内卷 纯触觉交互机器人能否开辟AI陪伴新赛道?
- 现实版变形金刚落地!有怡科技发布可变形本质人形机器人T01
- 开创具身智能保险新范式:丈八科技、平安财险重庆分公司、七腾机器人达成战略合作
- 机器漫步在世界机器人大会发布桌面服务机器人V2.0,单臂突破180杯/小时,全行业最快!
AI企业
更多>>AI硬件
更多>>AI产业
更多>>AI技术
更多>>- 全球最强开源模型 Kimi K3 发布,参数规模 3 万亿,真的是强!
- 范式变革!东软发布AI原生软件工程白皮书,重构软件产业底层逻辑
- KAT-Coder-Pro V2.5正式发布:从“写代码”迈向“做工程”,Agentic能力全面升级
- 自变量机器人王昊:训练世界模型需付出“时间税”,解决模态对齐是当务之急
- 腾讯发布CodeBuddy Security,用AI Agent实现更高效的代码审计
- Twinkle x昇腾,率先实现Deepseek-V4系列模型高效训练
- 高德发布鸿蒙首个生成式 UI 开源框架 AGenUI,告别传统 UI 开发模式
- 发布即适配| 天数智芯全力支持腾讯混元Hy3 preview 开源落地,共推国内大模型产业普惠









