Motion

虚实迁移:AI模拟如何取代数月的机器人工程

在将人形机器人部署到真实工厂之前,在模拟环境中对其进行训练,可将集成时间从数月缩短到数天。本文将介绍 sim-to-real 迁移的工作原理以及它对制造商的重要性。

Motion1 Inc. ·

虚实迁移:AI模拟如何取代数月的机器人工程

旧方法:工厂车间的反复试验

自工业机器人诞生以来,其部署一直遵循着同样的痛苦模式。工程师安装机器人,编写控制代码,在工厂车间进行测试,发现其未能按预期工作,然后反复迭代,有时数周,有时数月,直到机器人达到可接受的性能。然后,整个循环会针对下一个任务、下一个产品变体、下一条生产线重复进行。

Physical AI 是现在赋予那些必须在现实世界中工作的智能的名称。它感知、决策、移动,并为每一个错误付出物理代价。正是这种代价,使得学习必须首先在其他地方进行。

这个过程之所以缓慢,是因为现实世界中的测试本身就很慢。在工厂车间,每个迭代周期需要数分钟到数小时,机器人必须实际执行任务,工程师必须观察结果,诊断故障,修改代码,然后再次尝试。一次部署可能需要五十到一百个这样的循环,机器人才能可靠地运行。每次部署成本在5万到15万欧元之间,昂贵的工程人才被占用数月,经济成本是巨大的。

Sim-to-real 迁移,在真实环境的虚拟仿真中训练机器人,然后将训练好的策略部署到物理硬件上,有望将这一时间线从数月压缩到数天。这个想法并不新鲜,但人工智能、计算机视觉和物理仿真领域的最新进展已将其从学术上的好奇心转变为实用的部署工具。对于任何评估人形自动化的制造商来说,了解其工作原理、优势以及局限性至关重要。

Sim-to-Real 迁移的工作原理

Sim-to-real 流程始于捕获真实环境。工厂的照片和视频,使用普通智能手机或工人佩戴的视角相机拍摄,被处理成一个三维仿真,复制实际设施的几何形状、光照和物理特性。这并非一个通用的仓库或风格化的工厂车间;它是您特定生产环境的数字孪生,包含您的设备、您的产品和您的布局。

一旦仿真环境建立,人形机器人的训练过程便开始。一项任务会从已经执行该任务的操作员那里捕获,例如,“从传送带末端拾取产品,检查可见缺陷,然后装入六个一盒的箱子中。”一个 AI 系统将该任务分解为离散的操作步骤,并开始训练人形机器人在仿真中执行每个步骤。

训练以在现实世界中不可能达到的速度进行。在仿真中,人形机器人每小时可以尝试一项任务数千次,从每次失败中学习并完善其方法。在现实中,每次尝试都需要数分钟,并有损坏设备或产品的风险。仿真将数月的现实世界学习压缩为数小时的计算,而且成本仅为一小部分,GPU 计算时间与工厂车间高薪工程人才的成本相比。

训练好的策略在接触真实硬件之前会根据准确性目标进行验证。通常,在仿真中任务完成率的阈值是百分之九十或更高。只有当达到这个目标时,策略才会转移到物理机器人上,在那里进行短暂的现实世界微调,以弥补仿真与现实之间剩余的差距。

Traditional robotics timeline (12-18 months) vs sim-to-real (4-6 weeks)

弥合 Sim-to-Real 差距

基于仿真的机器人技术一直以来的批评是 Sim-to-real 差距,即在仿真中完美运行的策略在现实世界中往往会失败的现象。仿真图形无法完美匹配现实。模拟物理是近似的。真实传感器引入了仿真无法捕捉的噪声和延迟。而且现实世界包含气流、振动、温度变化、表面不规则性等传统仿真所忽略的影响。

现代方法通过过去两年中显著成熟的几种技术来解决这些差距。

域随机化或许是最重要的。在训练过程中,仿真会随机改变纹理、光照条件、物体位置、表面摩擦力以及其他物理参数。机器人不是学习在一个完美的环境中执行任务,而是学习处理各种变化。当它遇到现实世界时,从机器人的角度来看,这只是随机化训练环境的另一个变体,它会进行泛化而不是失败。

渐进式迁移提供了额外的安全层。策略不是从仿真直接跳到全面生产,而是分阶段转移:高保真仿真,然后是简化的现实世界测试环境,接着是有限的生产运行,最后是全面部署。每个阶段在下一个阶段开始之前都会验证性能,从而在问题解决成本较低时及早发现问题。

持续学习确保仿真随着时间的推移而改进。一旦部署,机器人会收集现实世界数据,并将其反馈到仿真引擎中。数字孪生随着每次操作班次的进行而变得更加准确,并且在更新后的仿真中训练的未来策略所需的现实世界微调更少。这创造了一个良性循环:更多的部署带来更好的仿真,从而带来更快、更可靠的未来部署。

Sim-to-Real 的优势所在

Sim-to-real 对于具有某些共同特征的制造任务特别有效。具有一致产品几何形状的重复性任务,包装、码垛、分拣、物料搬运,是理想的选择,因为仿真可以高保真地建模相关对象,并且任务结构足够可预测,以便强化学习快速收敛。

在受控环境中的任务表现优于在非受控环境中的任务。具有一致光照、稳定温度和可预测设备布局的工厂车间比室外建筑工地或农田更容易准确仿真。

具有明确成功标准的任务,箱子已密封、托盘已堆叠、产品已检查,比具有主观或模糊结果的任务训练得更快,因为强化学习算法需要一个明确定义的奖励信号来进行优化。

复合优势

每一次 Sim-to-real 部署都会生成数据,从而改进下一次部署。仿真模型随着整合现实世界反馈而变得更加准确。任务分解算法从过去的成功和失败中学习。随着训练数据库的增长,策略训练收敛得更快。

这创造了一个数据飞轮,是人形机器人领域最具战略意义的动态之一。最早开始 Sim-to-real 部署的公司和制造商积累的数据最多,构建的仿真最准确,并实现最快的部署时间。后来者面临着复合劣势:他们不仅缺乏数据,而且还在与那些部署基础设施已经迭代改进了数月或数年的组织竞争。

对于制造商而言,实际意义是明确的。您工厂的第一次 Sim-to-real 部署将是最慢、最复杂的。第二次将显著加快。到第五或第六次部署时,该过程将变得例行化。问题不在于 Sim-to-real 是否会成为人形机器人部署的标准方法,经济因素使其不可避免。问题在于您的工厂是现在就开始生成数据并构建能力,还是以后从头开始。

← 返回博客