从任务捕获到工作流程:人形机器人如何学习工厂工作
记录现有操作员的工作,然后将其转化为可部署的类人工作流程。Motion 的 Field Deployment Engineers 和 AI Workflow Builder 就是这样让机器人执行您的任务的。
Motion1 Inc. ·

我们所知的机器人编程的终结
自工业机器人诞生以来,要让它们完成有用的工作,就需要专业的编程。无论是专有语言,例如用于工业机械臂的示教器,还是像Python和C++这样的通用语言,根本限制都是一样的:一个拥有深厚技术知识的人必须手动指定机器人行为的各个方面,从高层任务逻辑到单个关节轨迹。
Physical AI 打破了这一限制。一旦模型能够观察任务的执行并推断出运动背后的意图,指定行为就从编写代码转变为展示工作。
这一限制塑造了机器人技术的整体经济模式。这意味着每一次部署都需要昂贵的工程人才。这意味着每一个新任务都需要新的编程工作。这意味着理解工作的人,运营经理和生产线工人,与能够编程机器人的人之间,隔着一层由顾问和工程师组成的翻译层,这在每个阶段都增加了成本、时间和沟通不畅。
以自我为中心的任务捕获是消除这一限制的技术。运营经理展示需要完成的工作,从他们自己的视角记录下来,并伴随着对步骤的口头描述:从传送带上拾取产品,检查缺陷,装入六个一盒的箱子,密封并码垛。Field Deployment Engineer 将这些捕获转化为 AI Workflow Builder 中可供部署的工作流程。制造商无需招聘工程人员。无需机器人学学位。无需在工厂车间进行数月的迭代。
其影响远不止便利性。这种模式从根本上改变了谁可以部署机器人、部署速度以及部署成本。它之于机器人技术,犹如电子表格之于财务建模,网络浏览器之于信息获取,智能手机之于个人计算:一项将强大能力从专家手中普及到每个人的技术。
管道内部
展示一个任务并获得一个可用的工作流程,其表面上的简单性掩盖了一个由协同工作的复杂 AI 代理组成的管道。了解幕后发生的事情对于评估不同部署平台的成熟度和可靠性很有用。
该管道始于任务分解。一个专门的 AI 代理解析捕获的任务,录音和操作员对步骤的描述,并将其分解为离散的操作步骤。“将产品包装成箱”变成了一系列原子动作:接近传送带,识别产品,以适当的力抓取,运输到箱子,正确定向,放置,释放,重复直到箱子装满,密封箱子,运输到托盘,并按照定义的模式堆叠。这种分解必须考虑操作顺序、步骤之间的依赖关系以及机器人必须在替代动作之间做出选择的决策点。
接下来,一个场景生成代理创建真实环境的三维模拟。该代理使用工厂的实际照片和视频,用普通相机捕获,重建几何结构,识别关键对象(传送带、箱子、产品、托盘),并为每个元素分配真实的物理属性(质量、摩擦力、可变形性)。结果是特定于制造商设施的数字孪生。
然后,一个策略训练代理接管,利用强化学习和现场远程操作数据来训练人形机器人,使其在模拟中执行每个步骤。机器人每小时练习数千次迭代,成功完成任务会获得奖励,失败则会受到惩罚。通过这个过程,它形成了一个控制策略,从感官输入到运动输出的映射,从而实现每个步骤的目标精度。
一个部署代理通过一系列测试验证训练好的策略,处理从模拟到现实的转移过程,并在初始操作期间通过实时监控管理到物理硬件的交接。
最后,当任务需要机器人之间的协作或多个单元在同一设施中处理相关任务时,一个编排代理会协调多个人形机器人。

任务捕获改变了什么
从编程到任务捕获的转变不仅仅是工具的改变。它从根本上重构了理解工作的人与执行工作的机器人之间的关系。
在传统模式中,运营经理知道需要做什么,但无法直接传达给机器人。他们必须向机器人工程师解释,工程师会进行解释(不可避免地会丢失细微差别和上下文),将其翻译成代码(不可避免地会产生假设和简化),并进行迭代(不可避免地会在请求和交付之间产生偏差)。这种“传话游戏”增加了数月的时间、数万美元的成本,以及意图与实施之间持续存在的差距。
在任务捕获模式中,运营经理以他们已经知道的方式传达工作:通过在摄像机前操作并向 Field Deployment Engineer 讲解。Workflow Builder 处理从捕获的任务到机器人行为的转换。反馈循环非常紧密,如果生成的工作流程与意图不符,经理会指出,系统会在几分钟而不是几周内重新生成工作流程。
这不仅仅是更快。这是自动化过程参与者的一次质变。全球机器人工程师的数量只有数万人。全球运营经理、班组长和能够演示制造任务的领域专家数量则达数百万人。任务捕获将能够让机器人投入工作的人群扩大了两个数量级。
迭代循环
部署并非一次性过程,将其视为一次性过程会产生误导。最有效的部署采用迭代循环,通过快速的精炼周期,最终达到生产就绪的质量。
该过程始于对任务进行高层次的初步捕获。平台生成工作流程的初稿并在模拟中运行。运营经理审查模拟结果,识别机器人行为与预期结果之间的差异,并提供缺失的细节,第二次录制、修正、团队认为理所当然的约束。平台重新生成工作流程,循环重复。
每次迭代在模拟中只需几分钟,而在工厂车间则需要数小时或数天。大多数工作流程在三到五次迭代后即可达到生产就绪的质量,这个过程可以在一个工作日内完成。与传统现场开发通常需要数月时间、五十到一百次迭代周期相比,这种加速是显而易见的。
诚实的边界
任务捕获是一种强大的方法,但它并非魔法,其当前的局限性应被清楚地理解。
高度灵巧的任务,穿针引线、打结、操作非常小或非常柔韧的部件,仍然是当前系统能力所及的边缘。人手灵巧度与人形机器人抓手能力之间的差距是真实存在的,尽管它随着每一代硬件的进步而缩小。
新颖环境比熟悉环境需要更长时间。在全新类型的设施中进行首次部署比在类似设施中进行后续部署需要更多的迭代,因为模拟模型可借鉴的先验数据较少。
条件变化不可预测的动态环境,室外建筑工地、农田、非结构化零售空间,比受控的工厂环境更难准确模拟,因此生成的策略需要更多的实际微调。
这些局限性在今天确实存在。但它们也随着每一次部署而缩小,因为数据飞轮提高了模拟保真度,强化学习算法遇到并适应了更广泛的条件。轨迹是清晰的:今天困难的事情,明天将成为常态。