Motion

태스크 캡처에서 워크플로우로: 휴머노이드 로봇이 공장 업무를 배우는 방법

기존에 작업을 수행하는 작업자들을 기록하여, 이를 즉시 배포 가능한 휴머노이드 워크플로우로 전환합니다. Motion의 Field Deployment Engineer와 AI Workflow Builder가 로봇으로 귀하의 작업을 실행시키는 방법은 다음과 같습니다.

Motion1 Inc. ·

태스크 캡처에서 워크플로우로: 휴머노이드 로봇이 공장 업무를 배우는 방법

우리가 알던 로봇 프로그래밍의 종말

로봇이 산업계에 존재해 온 이래로, 로봇이 유용한 작업을 수행하게 하려면 전문적인 프로그래밍이 필요했습니다. 산업용 로봇 팔에 사용되는 티치 펜던트와 같은 독점적인 언어이든, Python 및 C++와 같은 범용 언어이든, 근본적인 제약은 동일했습니다. 즉, 깊은 기술 지식을 가진 사람이 고수준 작업 논리부터 개별 관절 궤적에 이르기까지 로봇 행동의 모든 측면을 수동으로 지정해야 했습니다.

Physical AI는 이러한 제약을 깨뜨립니다. 모델이 작업이 수행되는 것을 관찰하고 동작 뒤에 숨겨진 의도를 추론할 수 있게 되면, 행동을 지정하는 방식이 코드를 작성하는 것에서 작업을 시연하는 것으로 전환됩니다.

이러한 제약은 로봇 공학의 전체 경제학을 형성했습니다. 이는 모든 배포에 값비싼 엔지니어링 인재가 필요하다는 것을 의미했습니다. 모든 새로운 작업에는 새로운 프로그래밍 노력이 필요하다는 것을 의미했습니다. 이는 작업을 이해하는 사람들(운영 관리자와 현장 작업자)이 로봇을 프로그래밍할 수 있는 사람들과 분리되어, 모든 단계에서 비용, 시간, 오해를 추가하는 컨설턴트 및 엔지니어의 번역 계층에 의해 연결되었다는 것을 의미했습니다.

Egocentric task capture는 이러한 제약을 해소하는 기술입니다. 운영 관리자가 해야 할 일을 보여줍니다. 그들이 작업을 수행하는 동안 자신의 관점에서 녹화되고, 단계에 대한 음성 설명과 함께: 컨베이어에서 제품을 집어 들고, 결함을 검사하고, 6개씩 상자에 포장하고, 밀봉하고, 팔레트에 적재합니다. Field Deployment Engineers는 해당 캡처를 AI Workflow Builder에서 배포 준비가 된 워크플로우로 전환합니다. 제조업체 측의 엔지니어 채용이 필요 없습니다. 로봇 공학 학위도 필요 없습니다. 공장 현장에서 수개월간의 반복 작업도 필요 없습니다.

그 의미는 편의성을 훨씬 뛰어넘습니다. 이 모델은 로봇을 누가 배포할 수 있는지, 얼마나 빨리 배포할 수 있는지, 그리고 어떤 비용으로 배포할 수 있는지를 근본적으로 변화시킵니다. 이는 로봇 공학에 있어 스프레드시트가 재무 모델링에, 웹 브라우저가 정보 접근에, 스마트폰이 개인 컴퓨팅에 미친 영향과 같습니다. 즉, 강력한 기능을 전문가에서 모든 사람에게로 옮기는 기술입니다.

파이프라인 내부

작업을 시연하고 작동하는 워크플로우를 받는 겉보기에는 단순한 과정 뒤에는 정교한 AI 에이전트 파이프라인이 조화롭게 작동하고 있습니다. 이면에서 어떤 일이 일어나는지 이해하는 것은 다양한 배포 플랫폼의 성숙도와 신뢰성을 평가하는 데 유용합니다.

파이프라인은 작업 분해로 시작됩니다. 전문 AI 에이전트가 캡처된 작업(녹화물 및 작업자의 단계 설명)을 분석하고 이를 개별 조작 단계로 분해합니다. "제품을 상자에 포장하기"는 다음과 같은 원자적 행동의 순서가 됩니다: 컨베이어에 접근하고, 제품을 식별하고, 적절한 힘으로 잡고, 상자로 운반하고, 올바르게 방향을 잡고, 놓아두고, 상자가 가득 찰 때까지 반복하고, 상자를 밀봉하고, 팔레트로 운반하고, 정의된 패턴에 따라 쌓습니다. 이 분해는 작업 순서, 단계 간의 종속성, 그리고 로봇이 대안적인 행동 중에서 선택해야 하는 결정 지점을 고려해야 합니다.

다음으로, 장면 생성 에이전트가 실제 환경의 3차원 시뮬레이션을 생성합니다. 실제 공장의 사진과 비디오(일반 카메라로 캡처됨)를 사용하여 에이전트는 기하학적 구조를 재구성하고, 주요 객체(컨베이어, 상자, 제품, 팔레트)를 식별하며, 각 요소에 현실적인 물리적 속성(질량, 마찰, 변형 가능성)을 할당합니다. 그 결과는 제조업체의 시설에 특화된 디지털 트윈입니다.

이어서 정책 훈련 에이전트가 강화 학습 및 현장 원격 조작 데이터를 사용하여 시뮬레이션 내에서 각 단계를 실행하도록 휴머노이드를 훈련합니다. 로봇은 시간당 수천 번의 반복 연습을 하며, 성공적인 작업 완료에 대한 보상을 받고 실패에 대한 페널티를 받습니다. 이 과정을 통해 로봇은 각 단계에 대한 목표 정확도를 달성하는 제어 정책(감각 입력에서 운동 출력으로의 매핑)을 개발합니다.

배포 에이전트는 일련의 테스트를 통해 훈련된 정책을 검증하고, 시뮬레이션-실제 전송 프로세스를 처리하며, 초기 작동 중 실시간 모니터링을 통해 물리적 하드웨어로의 인계를 관리합니다.

마지막으로, 오케스트레이션 에이전트는 작업에 로봇 간 협업이 필요하거나 여러 장치가 동일 시설에서 관련 작업을 수행할 때 여러 휴머노이드 간의 조정을 담당합니다.

배포 파이프라인: 작업 캡처, AI 분해, 시뮬레이션 검증, 배포

작업 캡처가 바꾸는 것

프로그래밍에서 작업 캡처로의 전환은 단순히 도구의 변화가 아닙니다. 이는 작업을 이해하는 사람들과 작업을 수행하는 로봇 간의 관계를 근본적으로 재구성합니다.

전통적인 모델에서 운영 관리자는 해야 할 일을 알지만, 로봇에게 직접 전달할 수는 없습니다. 그들은 로봇 공학 엔지니어에게 설명해야 하며, 엔지니어는 이를 해석하고(미묘한 차이와 맥락의 불가피한 손실과 함께), 코드로 번역하고(불가피한 가정과 단순화와 함께), 반복합니다(요청된 것과 전달된 것 사이의 불가피한 불일치와 함께). 이러한 '전화 게임'은 수개월의 시간, 수만 달러의 비용, 그리고 의도와 구현 사이의 지속적인 격차를 초래합니다.

작업 캡처 모델에서는 운영 관리자가 이미 알고 있는 방식으로 작업을 전달합니다. 즉, 카메라 앞에서 작업을 수행하고 Field Deployment Engineer에게 과정을 설명하는 방식입니다. Workflow Builder는 캡처된 작업을 로봇 행동으로 번역하는 것을 처리합니다. 피드백 루프는 긴밀합니다. 결과 워크플로우가 의도와 일치하지 않으면 관리자가 이를 알리고, 시스템은 몇 주가 아닌 몇 분 안에 워크플로우를 재생성합니다.

이는 단순히 더 빠른 것만이 아닙니다. 이는 자동화 프로세스에 참여하는 사람들의 질적인 변화입니다. 전 세계 로봇 공학 엔지니어의 수는 수만 명에 이릅니다. 제조 작업을 시연할 수 있는 운영 관리자, 교대조 감독자 및 도메인 전문가의 전 세계 인구는 수백만 명에 이릅니다. 작업 캡처는 로봇을 작업에 투입할 수 있는 사람들의 풀을 두 자릿수 규모로 확장합니다.

반복 루프

배포는 일회성 프로세스가 아니며, 그렇게 취급하는 것은 오해를 불러일으킬 수 있습니다. 가장 효과적인 배포는 빠른 정제 주기를 통해 생산 준비 품질에 수렴하는 반복 루프를 사용합니다.

이 프로세스는 높은 수준에서 작업의 초기 캡처로 시작됩니다. 플랫폼은 초안 워크플로우를 생성하고 시뮬레이션에서 실행합니다. 운영 관리자는 시뮬레이션 결과를 검토하고, 로봇의 행동과 원하는 결과 사이의 불일치를 식별하며, 누락된 세부 정보(두 번째 녹화, 수정, 팀이 당연하게 여기는 제약 조건)를 제공합니다. 플랫폼은 워크플로우를 재생성하고, 이 주기는 반복됩니다.

각 반복은 시뮬레이션에서 몇 분이 소요되며, 공장 현장에서의 몇 시간 또는 며칠과 비교됩니다. 대부분의 워크플로우는 3~5회 반복 만에 생산 준비 품질에 도달하며, 이 과정은 단 하루 만에 완료될 수 있습니다. 이를 전통적인 현장 개발이 일반적으로 수개월에 걸쳐 요구하는 50~100회 반복 주기와 비교하면, 가속화가 명확합니다.

솔직한 한계

작업 캡처는 강력한 접근 방식이지만, 마법은 아니며 현재의 한계를 명확히 이해해야 합니다.

바늘에 실 꿰기, 매듭 묶기, 매우 작거나 매우 유연한 부품 조작과 같은 고도의 정교한 작업은 현재 시스템이 처리할 수 있는 한계에 남아 있습니다. 인간 손의 정교함과 휴머노이드 그리퍼 능력 사이의 격차는 실제 존재하지만, 하드웨어 세대가 거듭될수록 좁혀지고 있습니다.

새로운 환경은 익숙한 환경보다 더 많은 시간이 걸립니다. 완전히 새로운 유형의 시설에서의 첫 배포는 유사한 시설에서의 후속 배포보다 더 많은 반복을 필요로 합니다. 시뮬레이션 모델이 활용할 수 있는 사전 데이터가 적기 때문입니다.

조건이 예측 불가능하게 변하는 동적 환경(야외 건설 현장, 농경지, 비정형 소매 공간)은 통제된 공장 환경보다 정확하게 시뮬레이션하기 어렵고, 결과 정책은 더 많은 실제 미세 조정을 필요로 합니다.

이러한 한계는 오늘날에도 실제합니다. 또한 데이터 플라이휠이 시뮬레이션 충실도를 향상시키고 강화 학습 알고리즘이 점점 더 광범위한 조건을 접하고 적응함에 따라 모든 배포와 함께 이러한 한계는 줄어들고 있습니다. 궤적은 명확합니다. 오늘 어려운 것은 내일 일상이 될 것입니다.

← 블로그로 돌아가기