シム・トゥ・リアル:AIシミュレーションはいかに数ヶ月にわたるロボット開発を置き換えるか
実際の工場に展開する前にヒューマノイドロボットをシミュレーションで訓練することで、統合期間を数ヶ月から数日に短縮できます。シム・トゥ・リアル転送の仕組みと、それが製造業者にとってなぜ重要なのかをご紹介します。
Motion1 Inc. ·

従来のやり方:工場現場での試行錯誤
産業用ロボットが存在して以来、その導入は常に同じ苦痛を伴うパターンを辿ってきました。エンジニアはロボットを設置し、制御コードを記述し、工場現場でテストし、期待通りに動作しないことを発見し、数週間、時には数ヶ月にわたって反復作業を行います。ロボットが許容できる性能を達成するまで、この作業が続きます。その後、このサイクルは次のタスク、次の製品バリアント、次の生産ラインに対して繰り返されます。
現実世界で機能する必要がある知能は、現在「Physical AI」と呼ばれています。それは知覚し、決定し、動き、そしてあらゆる間違いに対して物理的な代償を支払います。その代償こそが、学習がまず別の場所で行われる必要がある理由です。
このプロセスは、現実世界でのテストが本質的に遅いため、時間がかかります。工場現場では、ロボットが物理的にタスクを実行し、エンジニアが結果を観察し、故障を診断し、コードを修正し、再度試行する必要があるため、各反復サイクルに数分から数時間かかります。ロボットが確実に動作するようになるまでに、1回の導入で50回から100回のこのようなサイクルが必要になる場合があります。1回の導入あたり5万ユーロから15万ユーロの費用がかかり、高価なエンジニアリング人材が数ヶ月間拘束されるため、経済的な負担は非常に大きいです。
Sim-to-real転送、つまり現実環境の仮想シミュレーションでロボットを訓練し、訓練されたポリシーを物理ハードウェアに展開することは、このタイムラインを数ヶ月から数日に短縮することを約束します。このアイデアは新しいものではありませんが、AI、コンピュータービジョン、物理シミュレーションにおける最近の進歩により、学術的な好奇心から実用的な導入ツールへと進化しました。その仕組み、優れている点、そしてまだ限界がある点を理解することは、ヒューマノイドオートメーションを評価するあらゆるメーカーにとって不可欠です。
Sim-to-Real転送の仕組み
Sim-to-realパイプラインは、現実環境のキャプチャから始まります。工場の写真や動画(一般的なスマートフォンや作業員が装着する視点カメラで撮影されたもの)は、実際の施設の形状、照明、物理特性を再現する3次元シミュレーションに処理されます。これは一般的な倉庫や様式化された工場現場ではありません。それは、お客様の設備、製品、レイアウトを備えた、お客様固有の生産環境のデジタルツインです。
シミュレーション環境が構築されると、ヒューマノイドの訓練プロセスが開始されます。タスクは、すでにそれを実行しているオペレーターからキャプチャされます。例えば、「コンベアの端から製品をピックアップし、目に見える欠陥がないか検査し、6個入りの箱に梱包する」といったものです。AIシステムは、そのタスクを個別の操作ステップに分解し、シミュレーション内で各ステップを実行するようにヒューマノイドの訓練を開始します。
訓練は、現実世界では不可能な速度で行われます。シミュレーションでは、ヒューマノイドは1時間に数千回タスクを試行し、それぞれの失敗から学び、アプローチを洗練させることができます。現実では、各試行に数分かかり、設備や製品を損傷するリスクがあります。シミュレーションは、数ヶ月にわたる現実世界の学習を数時間の計算に圧縮し、その費用もごく一部で済みます。これは、GPU計算時間と工場現場の高給なエンジニアリング人材との比較です。
訓練されたポリシーは、実際のハードウェアに触れる前に精度目標に対して検証されます。通常、そのしきい値はシミュレーションでのタスク完了率90%以上です。この目標が達成されて初めて、ポリシーは物理ロボットに転送され、そこで短期間の現実世界での微調整が行われ、シミュレーションと現実の間に残るギャップが解消されます。

Sim-to-Realギャップの解消
シミュレーションベースのロボット工学に対する歴史的な批判は、Sim-to-realギャップでした。これは、シミュレーションでは完璧に機能するポリシーが、現実世界ではしばしば失敗するという観察です。シミュレーションのグラフィックは現実と完全に一致しません。シミュレートされた物理は近似です。実際のセンサーは、シミュレーションでは捉えられないノイズと遅延を導入します。そして現実世界には、気流、振動、温度変化、表面の不規則性など、シミュレーションが従来無視してきた影響が含まれています。
現代のアプローチは、過去2年間で大きく成熟したいくつかの技術を通じてこれらのギャップに対処しています。
ドメインランダム化は、おそらく最も重要です。訓練中、シミュレーションはテクスチャ、照明条件、オブジェクトの位置、表面摩擦、その他の物理パラメータをランダムに変化させます。ロボットは、一つの完璧な環境でタスクを実行することを学ぶのではなく、バリエーションに対応することを学びます。ロボットが現実世界に遭遇したとき(ロボットの視点から見れば、それはランダム化された訓練環境の単なる別のバリアントです)、失敗するのではなく、一般化して対応します。
プログレッシブ転送は、追加の安全層を提供します。シミュレーションから完全な生産への単一のジャンプではなく、ポリシーは段階的に転送されます。高忠実度シミュレーション、次に簡素化された現実世界のテスト環境、次に限定的な生産実行、そして最終的に完全な展開です。各段階は、次の段階が始まる前にパフォーマンスを検証し、修正費用が安い段階で問題を早期に発見します。
継続学習は、シミュレーションが時間とともに改善されることを保証します。展開されると、ロボットは現実世界のデータを収集し、それがシミュレーションエンジンにフィードバックされます。デジタルツインは、稼働するたびに精度が向上し、更新されたシミュレーションで訓練された将来のポリシーは、現実世界での微調整が少なくて済みます。これにより好循環が生まれます。より多くの展開がより良いシミュレーションにつながり、それがより迅速で信頼性の高い将来の展開につながります。
Sim-to-Realが優れている点
Sim-to-realは、特定の特性を共有する製造タスクに特に効果的です。一貫した製品形状を持つ反復タスク(梱包、パレタイジング、仕分け、材料移送など)は、シミュレーションが関連オブジェクトを高忠実度でモデル化でき、タスク構造が強化学習が迅速に収束するのに十分なほど予測可能であるため、理想的です。
管理された環境でのタスクは、管理されていない環境でのタスクよりも優れたパフォーマンスを発揮します。一貫した照明、安定した温度、予測可能な設備レイアウトを備えた工場現場は、屋外の建設現場や農地よりもはるかに正確にシミュレートするのが容易です。
明確な成功基準を持つタスク(箱が密閉されている、パレットが積み重ねられている、製品が検査されているなど)は、主観的または曖昧な結果を持つタスクよりも速く訓練されます。これは、強化学習アルゴリズムが最適化するための明確に定義された報酬信号を必要とするためです。
複合的な優位性
すべてのSim-to-real展開は、次の展開を改善するデータを生成します。シミュレーションモデルは、現実世界のフィードバックを取り入れることで、より正確になります。タスク分解アルゴリズムは、過去の成功と失敗から学習します。訓練データライブラリが成長するにつれて、ポリシー訓練はより速く収束します。
これにより、ヒューマノイドロボット工学において最も戦略的に重要なダイナミクスの一つであるデータフライホイールが生まれます。Sim-to-real展開を最も早く開始した企業やメーカーは、最も多くのデータを蓄積し、最も正確なシミュレーションを構築し、最速の展開時間を達成します。後発企業は複合的な不利に直面します。データが不足しているだけでなく、数ヶ月から数年にわたって反復ごとに展開インフラを改善してきた組織と競争することになるためです。
メーカーにとって、その実用的な意味合いは明確です。お客様の施設での最初のSim-to-real展開は、最も時間がかかり、最も複雑なものになるでしょう。2回目は大幅に速くなります。5回目または6回目の展開までには、そのプロセスは日常的なものになるでしょう。問題は、Sim-to-realがヒューマノイド展開の標準的なアプローチになるかどうかではありません。経済的な側面から見て、それは避けられないことです。問題は、お客様の施設が今すぐデータを生成し、能力を構築するか、それとも後でゼロから始めるかです。