KDDI総合研究所、ロボットAI実機評価で1位に 複数モデルと動作予測を組み合わせ

 KDDI総合研究所は10月5日、ロボットAIの国際的な実機ベンチマーク「RoboChallenge」の評価部門「Table 30 V2」において、同日時点でリーダーボードの1位になったと発表した。

 「Table 30 V2」は、4種類の実機ロボットと30種類の実作業タスクを用いて、AIモデルの性能を実環境で評価する部門である。両腕を連携させる作業や、柔らかい物を扱う操作など、難度の高い「手作業」の精度が問われる。多数の企業が実機テストを継続しており、成功率と順位は日々更新されている。

 今回の成果は、画像と言語による指示を理解してロボットの動作を生成する「VLA(Vision-Language-Action)」と呼ばれるAIモデルを、複数組み合わせたことがポイントとなる。KDDI総合研究所は、物をつかむ際の力加減や持ち替えのタイミングなど、タスクの成否に大きく影響する動作知見を各モデルから抽出し、強みを統合することで、多様な作業に対応する高性能モデルを構築したという。

 さらに、複数のVLAモデルが生成した動作プランについて、物理法則や因果関係を学習したAI「世界モデル」を使い、その動作を実行した場合にタスクが成功するかを事前に予測する仕組みを導入した。予測結果をもとに成功確率の高い動作を選び、タスクや状況に応じて動作速度も動的に切り替えることで、実機での安定した自律動作につなげたとKDDI総合研究所は説明している。

複数のVLAモデルの知識を統合し、世界モデルで動作結果を予測して行動を選ぶ仕組み

 同社は、経済産業省とNEDOによる生成AI開発支援事業「GENIAC」で採択された「小売物流業等の現場業務を代替するロボット基盤モデルの研究開発」に本技術を活用する方針。小売、物流、製造、設備保守などの分野で、多様な作業を一つのシステムで担うフィジカルAIの実用化を目指す段階にあるとしている。

日本のものづくりはAI時代に何を担う? NVIDIAが示した「フィジカルAI」の可能性

NVIDIAの平野一将氏がGMO大会議で語った、フィジカルAIと日本のものづくりの可能性。ロボットの専門性を育てる「現場のデータ…

関連記事