AIロボットコミュニティ「AI Robot Japan」、日本ロボット学会オープンフォーラムで「社会実装に向けたPhysical AIの現在と今後の展開」を開催 [PR] #ai_robot_japan
AIロボットの有志コミュニティ「AI Robot Japan」が、2026年9月1日(火)〜4日(金)の日程で金沢大学角間キャンパスで開催された第44回日本ロボット学会 学術講演会(RSJ2026)の「オープンフォーラム」でパネルディスカッションを開催しました。「オープンフォーラム(OF)」とは学術講演会の一環として開催される参加無料・参加資格なしの一般公開企画のことです。学会の会員資格を問わず講演・聴講が可能な、市民に開かれた企画です。ロボット学会では主に初日に開催されます。
「AI Robot Japan」が企画したOFは、パネルディスカッション「社会実装に向けたPhysical AIの現在と今後の展開」。藤本敬介氏(ABEJA)、南里勇気氏(Algomatic Dynamics)の二人がオーガナイザーとなり、東京大学の河原塚健人氏による講演のあと、「産学官パネルディスカッション」として河原塚氏、小倉崇氏(アイリスロボティクス・シンクロボ)、五百籏頭アレン氏(経済産業省)の3氏による、フィジカルAIの課題をめぐる議論が行われました。初日の夕方開催でしたが、イベントには多くの人が現地で参加しました。
社会実装に向けたフィジカルAIの現在と今後の展開

まず東京大学AIセンター(EVARL)の河原塚健人氏が、「社会実装に向けたフィジカルAIの現在と今後の展開」と題した講演を行いました。河原塚氏は筋骨格ヒューマノイドの研究で知られる研究者です。日本ロボット学会のオーガナイズドセッション「基盤モデルの実ロボット応用」(2023〜2025年、共同オーガナイザーは松嶋達也氏)を継続的に主催しているほか、国際論文誌Advanced Roboticsの特集号「Real-World Robot Applications of Foundation Models」(Lead Editor:河原塚氏、松嶋氏)の編集も務めています。著書『基盤モデルとロボットの融合』(講談社、松嶋達也氏との共著)は第5版に達しており、技術評論社『Data-centric AI入門』でも「第5章 ロボットデータ」を分担執筆しています。
「SO-101で模倣学習をすることがフィジカルAIか」
河原塚氏は冒頭、近年の低価格ロボットアーム「SO-101」の流行に触れ、「SO-101」を使った「ピック&プレイス」のデモンストレーションが「フィジカルAI」という言葉とほぼ同義に扱われがちな現状に疑問を呈しました。「SO-101」はフィジカルAIを始める入口としては良いものの、そこから先に進むことが重要だという認識を示しました。
そして「フィジカルAI」技術を大きく以下の4つのアプローチに分類しました。
模倣学習(Imitation Learning)---- 人の動きの真似をする
強化学習(Reinforcement Learning)---- シミュレーション上の大量の試行から動作を自律獲得する
基盤モデルのロボット応用 ---- LLMやVLMをロボットに活用する
ロボット基盤モデル ---- ロボット専用の基盤モデルを作る(模倣学習の大規模化)
以下、それぞれについて講演内容に沿って解説します。

模倣学習:データ収集の負荷と汎化性の欠如
模倣学習は、エキスパートから得られた状態・行動の時系列データ (s, a) を真似するように方策 a = π(s) を学習する手法です。得られたデータから状態 s を入力として行動 a を出力するニューラルネットワークを学習するだけというシンプルな構成であり、手法間の差異は主にネットワークの組み方(RNN/GRU/LSTM/MTRNNなどのRNN系、ACT=Action Chunking with Transformersに代表されるTransformer系、Diffusion Policyに代表されるDiffusion系)に集約されます。
紹介事例として、双腕ロボットによる料理・裁縫的なタスクの遠隔操作収集を基盤とするALOHA([T. Z. Zhao+, RSS2023])、ヒューマノイド全身を対象とした模倣学習([Y. Matsuura+, IROS2023])、腹腔鏡下手術トレーニング課題であるFundamentals of Laparoscopic Surgeryへの適用(河原塚氏自身の研究、[K. Kawaharazuka+, ICRA2024])が挙げられました。
ALOHAを例に取ると、ロボットの行動は指令関節角度、状態はカメラ画像と関節角度、データ収集は人間がALOHAをひたすら操作して対象物体や環境を多少変化させながら数十〜数百回分を収集する、という構成になります。
河原塚氏は、この分野の本質的な課題として次の4点を挙げました。
第一に、データ収集が非常に辛く、大量のデータ収集が人間に大きな負担を強いること。
第二に、単一タスクしかできず、異なる動作を同時に学習することが難しいこと。
第三に、環境条件の変化に弱く、照明条件や周囲環境がわずかに異なるだけで動作しなくなること。
第四に、あくまでデータ駆動であるため人間の熟練度を超えることがなく、動きが遅くオンラインで進化しないことです。
河原塚氏は失敗してもやり直して成功する様子を見せる模倣学習のデモも、「実際にはデータ収集時の動作をほぼそのまま再生しているだけに見えることが多い」と指摘し、「単純にデータを再生すればいいのではないか」という問いを投げかけ、模倣学習の望みとは何かを改めて考える必要があると述べました。「単にデータを再生するだけなら、模倣学習そのものにどのような価値があるのか?」という問題提起です。
強化学習:脚の動作は「ほぼ何でもできる」段階に
強化学習は、状態 s に対する行動 a の方策 a = π(s) を割引報酬和から獲得する枠組みです。価値関数を更新していく価値ベースのアルゴリズム(Q学習、SARSA等)と、報酬の期待値を最大化するように方策を直接最適化する方策ベースのアルゴリズム(REINFORCE、A3C、TRPO、PPO等)があり、行動空間が連続あるいは多変数の場合は方策ベースが基本で、実務上ロボットの強化学習ではほぼPPO(Proximal Policy Optimization)のみが用いられているとのことです。
学習はMuJoCo・Isaac Gym・Isaac Simなどのシミュレータ上で行い、得られたポリシー(アクター部分)を実機にデプロイするのが基本的な流れです。
四脚ロボットの歩行制御を例とすると、行動は関節角度(PID制御のリファレンス)、状態は並進速度・角速度、重力ベクトル、指令速度・角速度、現在の関節位置・速度など、報酬は指令速度への追従度、Z方向速度やXY方向角速度に対するペナルティ、関節速度・加速度に対するペナルティ、水平姿勢からのズレに対するペナルティ、衝突に対するペナルティなど多岐にわたる項目を細かく設計する必要があるといいます。
紹介事例として、瓦礫の上を移動する四脚ロボット([F. Jegenlten+, Science Robotics 2024])、1.9mの壁を飛び越える四脚ロボット(Unitree Robotics, 2024)、はしごを登るANYmal(ANYmal Ladder Climbing, [D. Vogel, R. Baines+, IROS2025])が示され、四脚ロボットの運動性能は近年著しく向上していると評価されました。
河原塚氏自身が3か月間滞在した研究室での経験として、ロボットが組み上がってから2年間、雪道を含むあらゆる路面で一度も転倒していないという事例を紹介し、脚の運動制御に関しては「報酬設計さえできればロバストな動作がほぼ何でも実現できる」段階に達していると評価しました。
一方で、強化学習の課題として、脚は比較的動かせば歩けるため学習しやすいのに対し、腕は繊細な物体把持と操作が必要で性質が大きく異なり、うまく使えていないこと、柔軟物体や液体、関節あり物体などモデリングが難しい対象は確かに扱えるようにはなってきたもののSim-to-Realギャップが大きく実機への転移が難しいこと、リアルな画像の再現が困難なためRGB情報が使いにくいこと、そして歩行やピック・アンド・プレースのような単一タスクの性能向上で終わりがちであり、多様なタスクの同時学習が難しいことの3つが挙げられました。
また、模倣学習に比べて強化学習に取り組む研究者・実践者自体が少ない状況にも言及がありました。
基盤モデルのロボット応用:プリミティブの組み合わせという限界
三つ目の方向として、LLMやVLMなど既存の基盤モデルをロボットに利用する研究があります。初期のアプローチでは、ユーザーから与えられた言語指示をLLMが解釈し、あらかじめ用意したロボットのプリミティブをどの順序で実行するかを計画する方式が中心でした。
LLM・VLMをロボットの行動計画に応用するアプローチとして、SayCan([M. Ahn+, CoRL2022])やCode as Policies([J. Liang+, ICRA2023])が紹介されました。例えば「コーラをこぼしたので片付けて、掃除するものを持ってきてほしい」といったユーザー入力を与え、ロボットが必要な行動を組み合わせて実行するのです。
これは、ユーザーの言語入力に対し、あらかじめ用意した言語と動作が紐付いた「プリミティブ」をどの順序・引数で実行するかをLLMに判断させる仕組みです。近年はLLMがプログラム自体を自動生成する方向や、画像生成モデルなどを用いて周囲環境のバリエーションを増やしデータ拡張に活用する方向にも展開しているとのことです。
このアプローチは、Low-level Perception(環境や物体・現在状態を言語に変換する低レイヤ認識)、High-level Perception(マップ生成や報酬生成等の高レイヤ認識)、High-level Planning(抽象的なレイヤでの動作計画)、Low-level Planning(手先位置や関節を扱う低レイヤ制御)、Data Augmentation(認識と制御を接続する学習の際に活用)という古典的な階層制御の各要素をLLM・VLMに置き換えたシステムとして整理されました。
このアプローチの課題として、所詮はプリミティブの組み合わせであり実行できることの幅が限られ、むしろプリミティブ側の設計の比重が大きいこと、動きの微妙なニュアンスを言語化することが難しく連続的な動作と離散的な言語の性質の違いが障壁になること、そして画像を言語に変換する過程で認識情報が大きく失われることの3点が挙げられました。
河原塚氏は「2022年前後に活発化したこの方向性の研究は、2024年ごろまでにアカデミアでは一巡した印象がある」と述べました。
ロボット基盤モデル(VLA):データ不足という根本課題
こうした問題を背景として登場しているのがロボット基盤モデルです。ロボット基盤モデルは、画像や言語からロボットのアクションを直接出力するモデルであり、Vision-Language-Action(VLA)モデルとも呼ばれます。
これまでVision-Models・Language-Modelsによる個別のモダリティ理解とAction-Modelsによる行動制御が分断されていたため、視覚・言語理解と行動が一体的に扱いにくいという問題があり、これを解消して視覚・言語理解・運動制御を統合的に学習しようというのが本来の狙いです(VLA Survey, [R. Sapkota, arXiv 2025])。紹介事例として、Physical Intelligence社のπ0(洗濯物たたみのデモ、2024年)、Figure社のHelix 02(家庭内タスクのデモ、2026年)が挙げられました。
汎用的なロボット基盤モデルが実現すれば、カスタムデータセットの必要性を最小化ないしゼロに近づけ、ロボット導入の障壁をゼロにできるという期待があるとのことです。
もっとも、河原塚氏は「VLA」という呼称が使われていても、実質的に言語情報がほとんど活用されていない事例が多く、「実態としては模倣学習の延長にとどまっているケースが大半」と指摘しました。ICRAなどで発表される多くのデモも、単一タスク(例えば衣類をたたむなど)に対して大量のデータを取得し、模倣学習に強化学習による微調整を加えたものにすぎないとのことでした。
根本的な課題として、まずLLMやVLMほどの規模のデータを集められるはずがなく、この対応として人間の行動動画データセットの活用(LAPA:Latent Action Pretraining from Videos 等)や世界モデル・動画生成モデルの活用が研究されていること。次に、環境や身体の変化に敏感で、オンライン学習によって逐次的に変化に対応する仕組み(VLA-RL等)や、ロボット自身が能動的にデータを収集し、その経験を自らの学習に取り込む仕組みが重要になるのではないかと指摘しました。ここが今後の重要な流れになると思われます。
さらに、現状ほとんどのVLAは画像・言語・アクションのモダリティしか扱えず、力覚・接触覚・聴覚・3次元表現などのモダリティを十分扱えてないことを指摘しました。しかし、これらを追加すれば、現状でさえそもそも困難なデータ収集が、さらに難しくなるという問題もあります。
フィジカルAIの現状と、足りていない「適応性・汎化性・伝達性」
河原塚氏はまとめとして、模倣学習は単一のタスク学習であれば比較的何でもできる、強化学習は脚の動きだけであれば比較的何でもできる、基盤モデルのロボット応用は色々とできるが限界がある、ロボット基盤モデルは正直まだ使えるレベルに達していない、という4象限の現状評価を示しました。

Unitree「G1」やBoston Dynamicsの「Atlas」に代表される強化学習・模倣学習の組み合わせによって、単純な運動性能はすでに人間を超えているとする一方、Figure社の「Helix 02」や、Physical Intelligence社の「π*0.6」に代表されるロボット基盤モデルは、言語情報こそうまく使えていないものの、定まった単一タスクの実行であれば高い性能を示していると評価しました。

その一方で、単一タスク・単純な運動性能はOKだとしても、タスクが変わったら、環境が変わったら、ロボットが変わったらどうなるかという観点で見ると、ロボットの「適応性」(環境の変化に適応できるか)、「汎化性」(様々なタスクに汎化できるか)、「伝達性」(他の身体に技術を伝達できるか)が明確に不足していると総括しました。

河原塚氏はこれを自身の適当な定義と断りつつ、「この3点に正面から向き合わなければ、単純作業の実行だけであれば、実は20年前とほとんど変わらない状況を繰り返しているだけになりかねない」と警鐘を鳴らしました。
フィジカルAIの今後に向けて
また河原塚氏は、「SO-101しかやっていない人向け」、「産業界向け」、「アカデミア向け」の3つの層に向けたメッセージを提示しました。
SO-101の先に進むために
「SO-101しかやっていない人」向けには、フィジカルAI技術はSO-101の模倣学習だけではないとして、模倣学習では一度自分でゼロからプログラムを書いてみること、もう少し大きなアーム(reBot Armなど)を使ってみること、強化学習ではUnitree Go2を購入してすぐに試してみること、基盤モデルのロボット応用ではプリミティブをきちんと作ってLLMに接続してみることを勧めました。
こうした自作・改造を後押しする背景として、河原塚氏が強調したのがオープンソース・オープンハードウェアの活用です。
河原塚氏の研究室では、四脚ロボットとして世界初のオープンソース公開を行った実績があり、ボストンダイナミクスのSpotと同等サイズのロボットをソフトウェア・ハードウェア・学習環境も含めて全て公開し、200万円程度の予算があれば誰でも同等機を製作できるようにしています。講演では、屋外の石畳や不整地を歩行する四脚型のReal-World Deploymentの映像、木材ブロックの障害物を乗り越える二足型のIndoor Experiment([K. Kawaharazuka+, Humanoids2025])の映像が紹介されました。
さらに、遠隔操作によるだるま落とし課題(Teleoperation Experiment、独自開発の遠隔操作システムMEVIONを使用、[K. Kawaharazuka+, RA-P 2026])、オープンハードウェアのヒューマノイドMEVITAの脚部をリング状に改造し二足歩行機構から双腕機構へ転用する研究(Change in Hardware、[A. Iwata, K. Kawaharazuka+, Under Review])、実機を吊り下げてのSim-to-Real検証実験([A. Iwata, K. Kawaharazuka+, IROS2026])といった、身体構造そのものを作り替えながら新しい運動能力を引き出す一連の取り組みが紹介されました。
産業界には「本当にその技術が必要なのか」を問う
「産業界向け」には、そのフィジカルAI技術は本当に必要か、自らフィジカルAI技術の適用範囲を狭めすぎていないか、あるいは広げすぎていないか、無理にロボット基盤モデル・VLAを使おうとしていないかを問い直すべきだと語りました。技術を導入する前に、その必要性を見極めることです。
模倣学習と強化学習だけでも相当なことができるようになっており、まずはオープンソース・オープンハードウェアを活用して手を動かしてみることをすすめました。
アカデミアには「生きるための研究」と「死ぬための研究」
「アカデミア向け」には、最新手法をコードごと持ってきて生成AIに多少の改良を加えさせ、簡単な実機実験を行うだけで「ICRA」や「IROS」といった国際会議に論文が通ってしまう時代になっており、論文投稿数がうなぎ登りである一方、「論文の価値がただ下がりになっている」と指摘しました。
河原塚氏はこれを「生きるための研究」(生き残るために続けるべき研究)と「死ぬための研究」(それをやり切れたら死んでもいいと思えるような研究)という対比で表現し、「生きるための研究は当然続けるべきとしつつ、同時に死ぬための研究にも取り組むべきだ」と述べました。
ムーンショット型研究開発事業:MIRAI Humanoidプロジェクト
この「死ぬための研究」の一つとして紹介されたのが、河原塚氏が採択されたムーンショット型研究開発事業の目標3の統合研究課題「多層的な教示と継承を通じて成長する汎用自律ヒューマノイド」(プロジェクト名:MIRAI Humanoid)です。
まず、目指す将来像として4コマの絵で構成されるシナリオが示されました。アルバイト初日、店長が今日の仕事をロボットAにたたきこみ、口頭だけでは難しい部分は見よう見まねや手取り足取りで仕事を教えていく。1週間もすれば簡単な口頭の指示だけでスムーズに仕事をこなせるようになり、徐々に店の仕事のほとんどをこなせるようになる。新人アルバイトが仲間に加わると、ロボットAが新人2人に仕事を説明し、店長からの教えと自らのコツを合わせて技術を後輩に伝えていく。そして店長もかなり歳を取り、次はロボットAが店長になる番だ、というストーリーです。

プロジェクトの概要としては、人間が他者に物事を教えられるようになって初めて本当に理解したと言えるように、環境・タスク・身体が多様に変化する状況であってもロボットが「物事の本質的な理解」を持ち、自身の経験や技能を他者に伝えられるようになる必要があるという問題意識のもと、手取り足取り―見よう見まね―言語指示に見る多層的な教示と、人からロボット・ロボットからロボット・ロボットから人へという多層的な継承を通じて、逐次的に成長する汎用自律ヒューマノイドを開発し、その適応性・汎用性・伝達性を評価するという構想が説明されました。

「言語だけでは教えられない」という問題
質疑応答では、いくつかの興味深いやり取りがありました。まず、ロボットが技術を他のロボットへ「言語だけで」伝達することの難しさについて質問が出ましたが、河原塚氏は「言語のみでの伝達には限界がある」としつつ、手取り足取りの実演や見本提示など複数のモダリティを組み合わせることが今後重要になると回答しました。
ロボット基盤モデルの学習方式に関する質問に対しては、基本的にはネクストトークン予測をベースとしつつ、手法は徐々に多様化しつつあるとされました。
また、個人や小規模な研究リソースでの参入領域についての質問には、まず強化学習から着手することを勧め、既存のフレームワークをそのまま使うのではなく、コマンドラインレベルから中身を理解することの重要性を強調しました。海外では四脚ロボットの強化学習に取り組む個人・小規模チームが一定数存在する一方、日本ではほとんど見られない状況にも言及がありました。
世界モデルのような予測ベースのアプローチをVLAに組み込む方向に関しては肯定的な見方を示しました。元来、アクション出力のみに特化していたVLAに対し、時系列の次状態予測(=World Model的な要素)を組み込む研究がすでに進んでおり、両者は今後統合されていく方向にあるとの見解が示されました。
また、認知発達研究の知見(自由エネルギー原理など)を能動的データ収集に応用する可能性についても議論されましたが、河原塚氏はこの種の研究がずっと小規模な「トイプロブレム」に終始しており、その域を出て実用ロボットに組み込まれた例が少ないことを課題として挙げ、「ムーンショットプロジェクトにおける今後の取り組みの一つとしたい」と述べました。
言語を持たないロボットが基盤モデルを持つ必要性についての質問には、言語は強力な情報伝達手段である一方、タスク遂行そのものに言語が必須というわけではなく、見本提示や実演ベースの教示でも十分に機能しうるとの回答がありました。
また、基盤モデルの開発が結局は計算資源とデータ量の「資金力の勝負」になるのではという質問には、「現状の延長線上ではその傾向は否定できない」としつつ、「アカデミアとしては推論手法やデータ収集方法、小規模データでの効率化、シミュレータベースのデータセットといった方向で差別化を図る必要がある」との見解が示されました。
河原塚氏からは一貫して、現在のフィジカルAIを過小評価・過大評価するのではなく、すでにできるようになったことと、まだできないことを切り分けるという視点で語られました。
AIロボティクス産業政策の現在地

続いて、経済産業省でAIロボティクスの産業政策を担当する五百籏頭(いおきべ)アレン氏が登壇し、政策の視点から講演を行いました。五百籏頭氏は教育業界での起業、戦略コンサルを経て、現在は経済産業省 AI産業戦略課に所属しているとのことです。
経済産業省内の体制強化:ソフトウェアとハードウェアの一体運用
五百籏頭氏はまず、経済産業省内の体制変化について説明しました。2026年7〜8月にかけて、それまで別々の組織であったAI(ソフトウェア)担当チームとロボティクス(ハードウェア)担当チームが統合され、「AI産業戦略課」としてソフトウェアとハードウェアを一体的に扱う体制が構築されたとのことです。同時にチームの人員も大幅に増強されており、AIロボティクス領域の政策検討に本格的に取り組む姿勢が示されました。
五百籏頭氏自身は、その中でもサプライチェーン(供給側)の政策支援のあり方を検討するチームのリーダーを務めており、日々サプライチェーンを担う企業や現場との議論、現場訪問を重ねているとのことです。
五百籏頭氏は、日本のサプライチェーンを担う現場では、加工機の最適化やネジの数の調整、マイクロオーダーでの微調整といった、一見すると細部に見える改善や工夫の積み重ねによって、世界に通用する製品やロボットが生み出されていることを実感していると述べました。
AIロボティクスは製造業の「最後のフロンティア」
その上で、AIロボティクスという分野を「製造業の最後のフロンティア」と位置づけました。
AIロボティクスが普及した後のものづくりは、AIロボットが担っていくことになり、AIロボットが作業しやすいような環境設計・工程設計・量産設計が行われるようになるため、新しいものづくりは基本的にAIロボット前提のものへと移行していくとの見立てです。
こうした見通しから、AIロボティクスは日本の製造業にとって最も重要かつ最後の大きな挑戦であるとし、経済産業省としてもAIロボティクスおよびフィジカル領域を、現政権の重点政策の一つとして位置づけていると説明しました。
3つの政策支援:需要側支援・供給側支援・中核拠点整備
五百籏頭氏は、直近の予算要求も踏まえた具体的な政策支援のあり方として、3つの柱を示しました。
1. 需要側支援(導入支援)
現在のAIロボティクス業界における最大の課題は、需要側(導入する市場側)がまだ十分に立ち上がっていない点だとしました。現場にロボットが導入されなければ実績が得られず、コストも下がらず、量産もできないため供給側も立ち上がらない、その結果としてさらに導入が進まないという悪循環が生じていると指摘しました。
この悪循環を断ち切るため、まずは民間企業が一定以上のロボットを導入する際の購入補助金を提供し、ROI(投資対効果)を成立させることで実際の現場導入を加速させる方針が示されました。
これに加えて、民間だけでなく政府自らが調達者となる「Anchor Tenancy」としての需要創出も進めるとのことです。具体例として、火災など災害対応の現場で使用される遠隔操作ロボットや、防衛・災害対応分野での公共調達が挙げられました。
この需要側支援の狙いの根底には、フィジカルAI企業の成長モデルに関する仮説があると説明されました。すなわち、現場にフィジカルAI(AIロボット)を導入し、現場からのフィードバックやデータを還流させることでモデルとロボットの性能を改善し、それによってさらに現場への導入が進む、という「データフライホイール」の好循環を生み出すことが目標とのことでした。
2. 供給側支援
需要側の喚起と並行して、供給側の支援も進めます。対象は、AIロボットそのものを開発・製造する企業だけでなく、EMS(電子機器受託製造サービス)的にロボットを運用する事業者、設計・製造の両方を担う事業者、さらにはそれらを支えるキーコンポーネントを供給する事業者にも及びます。
具体的には、アクチュエーター、モーター、減速機、センサー、バッテリー、半導体といった部品・コンポーネントの供給企業への後押しが挙げられました。コンポーネントの川上から製品の川下まで一貫して供給支援を行うことで、AIロボット産業側の基盤を強化する方針です。
3. センターオブエクセレンス(中核拠点)の整備
需要側と供給側を橋渡しする施策として、「センターオブエクセレンス」と呼ばれるオンサイトの中核拠点の整備が挙げられました。
河原塚氏の講演内容にも触れる形で、AIロボット開発におけるデータ収集の難しさという課題を踏まえ、各分野のクリティカルなタスクに対応したモックアップ環境を用意し、そこで危険を伴うようなケースも含めてAIロボットの実証・データ収集・評価を行える場を整備するとしています。さらに、このモックアップ環境を通じて、その後ろにいる潜在的な需要(導入検討企業)へのアクセスにもつなげていく構想であると説明されました。
五百籏頭氏は、日本のものづくり産業が高度経済成長期から現在まで日本経済を牽引してきたこと、輸出の8割以上を製造業が占めていることに触れ、AIロボティクスをものづくり産業における「最後の挑戦」として妥協なく後押ししていく方針を改めて強調しました。
市場や需要の見通しが依然として不確実性の高い領域であるとしつつも、現段階から取り組む企業や人材を支援していく考えを示し、AIロボティクス産業への参入や投資を検討している企業・個人、および現場で課題意識を持つ関係者に対しては経済産業省への連絡を呼びかけて、話をいったん締めくくりました。
産学官パネルディスカッション:社会実装に向けたフィジカルAIの現在地

後半では、河原塚健人氏(東京大学)、小倉崇氏(株式会社シンクロボ代表取締役社長)、五百籏頭アレン氏(経済産業省)の3名によるパネルディスカッションが行われ、社会実装に向けたAIロボティクスの課題と今後の方向性について議論が交わされました。

ここから加わったシンクロボの小倉氏は東京大学で博士号を取得後、トヨタ自動車・SCHAFT・Google Xでヒューマノイド開発に携わり、2019年にスマイルロボティクスを創業しました。同社は2023年にアイリスオーヤマグループに参加し、社名を変更。現在はグループのロボット開発をハードウェアからソフトウェアまで一貫して手掛けています。
世界ロボット大会の所感:中国の運動性能と物量

議論は「まずは軽めの話から」ということで、直前に中国で開催された世界ロボット大会・ロボット運動会の話題から始まりました。
河原塚氏は、ヒューマノイドによる3mジャンプなど、大会で示された運動性能の高さに言及しました。理論計算上は4m程度のジャンプが可能でも、電流・電圧や機構が実際に耐えられる範囲を考慮すると2〜3m程度に落ち着くのが通常であり、そうした制約を踏まえた上での性能実現は技術的に高く評価できるとしました。
優勝したヒューマノイド「天工(Tiangong)」の前バージョンがオープンソースで公開されている点にも触れ、アカデミアでは基本的に学生1人での研究が中心となるため同等のものを再現するのは難しいものの、「20〜30人規模のチームを組んで役割分担できれば、日本でも十分に到達可能な範囲だ」との見方を示しました。
技術的な難所としては、減速機に十分な選択肢がないこと、高電圧・大電流に対応できるモータードライバーが少なく自作が必要になること、モーター・電源・減速機を一体のパッケージとして統合する必要があること、また水冷技術についても既製品では対応しきれず独自の作り込みが必要になることを挙げました。
小倉氏は、技術デモとしての完成度の高さを評価する一方、自身がSCHAFT在籍時に取り組んでいた不整地の乗り越えや多様な環境での安定動作といった要素技術と比較すると、現時点でのアプリケーションとしては「歩く」「走る」「地形を乗り越える」の域を大きく超えるものではなく、商用面では走行の楽しさなどエンターテインメント用途にとどまっているとの印象を述べました。また、SCHAFTやGoogle X在籍当時(約10年前)と比較した際の技術的な進化点として、ハードウェアの設計・製造方法が大きく変化し以前より壊れにくくなっている点、およびアクチュエーターの高速化によって高速領域での運動性能が大きく向上している点を挙げました。
世界ロボット大会を現地で観戦した五百籏頭氏は、前年がエンターテインメント色の強い展示が中心だったのに対し、今年はピッキングや物流現場でのPick and Place、交通案内といった具体的な産業ユースケースの探索が中心になっていたと述べました。前年はソフトウェア専業だった企業が自社ハードウェアを持ってユースケース探索に乗り出している例も多く見られたとのこと。
多数の企業が参入している点、前年はUMIやVLAベースの手法が中心だったのに対し、今年は世界モデルとエゴセントリックカメラ(一人称視点カメラ)を用いたデータ収集・モデル構築に取り組む企業が増えていた点を、物量を伴う急速なキャッチアップの例として紹介しました。
特化か汎用か

司会をつとめたABEJAの藤本敬介氏が次にふったテーマは「実際の現場とのギャップ」について。特定タスクに特化する方向性と汎用性を追求する方向性のどちらが社会実装に向けて筋が良いかという問いに対し、河原塚氏は「現在の技術水準では特定タスクに特化したアプローチを取らなければまともな成果を出すのは難しい」との見解を示しました。
これを受けて五百籏頭氏は、世界ロボット大会で見た企業の状況について、タスクの難易度自体はそれほど高くないものの、物を掴んでひっくり返すといった「従来技術では難しかった簡単なタスク」を的確に見つけて実装している企業が複数あったと説明しました。実際に現場に導入されている事例もあり、正確性とタクトタイムという2つのボトルネックについて、タクトタイムが人間の7割程度、成功率99.9%という水準を達成している例も出てきているとのことです。ただし、これらの足回りはほぼ車輪型であり、脚型はほとんど見られなかったとのことでした。
五百籏頭氏はさらに、現状のAIロボット市場を、四足(巡回点検・災害対応向け)、モバイルマニピュレーター(車輪型・産業用途)、ヒューマノイド(エンタメ・研究・レセプション案内向け)の3つに大別できると整理しました。ヒューマノイドを二足歩行にすると、姿勢制御だけでバッテリーを消費し、筐体に搭載可能なバッテリー容量も限られるため、マニピュレーションに特化して稼働時間を確保できる車輪型のモバイルマニピュレーターの方が、データ収集を含む実際の産業ユースケースでは優位になっているとの見方を示しました。
これに関連して、米国のFigureやテスラ、1Xなどは産業向けであっても二足歩行にこだわる傾向がある一方、中国企業はより現実的な観点から車輪型を選択する傾向にあると指摘し、その背景として、米国企業が長期的な到達点から逆算して開発している一方、中国では国やPEファンドからの資金提供に対して3年程度で成果を出す必要があるという時間的制約があり、転倒リスクやバッテリー稼働時間の制約が大きい二足歩行は選ばれにくい状況にあるとの分析を示しました。
現場とのギャップ:アプリケーション探索の難しさ

現場の実ニーズと技術デモとの間のギャップについて、小倉氏は「サービスロボットにおいて最も難しいのはアプリケーションを見つけることだ」と述べました。小倉氏が現在手掛けている清掃ロボットは「自律移動」という20年近く前に確立された技術がベースになっているにもかかわらず、実際に適したアプリケーションが定まるまでに10年以上を要しており、アプリケーションが定まって初めてコストが下がり、社会に受容され、産業として成立するとの認識を示しました。
そして中国はこうしたアプリケーション探索を数多くのベンチャーによって多産的に行っている国であり、中国での成功モデルを取り入れることが有効な戦略になり得るとの見方を示しました。
五百籏頭氏は、既存の販路・商流を持つPuduやKeenOnのような大手配膳ロボットメーカーが、自社の商流に技術を後から組み込む形でポジションを築く動きと、物流現場やピック・アンド・プレースといった具体的なユースケースに一から入り込もうとする動きの両方があると説明しました。
また、中国のある企業を例に「ピック・アンド・プレースという特定タスクに絞れば競争力がある」とする戦略が有効に機能しており、「領域」で区切るのではなく、実態としては「タスク特化」で複数領域に横展開し、そこで築いた商流をもとに別のタスクへ拡張していくモデルがビジネス的に成功しやすいとの見方を述べました。
これに対し河原塚氏からは、ピック・アンド・プレースという括り自体がすでに汎用的なタスクなのではないかという指摘があり、五百籏頭氏は、柔軟物を掴む、搬送中にかき分ける、ひっくり返すといったエッジケースへの対応にこそAIの付加価値が発揮されている面があると説明しました。
小倉氏は、AIの専門家は工場の実際の速度やタクトタイムの厳しさを十分に理解していないことが多く、そうした産業側の要件を踏まえた開発が必要である一方、それを上回ることができれば、との認識を示しました。
家庭用途とBtoB展開
日常生活領域へのロボット導入の動向について問われた五百籏頭氏は、世界ロボット大会で見られた家庭向けタスクのデモの多くは、家庭領域そのものの具体的なユースケールというより、事前学習における汎用的なスキル獲得を目的にしたものが多いのではないかという見立てを紹介しました。
一方で、技術力を示すデモとしてはキュウリの皮むきや洗濯物たたみが人気であり、特に洗濯物たたみは両手の協調動作を要する難易度の高いタスクである一方、既存の衣類関連データが豊富に蓄積されていることもあり、意外と既存技術で対応できる場合もあるとのことです。
「洗濯物たたみがビジネスとして成立し得るか」という河原塚氏の問いに対して、小倉氏は、「大手アパレル企業を相手にしたBtoBの工場作業として捉えれば、AIの精度が人間の作業水準を上回れば、導入され得る領域なのではないか」との見方を示しました。
導入戦略:環境をロボットに合わせるか、ロボットを環境に合わせるか
続いて、清掃・介護・建設などの複雑な既存の人間の作業環境にそのままロボットを導入するのが難しい中で、環境をロボット向けに作り変えるアプローチと、人間の環境にそのまま適応できる汎用ロボットを開発するアプローチ、そのどちらを優先すべきかという論点が提示されました。
小倉氏は、AI領域では通常の産業と異なり先行者利益が強く働きにくく、後発でもオープンソース・オープンモデルを活用して追いつくことができるのではないかという議論があるとした上で、「日本が必ずしも技術的なフロンティアを突き進む必要はないのではないか」という問題提起を行いました。
これに対し五百籏頭氏は、モデルやAIの分野で最先端を走り続けることは実現可能性の観点で難しく、キャッチアップを重視すべき面がある一方、実際に産業のユースケースに入り込んでいくフェーズは「陣取りゲーム」的な性質を持つと指摘しました。
つまり、現場を早期に押さえた企業には良質なフィードバックとデータが還流し、モデルの改善につながるほか、一度導入されるとソフトウェアも含めたベンダーロックインが発生し、後からのリプレースが困難になるため、実際の現場への導入という点ではスピードが重要になるとの見解です。
産学官連携のあり方と中国の支援体制

産学官連携の方向性について、五百籏頭氏は中国では中央政府・地方政府が補助金や出資、土地・建物の割安な供与などを中心に手厚い支援を行っていることを紹介しました。また、需要側とのマッチング支援も強力に行われていることが破壊力のある支援を可能にしている背景にあると説明しました。
大学との連携についても、清華大学と浙江大学からのスピンオフ企業が多いこと、また産業側では、自動車や物流といった既存プレイヤーがAIロボット企業に出資し、実際の現場でのユースケース提供や供給網でのサポート、保守運用まで一体的に支える形で、大企業とスタートアップの連携が進んでいる点を紹介しました。
データ収集拠点である「データファクトリー」は現在中国国内に100か所近く存在し、政府の支援もあって建設が進んでおり、それがデータ収集&需要創出につながっていると語りました。
ハイプサイクルと産業の持続性

小倉氏は、ロボット産業がこれまで約10年周期でブームと衰退を繰り返してきた経緯に触れ、現在もハイプ(過度な期待)の局面にあり、この先いずれ調整局面を迎える可能性が高いとの見方を示しました。その際に急激な衰退とならないよう、ダメージをコントロールしながら低空飛行を続け、次の波に乗れるようにする調整機能を政府に期待したいと述べました。
五百籏頭氏はこれに対し、ポジティブなインセンティブ設計の重要性に同意しつつ、「次のブームは前のブームがあったからこそ生まれるもの」であり、期待が実体を上回る局面(バブル的な状況)であっても、そこに人材や資金が集中的に投入されることで技術水準そのものが底上げされる意義があると指摘しました。
そして調整局面を耐え抜けるのは、研究用途やエンターテインメント用途ではなく、実際に現場で稼働しているユースケースを持つ企業であるとし、産業界に対しては、既存のユースケースや供給網を持つ大企業とAIロボットのスタートアップが連携し、長期的な視点で協業していくことが重要だと述べました。
社会実装を担う人材をどう育てるか

社会実装に向けた課題として、河原塚氏は、大学教育の立場から、社会実装そのものよりも社会実装を担う人材をどう育てるかを重視していると述べました。取り組む人材の絶対数が不足しており、企業側から資金や連携の申し出があっても対応しきれない状況があるとした上で、東京大学内で発足したUTAFのようなフィジカルAI分野の学生団体(他大学における同種の団体を参考にしたもの)など、若い世代を分野に呼び込む取り組みの必要性を強調しました。
あわせて、単純なシミュレーション設定に閉じた研究は今後論文として通りにくくなっていくとの見通しを示し、大学と企業が連携して研究成果を社会に還元していく道筋を作ることの重要性、およびAI研究のサイエンスとしての側面と社会実装の両立を目指す人材を増やしていく必要性を述べました。
また、既にこの分野に取り組んでいる人材だけでなく、まだ取り組んでいない層に対して積極的に声をかけて巻き込んでいく仕組みが必要であると述べました。
小倉氏は、大学に対しては優秀な学生の輩出を、政府に対しては資金面での支援を求めました。具体例として、中国では博士課程学生を雇用する企業に対する補助金制度があり、こうした仕組みが優秀な人材を自信を持って雇用できる環境づくりに寄与しているとの紹介がありました。
また、産業化のためには国営のデータセンター整備やロボットの調達支援なども重要であり、最終的なアプリケーションを誰がどこで見つけ、どう実装し、どのように補助金を設計するかという制度設計が重要だと述べました。
五百籏頭氏は、中国のドローン教室の事例を紹介しました。ドローンが小中高生向けのスポーツ競技として普及しており、全国大会・都道府県大会が整備され、大会での好成績が進学時の加点対象になる制度が存在するとのことです。開始から3年ほどで大会参加者が2万人規模に達しており、子どもたちが競技を通じてドローンの組み立てや部品選定(3Dプリンターでの部品製作を含む)を経験し、成績優秀者には国から操縦者としての級位認定と表彰が行われる仕組みになっているといいます。
こうした取り組みがハードウェアエンジニアの裾野拡大に寄与しており、AI・プログラミングやハードウェア領域全般でも同様に、子どもたちが自ら参加したいと思えるプラットフォームを産学官全体で構築していくことが重要な取り組みであるとの見解を述べました。
今回は、ここで終了時間を迎えました。
いいなと思ったら応援しよう!
よろしければ応援お願いします! いただいたチップは活動費に使わせていただきます!