こんにちは!AIフル装備 powered by みらいラボのモモです。
生成AIの進化は、これまで画面の中で完結する話が中心でした。文章を書く、コードを直す、資料をまとめるといった仕事は、この数年で急速に自動化が進んでいます。
その一方で、現実の空間で体を動かす「ロボットのAI」は長く実験室の机の上にとどまっていました。腕だけを動かして物をつかむデモは何度も公開されましたが、部屋の中を歩いて家事をこなす姿にはなかなか届きませんでした。
2026年7月30日、グーグル・ディープマインドがロボット向けAIの新世代「Gemini Robotics 2」を公開しました。人型ロボットの脚・胴体・腕・多指ハンドまでを、一つのモデルでまとめて動かせるようになったと発表しています。
この記事では、何が新しくなったのか、前の世代と比べてどこが変わったのかを順番に整理します。あわせて、公開された成功率の数字がどこまで実用に近いのか、そして誰が今すぐ使えるのかまで確認していきます。

グーグル・ディープマインドが公開した3つのモデル
今回の発表は単体のモデルではなく、3つのモデルをまとめたシリーズとして出されました。それぞれ担当する役割が明確に分かれており、組み合わせて使う設計になっています。
中心にあるのが、視覚と言語の入力をモーターの制御信号へ変換する「Gemini Robotics 2」です。グーグル・ディープマインドはこれを、人型ロボットの全身を一つのモデルで制御できる同社初のAIだと説明しています。
残る2つは、高度な段取りを担う「Gemini Robotics ER 2」と、ロボット本体の計算機で動く「Gemini Robotics On-Device 2」です。前者が計画を立て、後者が通信のない環境でも手を動かす、という分担になります。
3つのモデルの役割分担
3つの違いは、担当する階層で整理すると分かりやすくなります。人間でいえば、段取りを考える部分と、実際に体を動かす部分が分かれているイメージです。
以下の表に、公開情報をもとに各モデルの役割と提供状況をまとめました。提供範囲がモデルごとに違う点が、実務では特に重要になります。
Gemini Robotics 2 シリーズの3モデル
| モデル名 | 役割 | 主な特徴 | 提供状況 |
|---|---|---|---|
| Gemini Robotics 2 | 視覚と言語から動作への変換 | 人型の脚・胴体・腕・多指ハンドを一つのモデルで制御 | 早期アクセスのパートナー向け |
| Gemini Robotics ER 2 | 高度な計画と空間の理解 | 数分におよぶ多段階の計画、複数ロボットの調整、道具の呼び出し | Gemini APIとGoogle AI Studioで提供 |
| Gemini Robotics On-Device 2 | 機体の上で動く動作モデル | 通信がなくても動作し、新しい機体へ数時間で適応 | 早期アクセスのパートナー向け |
表で確認したいのは、一般の開発者が今すぐ触れるのはER 2だけだという点です。実際にモーターを動かす2つのモデルは、現時点では早期アクセスのパートナーに限られています。
全身を一つのモデルで動かすという変更
今回の最大の変更点は、制御の対象が腕から全身へ広がったことです。歩く、しゃがむ、背伸びをするといった移動の動作と、物をつかむ動作が同じモデルの中でつながりました。
重心を最適化して転倒の危険を下げる仕組みも組み込まれたと報じられています。上半身だけを制御していた世代では、そもそも転倒という問題が発生しませんでした。
公開されたデモでは、Apptronik社の人型ロボット「Apollo 2」が一つの指示でじょうろを棚の下段に置く様子が示されました。多指ハンドのひとつであるSharpaWaveは5本指で22の自由度を持ち、結び目を作る作業やジップロックを閉じる作業に使われています。
- 前の世代は主に上半身を制御しており、机の上での作業が中心だった
- 歩行やしゃがみ込みを伴う、部屋を移動しながらの作業は扱えなかった
- 複数のロボットが役割を分担して一つの仕事を進めることはできなかった
- 成否の判定は静止画が中心で、作業の途中経過を映像で追い続ける仕組みはなかった
前の世代から何が変わったのか
Gemini Roboticsシリーズは、2025年9月に1.5世代が公開されています。当時の目玉は、動く前に考えてその過程を示すことと、道具としてGoogle検索を呼び出せることでした。
今回の2世代はその延長線上にありますが、扱える体の範囲と作業の長さが大きく変わりました。ER 2は数分にわたる、数百手順の作業まで計画できるとされています。
変化は大きく3つに整理できます。制御範囲の拡大、映像による進捗の管理、そして複数ロボットの協調です。
映像を見ながら自分の進み具合を判断する
ER 2はカメラの映像を流し続けながら、作業がどこまで進んだかを自分で判断します。グーグルの技術者は、映像を見続けることでロボットが自らの進捗を追い、問題が起きれば調整し、次に移る時点を正確に知ることができると説明しています。
この仕組みが実務で持つ意味は、失敗しても最初からやり直す必要がなくなる点にあります。途中で止まった箇所から再開できるため、手順の長い作業ほど効率の差が大きくなります。
数字としては、作業の進み具合を5段階に分類する精度が57.4%と公表されました。映像から重要な場面を特定する精度は91.3%で、平均誤差は0.96秒、比較対象のモデルより4倍速いとされています。
ER 2はGoogle検索や利用者が定義した関数を、そのまま道具として呼び出せます。手元の映像だけでは判断できない情報を外部から取りに行けるため、指示があいまいな作業にも対応しやすくなりました。
さらに、遅延を抑えた通信に対応するGemini Live APIとの連携も用意されています。映像を送りながら判断を返す用途では、この応答の速さが実際の使い勝手を左右します。
複数のロボットが役割を分担する
もう一つの変更が、複数台のロボットによる協調です。ER 2が調整役となり、機体どうしで文脈を受け渡しながら、一台では大きすぎる仕事を分担します。
公開された例では、人型のApollo 2と、腕だけの構成である「Franka F3 Duo」が組み合わされています。形や動き方の違う機械どうしでも共通の意味理解を通じて連携できるとされており、車輪で動く機体と人型を組ませることも想定されています。
この機能は、工場や倉庫のように役割の異なる機械が並ぶ現場で効いてくると考えられます。一台の万能ロボットを待つのではなく、既存の機械を束ねる方向へ舵が切られたと読むこともできます。
- 前の世代であるGemini Robotics 1.5とER 1.5は、2025年9月25日に公開された
- 当時のER 1.5は全開発者向けに提供され、計画の立案と進捗の推定を担当していた
- 今回のER 2は、直前のER 1.6と比べて安全指示の順守と人の接近検知で上回るとされる
- On-Device 2は新しい機体への適応に、200例未満の実例と数時間の適応作業で足りるとされる
公開された成功率をどう読むか
発表資料には、作業ごとの成功率が具体的な数字で並んでいます。数字が公開されること自体は誠実な姿勢ですが、読み方には注意が必要です。
同じ人型ロボットでも、装着するハンドの種類によって成績が変わります。さらに作業の種類による数字の幅が非常に大きく、平均値で語ると実態を見誤ります。
公表された主要な数値を、機体とハンドの組み合わせごとに整理すると次のようになります。
Apollo 2 と Franka Duo における作業別の成功率
| 機体とハンド | 作業内容 | 成功率 |
|---|---|---|
| Apollo 2+Inspireハンド | 棚から取る | 76.3% |
| Apollo 2+Inspireハンド | 机から取る | 68.4% |
| Apollo 2+Inspireハンド | 床から拾う | 45.7% |
| Apollo 2+SharpaWaveハンド | 電球を外す | 92% |
| Apollo 2+SharpaWaveハンド | 電球をねじ込む | 36% |
| Apollo 2+SharpaWaveハンド | ごみ袋を結ぶ | 44% |
| Apollo 2+SharpaWaveハンド | ジップロックを閉じる | 40% |
| Apollo 2+SharpaWaveハンド | ちりとりを使う | 32% |
| Franka Duo | 精密な挿入 | 89.6% |
| Franka Duo | 工具の仕分け | 78.9% |
| Franka Duo | 一般的な把持と設置 | 74.2% |
表を眺めると、同じロボットでも作業によって3倍近い差があることが分かります。この幅こそが、ロボットAIの現在地を示しています。
得意な作業と苦手な作業がはっきり分かれる
電球を外す作業は92%に達する一方で、電球をねじ込む作業は36%にとどまります。外す方向と締める方向では、必要な力加減とずれの許容範囲が違うためだと考えられます。
ちりとりを使う作業は32%、ジップロックを閉じる作業は40%です。人間が日常的に何気なくこなす作業ほど、ロボットにとっては難しいという構図が数字に表れています。
一方、腕だけのFranka Duoでは精密な挿入作業が89.6%、工具の仕分けが78.9%と高めです。作業場所が固定され、体を運ぶ必要がない条件であれば、実用に近い水準まで来ていると言えます。
安全性の評価と開発元が認める限界
安全面では「ASIMOV-Agentic」という新しい評価基準が導入されました。これは動作モデルからの危険な道具の呼び出しを拒めるか、作業の可否を見極めて不確かなときに人の介入を求められるかを測るものです。
人の接近については、これとは別の評価項目が用意されています。人が近づいたときに人型ロボットを安全に停止させる点と、安全指示を守る点で、直前の世代を上回ったとされています。
グーグル・ディープマインド自身も、現時点の限界をはっきり認めています。ロボットの動作は遅く、人間が反射的にこなす動きの前で立ち止まって考えており、本当の器用さは遠い目標だとしています。
学習の効率についても、人間と比べて大きく劣ると述べられています。成功率の数字と合わせて読むと、いま起きているのは完成ではなく前進だと理解できます。
誰が使えるのか、産業には何が起きるのか
発表を実務の視点で見るとき、最初に確認すべきは提供範囲です。今回は3つのモデルで、公開の度合いがそれぞれ違います。
高度な計画を担うER 2は、Gemini APIとGoogle AI Studioを通じて一般に提供されています。企業向けのGemini Enterprise Agent Platformでは、限定プレビューという扱いです。
一方、実際にモーターを動かすGemini Robotics 2とOn-Device 2は、早期アクセスのパートナー向けにとどまります。試用を希望する開発者向けに、登録フォームが用意されている段階です。
対応する機体とパートナー企業
検証に使われた機体には、ApptronikのApollo 2、Franka Duo、Dexmate、SO101、Trossenのプラットフォームが挙げられています。パートナーとしては、Apptronik、ボストン・ダイナミクス、Agile Robotsの名前が公開されました。
幅広い機体に同じモデルを載せる方向性は、業界全体の流れとも一致しています。一つのモデルであらゆる体を動かすという考え方に、各社がそろって向かっている状況です。
自社で導入を検討する企業にとっては、手持ちの機械が対応リストに入るかが最初の関門になります。対応機体の広がり方が、そのまま普及の速度を左右します。
競合の動きとハードウェア側の制約
ロボット向けの基盤モデル開発は、グーグルだけの動きではありません。OpenAIやNVIDIAも同種のモデルを進めており、競争はすでに本格化しています。
同時に、ハードウェア側の事情も無視できません。米国が中国製ロボットの将来的な販売禁止に動いたと報じられており、ソフトウェアが進んでも機体の調達で制約を受ける可能性があります。
つまり、この分野の進み方はモデルの性能だけでは決まりません。どの国のどの機体を調達できるかという条件が、実際の導入時期を左右します。
- 実際に体を動かすモデルは一般公開されておらず、早期アクセスのパートナー限定である
- 公開された成功率は32%から92%まで幅があり、平均像で語ると実態を見誤る
- 動作速度は人間より遅く、開発元自身が本当の器用さは遠い目標だと述べている
- ハンドの種類や機体の構成で成績が変わるため、自社の作業に置き換えるには条件をそろえた検証が要る
今後どこを見るべきか
今回の発表は、研究段階から実装段階への入口にあたります。次に確認すべき指標は、派手なデモ映像ではなく地味な数字です。
具体的には3つあります。成功率の底上げ、動作速度の改善、そして動作モデルの提供範囲の拡大です。
いずれも、実際の現場に入るかどうかを分ける条件になります。この3点が動かないまま次の発表が来た場合は、進歩の中身を慎重に見る必要があります。
成功率と速度が実用ラインに乗るか
現場で使うには、単発の成功率だけでは足りません。同じ作業を数百回繰り返したときの安定性と、一回あたりの所要時間が問われます。
特に、床から物を拾う作業の45.7%という数字は、人が横で見ている必要がある水準です。ここが80%台に乗るかどうかが、次の世代の分かれ目になります。
動作速度についても、開発元が遅さを認めている以上は改善の幅が焦点です。人の作業速度に対して何割まで近づいたかが、実用性の分かりやすい目安になります。
提供範囲と現場での稼働事例
もう一つの注目点は、動作モデルがいつ一般提供へ移るかです。ER 2だけが使える状態では、段取りは立てられても手は動きません。
あわせて、パートナー企業から実際の稼働事例が出るかどうかも重要になります。倉庫や工場での連続稼働のデータが公開されれば、評価の精度は一気に上がります。
日本の製造や物流の現場にとっても、この2点は導入判断の材料になります。国内の機体メーカーが対応リストに加わるかどうかも、あわせて見ておきたいところです。
まとめ
グーグル・ディープマインドは2026年7月30日、ロボット向けAIの新世代「Gemini Robotics 2」を公開しました。全身を制御する動作モデル、計画を担うER 2、機体上で動くOn-Device 2の3本立てで、人型ロボットの脚から指先までを一つのモデルで動かせるようになったとしています。
このニュースが重要なのは、AIの適用範囲が画面の中から現実の空間へ広がる具体的な一歩だからです。机の上での作業から、歩いて移動しながらの作業へ対象が変わったことは、単なる性能向上とは意味が違います。
今後の注目点は、公開された成功率がどこまで底上げされるか、動作速度が人の作業にどこまで近づくかの2点です。加えて、実際にモーターを動かすモデルが一般提供へ移り、パートナー企業から現場の稼働データが出てくるかどうかで、実用段階かどうかの判断材料がそろいます。
私が今回の発表で最も誠実だと感じたのは、成功率の低い作業まで数字を並べて公開した点でした。ちりとりが32%という数字は期待をあおりませんが、ロボットAIの現在地を正確に示しています。
読者の皆さんがこの分野のニュースを追うときは、デモ映像の滑らかさではなく、公開された成功率と提供範囲の2点を確認してみてください。この2つがそろって動いたときが、ロボットが本当に現場へ入る合図になります。
参考サイトまとめ
- Gemini Robotics 2 brings whole body intelligence to robots — Google DeepMindhttps://deepmind.google/blog/gemini-robotics-2-brings-whole-body-intelligence-to-robots/
- Introducing Gemini Robotics ER 2 — Google Bloghttps://blog.google/innovation-and-ai/models-and-research/google-deepmind/gemini-robotics-er-2/
- Google DeepMind debuts Gemini Robotics 2 model series for humanoid robots — SiliconANGLEhttps://siliconangle.com/2026/07/30/google-deepmind-debuts-gemini-robotics-2-model-series-humanoid-robots/
- Google DeepMind’s Gemini Robotics 2 controls whole humanoids — TNWhttps://thenextweb.com/news/gemini-robotics-2-whole-body-humanoid-control
- Gemini Robotics 1.5 brings AI agents into the physical world — Google DeepMindhttps://deepmind.google/blog/gemini-robotics-15-brings-ai-agents-into-the-physical-world/













コメント