今日の深掘り — Physical AI / ロボティクス

GEMINI ROBOTICS 2 · ER 2

足先から指先まで!DeepMindが人間型ロボットの『全身知能』を解禁

Google DeepMind が 2026-07-30Gemini Robotics 2(VLA)・Gemini Robotics ER 2(Embodied Reasoning)・On-Device 2 を正式リリース。上半身テーブルトップから feet to fingertips の全身制御へ一気に拡張し、ゴミ袋結び・電球交換など高度器用作業、複数機の協働、動画フィードによる進行追跡型推論、オンデバイス高速適応まで揃えた。Apptronik Apollo 2 など実機デモが、Physical AI の「未来感」をそのまま映像にした一日だ。

📅 DeepMind 発表:2026-07-30 🤖 3モデル:VLA 2 / ER 2 / On-Device 2 🦾 実機:Apptronik Apollo 2 · Franka · Spot
3 models
同時ローンチVLA · ER · On-Device の第2世代
全身
制御範囲feet → fingertips の humanoid 全身
<200 ex
On-Device 適応新実施形態へ数時間・200例未満
91.3%
Moment-findingER 2 の精密イベント検出精度
Multi
協働異種ロボットの共有セマンティクス
9/10
サプライズ度デモ映像×Physical AI 直球ヒット
01

ONE-BOARD SUMMARY

1枚で見る Gemini Robotics 2

公式のキャッチは明確だ——「From feet to fingertips」。人間型ロボットに、歩く・しゃがむ・伸ばす・指先で結ぶまでの全身知能を教え、単機では無理な作業を複数ロボットのチームで解く。

  • 発表日:2026-07-30(DeepMind Blog 同時公開)
  • ER 2:Google AI Studio / Gemini API(public preview)・Enterprise は private preview
  • VLA 2 / On-Device 2:early-access partners 向け
02

THREE-LAYER STACK

脳・身体・エッジ——3モデルの役割分担

ER が「何をいつやるか」· VLA が「どう動くか」· On-Device が「現場で速く合わせる」

HIGH-LEVEL BRAINGemini Robotics ER 2

  • 人とチャットし、物理世界を理解
  • 数分単位のマルチステップ計画
  • 動画進行追跡・瞬間検出
  • Google Search 等のツール呼出
  • 異種ロボットの協働オーケストレーション

ACTION BODYGemini Robotics 2(VLA)

  • Vision + Language → motor control
  • humanoid 全身(足先〜指先)
  • 二腕ロボット・各種グリッパ
  • 結び・ジップロック・密充填など器用作業

EDGEOn-Device 2

  • ネットワーク制約向け軽量 VLA
  • 新実施形態へ <200 例で適応
  • 適応時間:数時間オーダー
  • Dexmate / SO101 / Trossen 等で実証
Think of Gemini Robotics ER 2 as a high-level brain for robots. It allows robots to chat with humans, understand the physical world, and plan multi-step tasks.— DeepMind Blog / Introducing Gemini Robotics ER 2
03

UPPER BODY → WHOLE BODY

「上半身→全身」進化比較——feet to fingertips

前世代はテーブルトップの上半身操作が主戦場だった。今回の VLA は 歩行・しゃがみ・伸展・精密配置まで含めた全身モーションに踏み込み、人間型の作業空間を一気に広げた。

🗑️
ゴミ袋結び柔軟物体の結び操作
💡
電球交換締付進行を動画で追跡
🤐
ジップロック密封Apollo 2 繊細操作デモ
📦
密充填パッキング5指 22-DoF ハンド対応
🧹
散らかった部屋歩行+片付けの長時間タスク
観点前世代イメージGemini Robotics 2
制御範囲上半身・固定ベース中心feet to fingertips 全身
器用作業把持・配置が中心結び・密封・締付・密充填
時間軸短い操作シーケンス数分単位の長時間タスク
進行把握成功/失敗の粗い検出動画進行分類 + 瞬間検出
協働単機前提Apollo × Franka 等の異種チーム
適応実施形態ごとに重い再学習<200 例・数時間(On-Device 2)
From feet to fingertips — we are teaching robots intelligent whole-body control, fine dexterity, and teamwork to complete a broad range of complex tasks.— DeepMind「Gemini Robotics 2 brings whole body intelligence to robots」
04

VIDEO-PROGRESS REASONING

ER 2——「考えながら動く」長時間タスク自律

ER 2 の本質はスペック表ではなく 連続動画で自分の進捗を見続ける能力だ。フレームごとに進行度を分類し、失敗(こぼし・滑り・ズレ)を途中検知し、「次のステップへ進む瞬間」をミリ秒〜秒単位で特定する。

PROGRESS TRACKING動画進行追跡

  • 進行分類 5段階(0–20% … 80–100%)
  • 分類精度 57.4%(ベンチ報告)
  • moment-finding 精度 91.3%
  • 平均誤差 0.96 秒
  • moment-finding は 4× 高速・低コスト化

ORCHESTRATION行動しながらの思考

  • Gemini Live API で双方向ストリーム
  • stop-and-think 待ちを削減
  • VLA / ナビ API をツールとして宣言
  • Google Search 等のネイティブ呼出
  • 失敗ステップのリトライ(全体再起動不要)

MULTI-ROBOTマルチロボット協働

車輪ローバーと humanoid など異種機体が共有セマンティクスでハンドオフ。単機では解けないワークフローをチームで完遂。Apptronik Apollo 2 × Franka F3 Duo のデモが象徴。

SAFETY安全・不確実性

ASIMOV-Agentic ベンチで危険ツール拒否・人間介入要求を評価。「人が近づいたら停止→離れたら再開」。ER 2 は「最も安全なモデル」と公式が位置づけ。

  • Think-while-acting——動作中に次ステップを並行推論
  • Progress before advance——仕様どおり完了したか確認してから次へ
  • Tool-first body——低レベル制御はツールとして差し替え可能
  • Based on Gemini 3.5 Flash——ER 2 の基盤(Model Card)
05

HARDWARE DEMOS

Apptronik Apollo ほか——実機が語る未来感

スライド映えの中核はデモ映像だ。公式は humanoid から固定二腕、四脚まで幅広く見せ、「どの体にも同じ知能レイヤを載せられる」メッセージを視覚化した。

HUMANOIDApptronik Apollo 2

  • 全身制御+繊細マニピュレーション
  • SharpaWave(5指 22-DoF)/ Inspire hands
  • ジップロック密封・じょうろ把持など
  • Franka F3 Duo との協働デモ

OTHER BODIES多様な実施形態

  • Franka 二腕 + Robotiq グリッパ
  • Boston Dynamics Spot — ER 2 が Spot API をオーケストレーション(物取り)
  • On-Device:Dexmate / SO101 / Trossen
  • パートナー:Apptronik · Boston Dynamics · Agile Robots 等

スライド映えの使い方:「上半身→全身」比較の左右対比+Apollo 連続カット+協働シーンの3点セットが強い。テキストは短く、映像/連続画像を主役に。

AVAILABILITYいま誰が触れるか

  • ER 2:AI Studio / Gemini API public preview
  • ER 2:Gemini Enterprise Agent Platform private preview
  • VLA / On-Device:early-access partners
  • Live API サンプル:GitHub robotics-samples

WHY #3 TODAY優先3位の根拠

  • VisionHub にドンピシャの Physical AI
  • デモビジュアルが強く未来感が一気に伝わる
  • 7/30 当日の新発表(鮮度最大)
  • 脳(ER)公開で開発者ストーリーも立つ
06

CAVEATS & OPEN QUESTIONS

盛りすぎない——デモと製品化のあいだ

公式デモは強力だが、Physical AI は常に ラボ成功率 ≠ 現場稼働率 のギャップを抱える。次の論点を分けて読む。

LIMITSいま見えている制約

  • 多指器用操作は依然として難しい領域
  • VLA / On-Device はパートナー限定
  • 進行分類 57.4% は「完璧」ではなく改善途上
  • 異種協働の現場オペレーション設計は未成熟
  • 安全ベンチと実環境のギャップは要監視

STILL POWERFULそれでも動かした針

  • 「全身」が公式プロダクトメッセージになった
  • ER 脳が API 経由で触れる(開発者参入)
  • 動画進行追跡が長時間自律の鍵を明示
  • multi-robot を第1級機能として位置づけ
  • 200 例適応は導入コストのゲームチェンジ候補
Gemini Robotics ER 2 represents a step change in powering robots with video understanding, task orchestration, and multi-robot collaboration — making it possible for robots to be more helpful in the physical world.— DeepMind Blog 2026-07-30

読みのコツは「人間型が完成した」ではなく 「全身+協働+進捗脳という設計図が公開された」と捉えること。ハードは各社、知能レイヤは Gemini——プラットフォーム戦争のフィジカル版が本格化した。

THE BOTTOM LINE

これは「ロボットが少し上手くなった」ニュースではない。足先から指先までの全身知能と、動画で進捗を見る脳が、同じスタックとして解禁されたニュースである。

2026-07-30 — AI Intelligence Hub / Day Slide

主な出典: DeepMind「Gemini Robotics 2 brings whole body intelligence to robots」(2026-07-30) / DeepMind「Introducing Gemini Robotics ER 2」Model Card: Gemini Robotics ER 2Gemini Robotics モデルページOn-Device 2 / Google Developer Blog / GitHub robotics-samples / 前日 Day Slide:Grok Build Mode(2026-07-29)
スライド拡大画像

画像クリック / Esc で閉じる