VISIONHUB · DAY SLIDE · OFFLINE HTML
2026-08-05 · Meta Muse Code + Muse Spark 1.2
2026年8月5日、Meta が Muse Code(beta) を公開。駆動するのはコーディング特化アップデートの Muse Spark 1.2。 大規模リポジトリで「計画 → 実装 → 検証」を一貫して回す実用ターミナルエージェント。Claude Code / Codex / Grok Build に対する本格参入で、モデルとエージェントを co-trained した点が最大の差別化。価格競争力も強い。
DAY SLIDE 2026-08-05 · ONE-SHEET SUMMARY
競争軸は「強いモデル単体」から co-trained エージェント製品 × 永続サブエージェント × 隔離並列 × クラッシュ耐性 × 価格 へ。
A · TIMELINE
C · 4 PILLARS
セッション全体で持続。毎回spawnせずコンテキスト蓄積。レイテンシとsteeringを削減
並列サブエージェントをGit worktreeで隔離。ワーキングコピー無触。衝突なし
全操作をログにappend。replay-exact・クラッシュ後正確再開。長時間タスク対応
モデルとエージェント共同訓練。/plan /grill /goal を標準搭載
D · COST · ACCESS
E · KEY NUMBERS
Terminal-Bench 2位(Claude Opus 5次点) · Hopper kernel 1,000+ tool calls
F · 競合位置
価格と持続・並列・再開性で勝負。製品として即試せる点がエンジニア直撃。
G · DO / DON'T · BOTTOM LINE
結論: 価値の中心は「強いモデル」ではなく co-trained エージェント製品 × 永続・隔離・再開 × 価格。 明日から既存リポで比較実験できる。
01 · MAP
KEY MAP · 4 LAYERS
LAYER 01 プロダクト — ターミナルエージェント。大規模リポジトリで計画・コード記述・検証まで一貫。
LAYER 02 ランタイム — Async Background Agents + Isolated Worktrees + Local Event Log。永続・並列・再開。
LAYER 03 モデル — Muse Spark 1.2。コーディング特化 + co-trained with Muse Code。1M context。
LAYER 04 戦略 — Claude Code / Codex / Grok Buildへの本格参入。価格と実用性で開発者を獲得。
BEFORE → AFTER
BEFORE
Metaは強力モデルを出しても、専用の実用コーディングエージェント製品が弱かった。開発者はClaude CodeやCodexに流れていた。
AFTER · 2026-08-05
モデルとエージェントを一緒に育てた「製品」を即beta公開。curl一発で試せ、価格も強い。座標が動いた。
なぜサプライズか: 「ただのモデル」ではなく、大規模コードベースで計画→実装→検証を一貫して回せる実用エージェント製品として即試せる点。価格競争力と、永続サブエージェント+隔離並列+クラッシュ耐性の組み合わせがエンジニア直撃。
02 · WHAT SHIPPED
Muse Code は、ターミナル上で動作するコーディングエージェント。大規模リポジトリを対象に変更の計画・実装・検証までを一貫処理する。駆動モデルは Muse Spark 1.2(1.1からのコーディング特化アップデート)。モデルとエージェントは co-trained され、ツール使用精度・計画実行・再試行の少なさが最適化されている。
curl -fsSL https://dev.meta.ai/install.sh | bash03 · WHY IT MATTERS
04 · ARCHITECTURE
Muse Code は単純なエージェントループに加え、セッション全体を通じて生き残る専門バックグラウンドエージェント群を動かす。大きな仕事ではサブエージェントが isolated Git worktrees に fan-out し、開発者の作業コピーは一切触れられない。すべてのモデル呼び出し・ツール実行・編集・承認はローカルイベントログに append され、これが single source of truth となる。
ASYNC BG AGENTS
タスク単位でspawnせず、セッション永続。情報収集・検証を並行し、必要なタイミングでメインに報告。冗長な再探索を避ける。
ISOLATED WORKTREES
並列書き込みを物理的に分離。Gitのネイティブ機能を活用。衝突ゼロで複数機能を同時実装可能。
EVENT LOG
操作を逐次記録。クラッシュ後も正確に中断点から再開。エンタープライズの監査性にも寄与。
ケーススタディ: NVIDIA Hopper GPU向けカーネル最適化。1,000回以上のツール呼び出しを最大24時間かけて実行し、Tritonで最適化を継続発見。長時間自律探索の実例。
05 · MUSE SPARK 1.2
EVOLUTION FROM 1.1
コード生成・複雑デバッグ・コードベース理解・end-to-end開発フローを強化。コーディングタスクへの学習計算量を大幅増加、学習環境の多様性も拡大。一般エージェント能力は維持。
Long-horizonタスク(リポジトリ全体生成、大規模end-to-end、自動調査)を重点学習。planning・goal conditioning・context compactionを組み合わせる。
CO-TRAINING
Muse Codeと共同訓練。rejection-sampled harness trajectories、目標・圧縮・サブエージェント向け最適化を導入。Muse Spark 1.1で生成した挑戦的環境を使った自己改善ループも活用。
結果としてツール使用の初回成功率向上、計画実行のクリーンさ、再プロンプトの減少が期待される。
06 · BENCHMARKS
| ベンチマーク | Muse Spark 1.2 + Muse Code | 参考(上位) |
|---|---|---|
| Terminal-Bench 2.1 | 82.9% | Claude Opus 5 + Claude Code 86.7%(2位) |
| DeepSWE 1.1 | 59.3% | Opus 5 65.0% / GPT-5.6 Terra 64.8%(3位) |
| 内部コーディングベンチ | 70.6% | Opus 5 79.4%(向上は明確) |
ベンダー報告。ハーネス付き評価。独立検証を推奨。GPT-5.6 TerraやGrok 4.5を一部上回る位置。
07 · ECONOMICS & STRATEGY
STANDARD
$1.25 / M input · $4.25 / M output
キャッシュ入力はさらに安い。
プロンプト・完了結果は学習に使わない。
CONTRIBUTOR
$0.10 / M input · $0.20 / M output
約12〜21倍安い。
データ利用許可が条件。レート制限あり。
戦略的意味: 個人・実験用途のコスト障壁をほぼ消すことで、開発者を一気に取り込み、実世界のコーディング軌跡を集める。モデル改善のフライホイールを回す意図が明確。
08 · CAVEATS
仕様・品質は急速に変わりうる。本番唯一のツールに即切替は避ける。
現時点はmacOS / Linux。Windows非対応。Metaアカウント必須。
安い代わりにプロンプトと完了結果がMetaのモデル改善に使われる。プライバシー方針を確認。
ベンダー報告中心。自前の中規模リポでの比較実験を優先すべき。
09 · NEXT EXPERIMENTS
推奨の最初の一手: 中規模の自分のリポジトリで「リファクタリング+テスト追加」を1本投げる。15〜30分で「計画品質・並列感・再開性・コスト」が一度に見える。
10 · THE BOTTOM LINE
Muse Code は「強いモデルの追加」ではなく、 co-trained エージェント製品 × 永続サブエージェント × 隔離並列 × クラッシュ耐性 × 価格競争力 の五点セットで座標を動かした。追うべきはカタログ機能の多寡ではなく、自リポジトリでの比較実験と、Contributor / Standardのコスト体感。明日から試せる。
DO
curlで入れて中規模repoを投げる · /plan /grillを使う · 競合と並走比較 · イベントログの再開を確認
DON'T
Windows前提 · betaを本番唯一化 · データ共有条件を無視 · ベンチ数字 alone で判断
SOURCES
Meta AI Research 公式ブログ · Mark Zuckerberg (@finkd) X投稿 · Reuters · VentureBeat · GIGAZINE · Unite.AI · Meta for Developers
Day Slide 2026-08-05 · 数値・対応OS・価格は 8/5 時点の公開情報。beta仕様は急速に変わりうる。ベンチや互換性は自前検証を優先。