AI Intelligence Hub · Day Slide No.378
日次スライド一覧 · TOP
LIVE MODEL / AGENT · 2026.08.13 THU

GROK 4.6 · SPACE XAI

サプライズは日付じゃない——同じ値段のまま前線に戻った Grok 4.6

予告どおりの到着、予告を超えた中身。2026年8月12日 に一般提供が始まった Grok 4.6。 サプライズは「出たか」ではなく、同じ土台でどこまで詰めたか。日付は平凡、密度は非凡。 総合サプライズ 68/100(編集部スコア)。AA Intelligence Index 61 で GPT-5.6 Sol Max と同点(Fable 5 Max は 62。超えてはいない)。

発表 2026-08-12 総合サプライズ 68/100 AA Index 61 = Sol Max $2 / $6 据え置き 5 MIN READ
68
総合サプライズ編集部スコア。新世代ではなく急加速
61
AA IndexGPT-5.6 Sol Max と同点
$2/$6
価格据え置き入力 / 出力。最大の攻撃
1753
GDPVal 首位4.5の1526から逆転
01

ONE-BOARD SUMMARY

サプライズは「出たか」ではなく「同じ土台でどこまで詰めたか」

Grok 4.6 を1枚で

Surprise 68/100 · 編集部

予告どおりの到着、予告を超えた中身。同じ値段のまま前線に戻った。日付は平凡、密度は非凡。総合サプライズ 68/100(編集部スコア)。新世代ではなく急加速。

どう動くか

アイデア 調査 / コード 自己検証 動くアプリ
01

到着は低サプライズ

8/12出荷。目標8/7から5日遅れは誤差。番号もインクリメンタル

02

中身の密度

同じ価格で AA 56→61。GDPVal / Briefcase / Harvey は首位級

03

価格据え置きが攻撃

$2/$6のまま前線。値下げより、同じ値段で先頭圏に乗せた

04

本丸は長時間エージェント

公式の第一文は知能指数ではなく long-running agents。GDPVal 1753 首位

これまで 8/7目標 織り込み 4.7予告 到着そのものは織り込み済み 市場は8/7前後の出荷を見ていた
これまで市場は8/7到着を織り込み。物語の重心は「4.7待ち」(予告。公式4.6稿に詳細なし)。
これから 8/12到着 密度上振れ $2/$6据置 前線復帰 物語は「4.6で前線復帰」へ移った
これから物語の重心は「4.6で前線復帰」。本丸は長時間タスクの完走。
SO WHAT

スコアの上振れより、長時間タスクが完走するか。昨日の Grok Bot(No.377)は実行環境、今日の 4.6 は頭脳。

02

WHAT'S NEW · GAP

予告とのギャップ——到着は低く、中身は高い

サプライズは二層に分かれる。到着そのものは低サプライズ同じ価格で前線に戻った密度は高サプライズ

LOW SURPRISE到着は織り込み済み

  • 実出荷は 8/12。目標 8/7 から 5 日遅れは誤差
  • バージョン番号もインクリメンタル(4.5 → 4.6)
  • 新基盤のジャンプではなく、4.5 の延長戦という公式の位置づけ

HIGH SURPRISE同じ値段で密度が上振れ

  • 同じ $2/$6 で AA 56 → 61。Sol Max 同着、Fable 62 は未達
  • GDPVal 1753 / AA-Briefcase 1577 / Harvey LAB 15.8% で首位級
  • 価格を動かさず前線に乗せたことが、日付より大きい
  • Musk 氏「4.6 は 2 週後、4.7 は 4 週後」および 1.5T / 2.1T は 予告 / 二次。公式 4.6 稿にはパラメータ数も 4.7 詳細も無し。断定しない
  • 公式が述べる中身は、4.5 より長い supplemental run、4.5 による SFT 軌道の再生成、agentic RL
  • 長い軌道では自己テスト/検証が増えた——公式の主張であり、独立検証はない
03

EVALS

総合知は Sol 同着、実行価値が上振れ

数値は公式投稿の Grok 4.6 High / 4.5 High / GPT-5.6 Sol Max / Fable 5 Max。総合知は Sol 同着。実行価値(GDPVal 1753 首位、AA-Briefcase 1577、Harvey LAB 15.8%)が上振れ。穴は DeepSWE と Terminal-Bench。

出典: x.ai/news/grok-4-6。ハイライトは 4.6 列。lead=4.6が首位、tie=Solと同点、lag=Sol/Fable劣後。
Eval 4.6 High 4.5 High Sol Max Fable 5 Max
AA Intelligence Index 61 56 61 62
GDPVal-AA v2 1753 1526 1728 1741
CursorBench v3.2 69.9% 66.7% 67.2% 70.5%
DeepSWE v1.1 65.9% 54% 73% 70%
FrontierCode v1.1 Extended 61.3% 56.6% 60.6% 63.6%
APEX-Agents 57.5% 47.1% 56.7% 59.2%
Terminal-Bench v3.0 26% 15.7% 34.6% 34.1%
APEX-SWE 56.4% 53.6% 58.8%
AA-Briefcase 1577 1313 1502 1574
Harvey LAB (Vals) 15.8% 12.9% 2.5% 11.3%

読み方: AA 61 は Sol Max と同点であり、Fable 5 Max(62)を超えた数字ではない。穴は DeepSWE 65.9 vs Sol 73、Terminal-Bench 26 vs 34%台。4.5 で幻覚が増えたという独立評価が 4.6 で戻ったかは未計測・未確認

04

TRAINING

長い補完学習と、ラボが飛ばしがちな領域の RL

公式が述べる学習側の差分は、事前学習の刷新話ではなく、4.5 からの supplemental run と agentic RL の寄せである。

TRAINING BOARD
Supplemental run on 4.5 · company-reported
Data CURATED

モデル生成データの選別。高品質なエンジニアリングデータ。4.5 で SFT 軌道を再生成。

Agentic RL DOMAINS

知識仕事、一般コーディング、カーネル最適化、Web 開発、CAD。

Long traj. UNVERIFIED

長い軌道で自己テスト/検証が増えた、と公式。独立検証はない。

パラメータ数や「新規事前学習」説、次世代番号の噂は公式 4.6 稿にない。1.5T / 2.1T / 4.7 は予告・二次。編集部読み:scale war を拒否した中間世代。
  • オプティマイザ改善を含む、4.5 より長い補完学習
  • 対象ドメインは、研究室が見落としがちな実務寄りの作業を含む
  • 自己検証は「萌芽」——製品の約束ではなく、会社発表の観測
  • 編集部読み: 大きくしたモデルではなく、SFT / RL と長時間エージェントに全振りした中間世代。scale war を拒否した、という読み。公式 4.6 稿にパラメータ数は無い
05

WHERE & PRICE

価格据え置きが最大の攻撃

知能を上げて値段を据え置くのは、値下げより攻撃的だ。公式ブログが挙げる提供先は Cursor / Grok Build / SpaceXAI API / OpenRouter / Vercel / Cloudflare。Grok Bot は公式4.6ブログの列挙にはない。

ACCESS

どこで使えるか

Cursor、Grok Build、API、OpenRouter、Vercel、Cloudflare。初週は Cursor と Grok Build の included usage が 2×(2026-08-13 時点でキャンペーン中)。

PRICE

$2 / $6 据え置きが攻撃

入力 $2 / キャッシュ $0.50 / 出力 $6。≥200k は倍($4 / $1 / $12)。Fast は 2 倍価格(ID 未確認)。価格表を動かす代わりに、同じ値段で前線に乗せた。

DOCS

500k · 200k で段階

コンテキスト 500k。text+image in / text out。プロンプト 200k 未満は $2 / $0.50 / $6、以上は $4 / $1 / $12。reasoning effort は low / medium / high(default)/ xhigh。

NOT IN BLOG

Grok Bot について

Bot への同日搭載は公式4.6ブログ未記載。X 引用のみの話として扱い、提供先リストには入れない。

06

ACTION / STACK

今すぐ切る、分ける、予約する

4.6 は待つモデルではなく、今週切るモデル。4.7 再計測は予告。公式 4.6 稿に 4.7 詳細なし。

今すぐ切る実装・調査・長めリファクタ
/
分ける深い SWE / シェルは Sol
予約4.7 再計測は予告
  • 今すぐ切る: Cursor / Build の実装・調査・長めのリファクタを 4.6 既定にする。初週 2× は 8/13 キャンペーン中
  • 分ける: DeepSWE と Terminal-Bench が勝つ深い SWE / シェルは Sol 側を残す。全部乗り換えない
  • 予約: 4.7 再計測は予告。公式 4.6 稿に 4.7 詳細なし。断定しない
  • Grok Bot(No.377)は実行環境、4.6 は頭脳。公式 4.6 ブログは Bot を列挙していない

TAKEAWAY

新世代ではない。同じ値段で前線。本丸は長時間エージェント。
4.7 は予告の本体戦。公式 4.6 稿に 4.7 詳細はない。

Day Slide No.378 · 2026-08-13 · AI Intelligence Hub

クリックまたは Esc で閉じる