AI Intelligence Hub · Day Slide No.378
日次スライド一覧 · TOP
LIVE MODEL / AGENT · 2026.08.13 THU

GROK 4.6 · SPACE XAI

Grok 4.6:同じ値段のまま、先頭圏に戻った

Grok 4.6 が 2026年8月12日 に一般提供を始めた。到着そのものは予告どおり。驚いたのは中身だ。 同じ値段のまま、性能を詰めた。 編集部スコアは 68/100。AA Intelligence Index は 61 で GPT-5.6 Sol Max と同点(Fable 5 Max は 62。超えてはいない)。

発表 2026-08-12 総合サプライズ 68/100 AA Index 61 = Sol Max $2 / $6 据え置き 5 MIN READ
68
総合サプライズ編集部スコア。新しい世代ではなく急加速
61
AA IndexGPT-5.6 Sol Max と同点
$2/$6
価格据え置き入力 / 出力。いちばん効いている点
1753
GDPVal 首位4.5の1526から逆転
01

ONE-BOARD SUMMARY

驚いたのは「出たか」ではなく、同じ値段でどこまで上げたか

Grok 4.6 を1枚で

Surprise 68/100 · 編集部

到着は予告どおり。中身は予告を超えた。同じ値段のまま先頭圏に戻った。日付より中身。編集部スコアは 68/100。新しい世代ではなく、急に速くなった。

どう動くか

アイデア 調査 / コード 自己検証 動くアプリ
01

到着は予想どおり

8/12に出た。目標は8/7。5日遅れは誤差の範囲。番号も 4.5 の次(4.6)

02

中身の密度

同じ価格で AA 56→61。GDPVal / Briefcase / Harvey は首位級

03

値段を据え置いた

$2/$6のまま先頭圏。値下げより、同じ値段で先頭圏に乗せた

04

いちばん大事なのは長時間エージェント

公式の第一文は知能指数ではなく long-running agents。GDPVal 1753 首位

これまで 8/7目標 予想済み 4.7予告 到着そのものは予想どおりだった 市場は8/7前後の出荷を見ていた
これまで市場は8/7到着を予想していた。話の中心は「4.7待ち」(予告。公式4.6稿に詳細なし)。
これから 8/12到着 中身上昇 $2/$6据置 先頭圏へ 話の中心は「4.6で先頭圏に戻った」
これから話の中心は「4.6で先頭圏に戻った」。いちばん大事なのは長時間タスクの完走。
SO WHAT

スコアが上がったことより、長時間タスクが最後まで走るか。昨日の Grok Bot(No.377)は実行環境、今日の 4.6 は頭脳。

02

WHAT'S NEW · GAP

予告とのギャップ——到着は予想どおり、中身は予想超え

驚いた点は二つに分かれる。到着そのものは予想どおり。同じ価格で先頭圏に戻った中身は、予想を超えた。

LOW SURPRISE到着は予想どおり

  • 実出荷は 8/12。目標 8/7 から 5 日遅れは誤差の範囲
  • バージョン番号も 4.5 の次(4.6)
  • 新しい基盤へのジャンプではなく、4.5 の延長という公式の位置づけ

HIGH SURPRISE同じ値段で中身が上がった

  • 同じ $2/$6 で AA 56 → 61。Sol Max と同点、Fable 62 は未達
  • GDPVal 1753 / AA-Briefcase 1577 / Harvey LAB 15.8% で首位級
  • 価格を動かさず先頭圏に乗せたことが、日付より大きい
  • Musk 氏「4.6 は 2 週後、4.7 は 4 週後」および 1.5T / 2.1T は 予告 / 二次。公式 4.6 稿にはパラメータ数も 4.7 詳細も無し。断定しない
  • 公式が述べる中身は、4.5 より長い supplemental run、4.5 による SFT 軌道の再生成、agentic RL
  • 長い軌道では自己テスト/検証が増えた——公式の主張であり、独立検証はない
03

EVALS

総合知は Sol と同点。実務の数字が上がった

数値は公式投稿の Grok 4.6 High / 4.5 High / GPT-5.6 Sol Max / Fable 5 Max。総合知は Sol と同点。実務寄りの数字(GDPVal 1753 首位、AA-Briefcase 1577、Harvey LAB 15.8%)が上がった。穴は DeepSWE と Terminal-Bench。

出典: x.ai/news/grok-4-6。ハイライトは 4.6 列。lead=4.6が首位、tie=Solと同点、lag=Sol/Fable劣後。
Eval 4.6 High 4.5 High Sol Max Fable 5 Max
AA Intelligence Index 61 56 61 62
GDPVal-AA v2 1753 1526 1728 1741
CursorBench v3.2 69.9% 66.7% 67.2% 70.5%
DeepSWE v1.1 65.9% 54% 73% 70%
FrontierCode v1.1 Extended 61.3% 56.6% 60.6% 63.6%
APEX-Agents 57.5% 47.1% 56.7% 59.2%
Terminal-Bench v3.0 26% 15.7% 34.6% 34.1%
APEX-SWE 56.4% 53.6% — 58.8%
AA-Briefcase 1577 1313 1502 1574
Harvey LAB (Vals) 15.8% 12.9% 2.5% 11.3%

読み方: AA 61 は Sol Max と同点であり、Fable 5 Max(62)を超えた数字ではない。穴は DeepSWE 65.9 vs Sol 73、Terminal-Bench 26 vs 34%台。4.5 で幻覚が増えたという独立評価が 4.6 で戻ったかは未計測・未確認。

04

TRAINING

長い追加学習と、研究室が見落としがちな作業の RL

公式が述べる学習側の差分は、事前学習を一新した話ではなく、4.5 からの supplemental run(追加学習) と agentic RL の寄せである。

TRAINING BOARD
Supplemental run on 4.5 · company-reported
Data CURATED

モデル生成データの選別。高品質なエンジニアリングデータ。4.5 で SFT 軌道を再生成。

Agentic RL DOMAINS

知識仕事、一般コーディング、カーネル最適化、Web 開発、CAD。

Long traj. UNVERIFIED

長い軌道で自己テスト/検証が増えた、と公式。独立検証はない。

パラメータ数や「新規事前学習」説、次世代番号の噂は公式 4.6 稿にない。1.5T / 2.1T / 4.7 は予告・二次。編集部読み:大きくせず、中間世代で止めた。
  • オプティマイザ改善を含む、4.5 より長い追加学習
  • 対象ドメインは、研究室が見落としがちな実務寄りの作業を含む
  • 自己検証は「萌芽」——製品の約束ではなく、会社発表の観測
  • 編集部読み: 大きくしたモデルではなく、SFT / RL と長時間エージェントに寄せた中間世代。規模競争を避けた、という読み。公式 4.6 稿にパラメータ数は無い
05

WHERE & PRICE

値段を据え置いたことが、いちばん効いている

知能を上げて値段を据え置くのは、値下げより効く。公式ブログが挙げる提供先は Cursor / Grok Build / SpaceXAI API / OpenRouter / Vercel / Cloudflare。Grok Bot は公式4.6ブログの列挙にはない。

ACCESS

どこで使えるか

Cursor、Grok Build、API、OpenRouter、Vercel、Cloudflare。初週は Cursor と Grok Build の included usage が 2×(2026-08-13 時点でキャンペーン中)。

PRICE

$2 / $6 据え置きがいちばん効く

入力 $2 / キャッシュ $0.50 / 出力 $6。≥200k は倍($4 / $1 / $12)。Fast は 2 倍価格(ID 未確認)。価格表を動かす代わりに、同じ値段で先頭圏に乗せた。

DOCS

500k · 200k で段階

コンテキスト 500k。text+image in / text out。プロンプト 200k 未満は $2 / $0.50 / $6、以上は $4 / $1 / $12。reasoning effort は low / medium / high(default)/ xhigh。

NOT IN BLOG

Grok Bot について

Bot への同日搭載は公式4.6ブログ未記載。X 引用のみの話として扱い、提供先リストには入れない。

06

ACTION / STACK

今週使う、分ける、4.7は予告

4.6 は待つモデルではなく、今週使うモデル。4.7 の再計測は予告。公式 4.6 稿に 4.7 詳細なし。

今週使う実装・調査・長めリファクタ
/
分ける深い SWE / シェルは Sol
→
予告4.7 の再計測は予告
  • 今週使う: Cursor / Build の実装・調査・長めのリファクタを 4.6 既定にする。初週 2× は 8/13 キャンペーン中
  • 分ける: DeepSWE と Terminal-Bench が勝つ深い SWE / シェルは Sol 側を残す。全部乗り換えない
  • 予告: 4.7 の再計測は予告。公式 4.6 稿に 4.7 詳細なし。断定しない
  • Grok Bot(No.377)は実行環境、4.6 は頭脳。公式 4.6 ブログは Bot を列挙していない

TAKEAWAY

新しい世代ではない。同じ値段で先頭圏。いちばん大事なのは長時間エージェント。
4.7 は予告の次の戦い。公式 4.6 稿に 4.7 詳細はない。

Day Slide No.378 · 2026-08-13 · AI Intelligence Hub

クリックまたは Esc で閉じる