今日の深掘り — オープンモデル / エージェント

DEEPSEEK · V4-FLASH

同じ骨格のまま、後訓練だけで
エージェント能力がフロンティア近傍へ跳ねた

2026年7月31日、DeepSeek は V4-Flash の正式版「0731」を API 公開し、ほぼ同時に Hugging Face へ MIT ライセンスで重みを公開した。アーキテクチャもサイズもプレビューと同じ(約 284B MoE / アクティブ 13B、1M コンテキスト)。なのに Terminal-Bench 2.1 で 82.7、Artificial Analysis Intelligence Index で 50(旧版 40)。「新しい巨大モデル」ではなく、後訓練中心でエージェント実務を強くした低コスト・オープンな選択肢——なぜこれが最重要トレンドなのかを深く整理する。

📅 発表:2026-07-31(API + HF) 📦 huggingface.co/deepseek-ai/DeepSeek-V4-Flash-0731 · MIT 🏷 284B total / ~13B active · 1M ctx 💰 $0.14 / $0.28 per 1M tok · cache $0.0028
82.7
Terminal-Bench 2.1公式 · Preview 61.8 / Pro 72.1 を上回る
50
AA Intelligence Index旧 Flash 40 → +10 · Luna(max) 51 とほぼ同帯
54.4
DeepSWEPreview 7.3 から異常ジャンプ
13Bactive
MoE 効率総 284B(DSpark 込み HF 表記 ~304B)
MIT
ライセンスAPI とほぼ同時の ungated オープンウェイト
~60%
対 Luna Cost/Task同帯知能で約 60% 低コスト(AA)
01

VISUAL SUMMARY · GROK IMAGINE

まず全体像——0731 が動かした「座標」

後訓練によるエージェント跳躍を中核にした DeepSeek V4-Flash の積層とオープンエコシステム クリックで拡大

図A · 後訓練が頂点の MoE 積層下から BASE 284B MoE → ACTIVE 13B → POST-TRAINING AGENT LEAP。左は高コストなクローズド API、右は MIT / Hugging Face 経由のコミュニティ拡散。エージェント用途(ツール呼び出し・長期ループ)が周囲を取り囲む。

BEFORE Preview と AFTER 0731 のエージェント性能比較 クリックで拡大

図B · BEFORE → AFTER 0731骨格は同じ。後訓練だけで Terminal-Bench / DeepSWE が跳ね、AA Index 50、MIT オープンウェイト、$0.14/$0.28 の価格帯が揃った。

テキストで固定する地図(画像の正確な読み取り)

生成画像は比喩。数字・用語・比較はここに正本を置く。

KEY MAP
LAYER 01
事前学習骨格

284B MoE · 256 routed + 1 shared · 6 active · 1M ctx · 構造は不変

LAYER 02
推論効率

アクティブ ~13B · DSpark スペキュレーティブ · 3段階 reasoning effort

LAYER 03 · NEW
後訓練エージェント強化

Terminal / DeepSWE / Toolathlon 等で Pro Preview 超え — 本命の差分

LAYER 04
配布レイヤー

API 公開ベータ + MIT 即日重み · 蒸留・量子化・自前デプロイが加速

01
何が変わったか

アーキ変更なし。後訓練だけでエージェント実務スコアが跳ねた

02
なぜ実務か

Terminal-Bench 等は「チャット賢さ」ではなく自律タスク完遂率

03
Pro 超えの皮肉

より小さい Flash が V4-Pro Preview を複数指標で上回る

04
経済性

同帯知能で Cost/Task 大幅優位 · 98% キャッシュ割引

05
オープンの破壊力

MIT 即日公開で蒸留・ローカル・社内微調整が即スタート

一行要約:0731 は「もっと大きなモデル」ではなく、同じ骨格をエージェント実務向けに鍛え直し、安く・開いて配ったニュースである。

Terminal-Bench 82.7 DeepSWE 54.4 AA Index 50 MIT open weights $0.14 / $0.28 /M cache $0.0028 DSpark included

上の2枚が本スライドの視覚的フック。続く節は、出荷内容・5層のすごさ・ベンチ・経済・アーキ・注釈をテキストで論証する。

02

WHAT SHIPPED

DeepSeek が出したのは「新しい巨大モデル」ではない

DeepSeek-V4-Flash-0731 は V4-Flash の公式リリースで、4月プレビューを置き換える。DeepSeek 自身の説明は明確で、エージェント能力を大幅強化し、複数ベンチで V4-Pro Preview を上回る一方、構造とサイズは同じ。

  • API 公開ベータdeepseek-v4-flash が 0731 を配信。Responses API / Codex 親和を強調
  • オープンウェイト即日 — Hugging Face deepseek-ai/DeepSeek-V4-Flash-0731 · MIT · ungated
  • 同梱 DSpark — スペキュレーティブデコード用モジュール(vLLM / SGLang でフラグ1本)
  • reasoning_effortlow / high / max の三段。高/max は長出力(最大 384K 級)
  • 価格据え置き — 入力 $0.14 / 出力 $0.28 / キャッシュヒット $0.0028 per 1M tokens
「改善は Flash API に適用。V4-Pro の API/App/Web は当面そのまま。V4-Pro 正式版はまだ」—— DeepSeek 公式のフォローアップ(要旨)

注意:Pro 本命は未着。今回の物語は「Flash が後訓練で先にエージェント面を取りに行った」話であり、最終天井の決着ではない。

03

WHY IT MATTERS

エンジニア視点の「5層のすごさ」

01 · 実務ベンチエージェント完遂率が跳ねた

  • Terminal-Bench / DeepSWE / Toolathlon
  • チャット知識よりツールと長期ループ
  • コーディングエージェント即戦力に近い

02 · 研究シグナル後訓練がフロンティア差分を決める

  • 構造・サイズ不変
  • スケーリング則ストーリーではない
  • RL / 軌道データ / ツールポリシーの勝利

03 · サイズ逆転小さい Flash が Pro Preview を超える

  • 「大きい=強い」がエージェント領域で崩れる
  • 13B active の推論経済が効く
  • デプロイと単価の両面で有利

04 · 価格破壊同帯知能で Cost/Task 優位

  • AA 50 ≒ Luna(max) 51
  • 約 60% 安いタスク単価
  • 98% キャッシュ割引がループ向き

05 · 配布形態MIT 即日オープン

  • 商用・改変・再配布ほぼ自由
  • 量子化・蒸留・社内 SFT が即開始
  • クローズドの「強さで守る期間」が短縮

横断 · 産業競争軸の移動

  • モデル名 → エージェント単価とハーネス
  • オープン基盤がインフラ化
  • V4-Pro 本命前にエコシステムを先取り
04

BENCHMARKS · AGENT LEAP

数字で見る跳躍——公式と独立評価の両方

以下は主に DeepSeek モデルカード報告。条件は DeepSeek Harness(minimal)・max reasoning 等。独立評価は Artificial Analysis。

ベンチV4-Flash-0731Flash PreviewV4-Pro PreviewGLM-5.2Opus-4.8
Terminal Bench 2.182.761.872.181.085.0
NL2Repo54.239.438.548.969.7
Cybergym76.738.752.783.1
DeepSWE54.47.312.846.258.0
Toolathlon-Verified70.349.755.959.976.2
Agents' Last Exam25.215.816.523.825.7
AutomationBench Public25.110.812.812.927.2
  • AA Intelligence Index 50 — 旧 Flash 40 から +10。GPT-5.6 Luna (max, 51) と 1 ポイント差
  • 独立 Terminal-Bench 2.1 ~79% — 公式 82.7 より控えめだが +17pt 級の改善は確認
  • GDPval-AA v2 Elo 1559 — 1189 から大幅上昇。オープン勢では Kimi K3 に次ぐ帯
  • 出力トークン使用 −12% — 同じ仕事をより短く(=より安く)回す傾向

読み方:82.7 を絶対真理としない。ただし独立評価も同方向。DSBench 系は内部セットなので外部横断比較には使いにくい。

05

ECONOMICS

同帯知能 × 異常なコスト効率

FIRST-PARTY API価格帯

  • 入力 $0.14 / 1M tokens
  • 出力 $0.28 / 1M tokens
  • キャッシュヒット $0.0028(約 98% 割引)
  • Pro 出力 ($0.87 帯) の約 1/3

INTELLIGENCE VS COSTPareto 前線

  • AA Index 50 ≒ Luna 51 / GLM 51
  • Cost/Task は Luna(max) より ~60% 安
  • OpenAI の値下げ後でも優位(AA 報告)
  • エージェントはループでトークンを食うので単価が効く

エージェントの本番コストは「入力単価」より システムプロンプトのキャッシュ1タスクの総トークンで決まる。DeepSeek の攻撃的キャッシュ割引は、長いツールログと固定指示を回す用途に極端に相性が良い。

LOOP長い指示 + ツール軌跡 CACHE98% 割引ヒット ACTIVE13B 推論コスト RESULT低 Cost/Task
06

ARCHITECTURE + DSPARK

13B active で回る理由と推論スタック

V4 技術報告(arXiv:2606.19348)ベースの骨格。0731 で変わったのは主に後訓練側。

MOE284B / 13B active

共有1 + ルーテッド256 · 6 expert/token · 初期3層は hash routing

CONTEXT1M tokens

巨大リポ・長いツールログ・分岐履歴を抱えやすい

DSPARK同梱 draft

スペキュレーティブで生成 60–85% 向上帯の報告 · HF 表記 ~304B

  • 注意は CSA + HCA ハイブリッド、残差は mHC(Manifold-Constrained Hyper-Connections)
  • 事前学習は 32T+ tokens + Muon オプティマイザ(V4 レポート)
  • ローカル: Unsloth 量子化で 3-bit ~103–110GB / 4-bit ~168GB 帯の報告
  • サービング: vLLM / SGLang が expert parallel・FP8 KV・DSpark フラグを即対応
「知識の倉庫は大きく、1トークンの計算は小さく」——エージェントのループ回数に対して sparse の利点がチャットより効きやすい。—— 本スライドの解釈
07

CAVEATS

サプライズしすぎないための注釈

0731 は本物のジャンプだが、銀の弾丸ではない。過熱を避けるための境界線。

  • ハーネス依存 — 公式エージェントスコアは DeepSeek Harness 条件。他スタックでは数字が落ちうる
  • 総合知性の天井 — AA でも Kimi K3 (57) や最上位クローズドには届かない帯。エージェント特化の跳躍
  • メモリ壁 — アクティブ 13B でも expert 常駐。フル精度は多 GPU、量子化でも ~100GB+ 級
  • 安全性・透明性 — 重みは開いたが後訓練データ / RL レシピの完全公開ではない
  • Pro 本命は未着 — Flash が先にエージェント面を取っただけ。天井競争は続く

正確な理解:サプライズは「人類最高知能の独占開放」ではなく、エージェント実務で使えるフロンティア近傍能力が、安く・開いて・即流通したことにある。

08

THE BOTTOM LINE

一行で言うと、何が起きたのか

DeepSeek V4-Flash-0731 の本質は、フロンティア競争の主戦場が 「もっと大きな事前学習」から 「後訓練の質 × エージェント完遂率 × 1タスク単価 × オープン配布」へ移ったことを、最もわかりやすく示した点にある。

以前の常識巨大 × クローズド

オープンは少し遅れて少し弱い

0731 の新常識後訓練 × 低コスト × MIT

同じ骨格でも実務エージェントは跳ねる

次の問い実装側

自社のハーネス・キャッシュ・評価を誰が設計するか

だから 7/31–8/1 のエンジニア TL は「また中国モデルが強い」ではなく、「エージェント時代のデフォルト基盤候補が、価格破壊付きでオープンになった」と読んだ——それが深い読みである。

THE BOTTOM LINE

これは「新しい天才モデルが出た」ニュースではない。同じ骨格を後訓練でエージェント実務向けに鍛え直し、フロンティア近傍の能力を安く・MIT で即配布したニュースである。

2026-08-01 — AI Intelligence Hub / Day Slide · DeepSeek V4-Flash-0731 深掘り · スタンドアロンHTML

スライド拡大画像

画像クリック / Esc で閉じる