VISIONHUB · DAY SLIDE · OFFLINE HTML

2026-08-03 · Qwen3.8-Max Formal Release

印刷 / PDF保存
今日の深掘り — 長ホライゾンエージェント / オープンウェイト競争

Alibaba Qwen3.8-Max 正式リリース 2.4T MoE · 95B active · 16日完全自律コーディング · 来週オープンウェイト

2026年8月2〜3日、Alibaba Qwen チームが Qwen3.8-Max を正式発表。 総パラメータ 2.4兆、アクティブ 95B の sparse MoE。 空リポジトリから CLI ツールを 16日間ほぼ人間介入なし で育て続け(265 commits · 127 PRs · 151 Issues、公開トレース)、 「チャットが上手いモデル」から「数日〜数週間単位でプロジェクトを完遂するエージェント」へのシフトを明示した。 価格は Input $2 / Output $6 per M tokens。Max 級のオープンウェイトは Qwen 初。

正式発表2026-08-02〜03
Preview2026-07-19(WAIC)
規模2.4T / 95B active MoE
コンテキスト1M tokens
Qwen3.8-Max 2.4T MoE Long-horizon Agent oh-my-cli Open Weights Next Week $2 / $6 QwenCloud

DAY SLIDE 2026-08-03 · ONE-SHEET SUMMARY

Qwen3.8-Max 正式リリース・サマリ

長時間自律・コーディング・研究再現・Eコマースシミュレーションで実績を提示。競争軸は「単発の賢さ」から マルチデイ完遂力 × 単価 × オープンウェイト へ。

GA · QwenCloud Open weights · ~来週 Max 級初の公開予定

A · TIMELINE

  1. 07.16
    Kimi K3 発表
    2.8T · オープン競合
  2. 07.19
    Qwen3.8-Max Preview
    WAIC Shanghai
  3. 07.30
    oh-my-cli 16日到達
    265c · 127PR · 151I
  4. 08.02–03
    正式 GA + ブログ
    価格確定 · OW 来週
B · WHAT IT IS
単発回答用の巨大チャットではない。 日〜週単位の長ホライゾンタスクを自律で回し切ることを設計目標に据えたフラッグシップ。

C · 4 PILLARS

012.4T / 95B MoE

総量は巨大、推論コストは active 95B で抑える sparse 設計

0216日自律コーディング

空フォルダ→本番相当 CLI。公開 Git トレース

03$2 in / $6 out

1M コンテキストまでフラット。K3 より安価

04Max 級オープンウェイト

HF / ModelScope 来週予定。Qwen-Max 初

D · PRICE · API

Input / M tokens
$2.00
1M ctx フラット
Output / M tokens
$6.00
thinking も output 課金
Cache hit
~$0.20–0.25
  • · QwenCloud / Model Studio
  • · OpenAI · Anthropic 互換 API
  • · reasoning_effort: low/med/xhigh
  • · vs K3: $3/$15 → 大幅に安い

E · KEY NUMBERS

総 params
2.4T
Active
95B
自律日数
16
Commits
265

TerminalBench-2.1 86.6 · PaperBench 93.0 · GPQA Diamond 92.6(公式自己報告)

F · DEMO 面

oh-my-cli 16日 論文再現 ~5日 チップ設計 ~500 iter Eコメ 365日 sim Tianchi 24h

公開トレースは qwen-code-dev-bot/oh-my-cli。 他デモは主に社内報告。外部独立検証はまだ薄い。

G · DO / DON'T · BOTTOM LINE

DO
  • · API で小さく試す
  • · 16日トレースを読む
  • · ハーネス移植を抽出
  • · E2E テストを必須化
DON'T
  • · ベンチを鵜呑み
  • · 無監督で本番書込
  • · OW 前に self-host 前提
  • · 単発チャット比較で終了

結論: 価値の中心はパラメータ数ではなく 長時間自律 × 公開トレース × 破壊的単価 × OW 予告。 エンジニアのコスト構造とワークフローを変える候補。

図 · ONE-SHEET · 全セクションの正本サマリ Sources: Qwen 公式ブログ · Bloomberg · The Decoder · MarkTechPost · X 実測

01 · MAP

まず全体像——何が「座標」を動かしたか

KEY MAP · 4 LAYERS

LAYER 01 モデル — 2.4T sparse MoE / 95B active / 1M context。マルチモーダル(文書200p+・動画100h+ 級の主張)。

LAYER 02 能力軸 — コーディング · 長ホライゾン · 研究再現 · チップ · Eコマース · オフィス/コワーク。

LAYER 03 · NEW 配布 — QwenCloud GA · $2/$6 · OpenAI/Anthropic 互換 · 来週 OW(HF/ModelScope)。

LAYER 04 競争 — Kimi K3(2.8T, OW済)と並ぶ中国勢のフロンティア級。米側 Claude Fable 5 / GPT 系と「二番手」争いを公式が主張。

BEFORE → AFTER

BEFORE
Qwen Max はホスト API 中心。長時間自律はデモ断片。オープンウェイトは中小〜中型が主戦場。


AFTER · 2026-08-02/03
Max 級を「数週間プロジェクト完遂」の実績で売り、OW を予告。コストは K3 より安く、トレースは GitHub 公開。

なぜサプライズか: 「チャットが上手い」から「数日〜数週間単位でプロジェクトを完遂するエージェント」への明確なシフト。中国勢がフロンティア級の長時間自律をオープンウェイトで出してくるのは、エンジニアにとってコスト構造とワークフローを本気で変える可能性が高い。

02 · WHAT SHIPPED

Alibaba が出したのは「もっと大きいチャット」ではない

Qwen3.8-Max は、RL 環境をマルチデイ・ネストディレクトリ・複数エージェントハーネスに拡張し、 長時間・多ステップの完遂を主戦場に据えたフラッグシップ。7/19 Preview → 8月上旬 GA。

日付イベント意味
2026-07-16Moonshot Kimi K3 発表2.8T · 中国勢 OW 競争加速
2026-07-19Qwen3.8-Max Preview(WAIC)2.4T · 「Fable 5 に次ぐ」主張
2026-07-27K3 ウェイト公開実際にダウンロード可能に
2026-07-30oh-my-cli 16日到達265c / 127PR / 151 Issue
2026-08-02〜03正式発表・GA 強調価格・ベンチ・OW 予告を固定
~2026-08-10OW 予定(「来週」)8/3 時点では未配布

03 · WHY IT MATTERS

エンジニア視点の「5層のすごさ」

01評価軸が「単発」から「数週間」へ

  • チャット Elo ではなく完遂日数・PR 本数
  • Issue → 実装 → テスト → merge の閉ループ
  • エージェント製品の KPI が書き換えられる

02公開トレースがある

  • oh-my-cli は GitHub で追える
  • ブラックボックスデモより検証可能
  • 自社ハーネス設計の教材になる

03コスト構造が壊れる

  • $2/$6 はフロンティア級で攻撃的
  • K3 $3/$15、Claude 系より大幅安
  • 長時間ループを回す前提の単価

04Max 級 OW の予告

  • ホスト依存からの脱却可能性
  • コンプラ・空気ギャップ・自前 RL
  • K3 との二強ローカル実験

05中国勢の同時攻撃

  • K3 と 3 日差のプレビュー
  • 価格・OW・エージェントの三点セット
  • 米側とのギャップ縮小を印象付け

横断産業インパクト

  • 競争軸 = モデル × ハーネス × 単価
  • 「人間レビュー付き自律 PR」が標準化
  • 16 日デモの再現性が次の戦場

04 · AUTONOMOUS CODING

16日間ほぼ人間介入なし——oh-my-cli トレース

自律期間
16
日(〜2026-07-30)
Commits
265
公開リポジトリ
Pull Requests
127
自己マージ含む
Issues
151
フィードバック→Issue 化

何をしたか

空のリポジトリから oh-my-cli(コマンドラインツール)を構築。ユーザー/コミュニティ要望を Issue 化し、自分にアサインし、コード生成・テスト・改善を反復。状態機械は ready → leased → active。Build / Unit / E2E / Desktop Lifecycle などの自己テストを組み込み。

なぜ重要か

「1 セッションで PR 1 本」ではなく、日単位で製品が進化し続けることを示した。トレースが公開されているため、ハーネス設計(Issue 駆動・自己テスト必須・マージ基準)を他社が移植・比較できる。

Repo: github.com/qwen-code-dev-bot/oh-my-cli · 数値は Qwen 公式ブログ(2026-08-02 前後)および The Decoder / The New Stack 報道。外部の品質監査は途上。

05 · BENCHMARKS

公式が並べた「コーディングとエージェント」の数字

領域ベンチスコアメモ
Coding AgentTerminalBench-2.186.6先頭級。GPT-5.6 Sol は 88.8 との比較あり
Coding AgentSWE-bench Pro67.7実リポジトリ系
Coding AgentFrontierSWE73.5前世代 40.7 から大幅改善との主張
ResearchPaperBench93.0比較内最高と公式
ReasoningGPQA Diamond92.6一般能力
Visual AgentOSWorld-Verified86.1デスクトップ操作
CoworkCoWorkBench74.8業務生産性
Long ctxMRCR v2 256K92.98-needle

Caveat: 上記は主に Alibaba 自己報告。Artificial Analysis / LMArena 等の独立評価は 8/3 時点で揃っていない。内部インデックスは 0.474 → 0.725 上昇、最適は約 4,000 訓練環境付近とブログが述べる。比較表は必ず自前で再測定すること。

06 · LONG-HORIZON DEMOS

コーディング以外——研究・チップ・Eコマース

01研究論文再現

  • 論文 “Unified Data Selection for LLM Reasoning”
  • ~5 日 / 約 125 GPU 時間 · 7,600 LOC · 33 訓練ジョブ
  • AIME24 +7.7pt、さらに改良で +2.7pt 上乗せ主張

02チップ設計(暗号アクセラレータ)

  • 約 500 イテレーションの自律最適化
  • ゲート数 8,298 → 678(約 81% 削減)
  • 面積 106×106 → 46×46 µm² · 500 MHz タイミング

03Eコマース 365 日シミュレーション

  • 初期資本 ¥100,000 · 年末残高 ¥416,252(約 4.16x)
  • 仕入・価格・返品・災害・詐欺検知 152 件
  • Qwen3.7-Max 比 2.5x、次点 GLM 5.2 を上回る主張

04Tianchi マルチモーダル大会

  • WWW2025 意図認識 · 526 チーム中
  • 24h で accuracy 0.60 → 0.853
  • 458 チームを上回る(人間チーム含む)と報告

デモ群は「単一ベンチで勝つ」より「環境に長時間住み、改善サイクルを回せる」ことを示すためのポートフォリオ。再現可能な公開資産は oh-my-cli が中心。

07 · ECONOMICS · OPEN WEIGHTS

価格・競合・オープンウェイトの座標

項目Qwen3.8-MaxKimi K3示唆
総パラメータ2.4T2.8T同クラス
Active / token95B104Bどちらも sparse
Input / M$2.00$3.00Qwen が安い
Output / M$6.00$15.00長考ループで差が拡大
Cache hit~$0.20–0.25$0.30反復エージェント向き
オープンウェイト来週予定07-27 公開済K3 が先行実在
1M context 課金フラット長文リポに有利

API で今できること

QwenCloud / Alibaba Cloud Model Studio。OpenAI Chat Completions および Anthropic Messages 互換。エージェント・長考は reasoning_effort=xhigh を試す。thinking トークンは output 単価。

OW 待ちの注意

8/3 時点でウェイト未配布。「来週」= おおよそ 8/10 前後の報道。ライセンス・量子化フォーマット・必要 VRAM は未確定。27B 級の軽量版併せて予告する報道もあり。

08 · CAVEATS

サプライズしすぎないための注釈

自己報告ベンチ

主要スコアはベンダー内部。独立 third-party が揃うまで「公式表 = 確定性能」としない。

デモの再現性

oh-my-cli 以外はトレースが薄い。論文再現・チップ・Eコメは条件・シード・失敗率の公開が不足。

OW はまだ「予定」

K3 のようにファイルが落ちてからが本番。遅延・制限ライセンス・巨大量子化の可能性。

ハーネス依存

16 日デモはモデル単体ではなく Issue 状態機械・自己テスト・マージポリシー込み。移植しないと比較不能。

安全・監督

長時間自律ほど権限範囲が効く。本番リポジトリへの無監督書込・課金 API・社外通信はゲート必須。

地域・データ

クラウド利用時のデータの所在・契約条件を確認。コンプラ要件が高い組織は OW 後のオンプレを並行検討。

09 · NEXT EXPERIMENTS

明日から回せる実験案

A最小 E2E 自律追加

  • 小さな公開/社内リポを QwenCloud に渡す
  • 指示:「この機能を自律追加して E2E テストまで通して」
  • 計測: 所要時間 · 人間介入回数 · テスト成功率 · トークン費用

B16日デモのハーネス移植

  • oh-my-cli の Issue 状態機械を読む
  • 自社向けに ready/leased/active · 必須テスト · PR 基準を抽出
  • Claude Code / 自作ハーネスに同等ルールを載せ替え

C価格感度テスト

  • 同一タスクを reasoning_effort 三段階で実行
  • $2/$6 実効コストと品質のパレートを記録
  • K3・Claude・自社標準モデルと並列比較

DOW 到着後の dual-track

  • API 継続 vs セルフホストのレイテンシ/コスト
  • ライセンス・量子化・最低 GPU をチェックリスト化
  • 「長時間ループだけ API、機密はローカル」の分割設計

推奨の最初の一手: 本番ではなくサンドボックス monorepo で「Issue 1 本 → テスト緑 → PR」を 24h 放置し、介入ログを取る。成功条件を先に数値で決めてから 16 日級にスケールする。

10 · THE BOTTOM LINE

今日の結論

Qwen3.8-Max は「巨大チャット」ではなく、 長時間自律 × 公開トレース × $2/$6 × Max 級 OW 予告 の四点セットで座標を動かした。エンジニアが追うべきはパラメータ数ではなく、 自社ハーネスに移植可能な閉ループと、実効コスト付きの再現実験。

DO

API で小さく試す / 16日トレースを読む / E2E 必須化 / 介入回数を測る / OW 到着に備える

DON'T

公式ベンチを確定値扱い / 無監督で本番書込 / OW 前に self-host 前提 / 単発チャット比較で打ち止め

WATCH NEXT

OW 実配布日 · ライセンス · 独立ベンチ · 27B 軽量版 · 他社 16日級デモの対抗

SOURCES

Qwen 公式ブログ(qwen.ai · id=qwen3.8, 2026-08-02 前後)· Alibaba Qwen / QwenCloud 公式投稿 · The Decoder · The New Stack · Developer-Tech · Pulse2 · Apidog 比較 · Bloomberg / MarkTechPost 報道 · X 上の実測・エンゲージメント(8/3 時点)

Day Slide 2026-08-03 · 数値は公式・主要報道を優先。ベンチは自己報告を含み、独立検証前。仕様・価格・OW 日程は変更されうる。