VISIONHUB · DAY SLIDE · OFFLINE HTML
2026-08-03 · Qwen3.8-Max Formal Release
2026年8月2〜3日、Alibaba Qwen チームが Qwen3.8-Max を正式発表。 総パラメータ 2.4兆、アクティブ 95B の sparse MoE。 空リポジトリから CLI ツールを 16日間ほぼ人間介入なし で育て続け(265 commits · 127 PRs · 151 Issues、公開トレース)、 「チャットが上手いモデル」から「数日〜数週間単位でプロジェクトを完遂するエージェント」へのシフトを明示した。 価格は Input $2 / Output $6 per M tokens。Max 級のオープンウェイトは Qwen 初。
DAY SLIDE 2026-08-03 · ONE-SHEET SUMMARY
長時間自律・コーディング・研究再現・Eコマースシミュレーションで実績を提示。競争軸は「単発の賢さ」から マルチデイ完遂力 × 単価 × オープンウェイト へ。
A · TIMELINE
C · 4 PILLARS
総量は巨大、推論コストは active 95B で抑える sparse 設計
空フォルダ→本番相当 CLI。公開 Git トレース
1M コンテキストまでフラット。K3 より安価
HF / ModelScope 来週予定。Qwen-Max 初
D · PRICE · API
E · KEY NUMBERS
TerminalBench-2.1 86.6 · PaperBench 93.0 · GPQA Diamond 92.6(公式自己報告)
F · DEMO 面
公開トレースは qwen-code-dev-bot/oh-my-cli。 他デモは主に社内報告。外部独立検証はまだ薄い。
G · DO / DON'T · BOTTOM LINE
結論: 価値の中心はパラメータ数ではなく 長時間自律 × 公開トレース × 破壊的単価 × OW 予告。 エンジニアのコスト構造とワークフローを変える候補。
01 · MAP
KEY MAP · 4 LAYERS
LAYER 01 モデル — 2.4T sparse MoE / 95B active / 1M context。マルチモーダル(文書200p+・動画100h+ 級の主張)。
LAYER 02 能力軸 — コーディング · 長ホライゾン · 研究再現 · チップ · Eコマース · オフィス/コワーク。
LAYER 03 · NEW 配布 — QwenCloud GA · $2/$6 · OpenAI/Anthropic 互換 · 来週 OW(HF/ModelScope)。
LAYER 04 競争 — Kimi K3(2.8T, OW済)と並ぶ中国勢のフロンティア級。米側 Claude Fable 5 / GPT 系と「二番手」争いを公式が主張。
BEFORE → AFTER
BEFORE
Qwen Max はホスト API 中心。長時間自律はデモ断片。オープンウェイトは中小〜中型が主戦場。
AFTER · 2026-08-02/03
Max 級を「数週間プロジェクト完遂」の実績で売り、OW を予告。コストは K3 より安く、トレースは GitHub 公開。
なぜサプライズか: 「チャットが上手い」から「数日〜数週間単位でプロジェクトを完遂するエージェント」への明確なシフト。中国勢がフロンティア級の長時間自律をオープンウェイトで出してくるのは、エンジニアにとってコスト構造とワークフローを本気で変える可能性が高い。
02 · WHAT SHIPPED
Qwen3.8-Max は、RL 環境をマルチデイ・ネストディレクトリ・複数エージェントハーネスに拡張し、 長時間・多ステップの完遂を主戦場に据えたフラッグシップ。7/19 Preview → 8月上旬 GA。
| 日付 | イベント | 意味 |
|---|---|---|
| 2026-07-16 | Moonshot Kimi K3 発表 | 2.8T · 中国勢 OW 競争加速 |
| 2026-07-19 | Qwen3.8-Max Preview(WAIC) | 2.4T · 「Fable 5 に次ぐ」主張 |
| 2026-07-27 | K3 ウェイト公開 | 実際にダウンロード可能に |
| 2026-07-30 | oh-my-cli 16日到達 | 265c / 127PR / 151 Issue |
| 2026-08-02〜03 | 正式発表・GA 強調 | 価格・ベンチ・OW 予告を固定 |
| ~2026-08-10 | OW 予定(「来週」) | 8/3 時点では未配布 |
03 · WHY IT MATTERS
04 · AUTONOMOUS CODING
何をしたか
空のリポジトリから oh-my-cli(コマンドラインツール)を構築。ユーザー/コミュニティ要望を Issue 化し、自分にアサインし、コード生成・テスト・改善を反復。状態機械は ready → leased → active。Build / Unit / E2E / Desktop Lifecycle などの自己テストを組み込み。
なぜ重要か
「1 セッションで PR 1 本」ではなく、日単位で製品が進化し続けることを示した。トレースが公開されているため、ハーネス設計(Issue 駆動・自己テスト必須・マージ基準)を他社が移植・比較できる。
Repo: github.com/qwen-code-dev-bot/oh-my-cli · 数値は Qwen 公式ブログ(2026-08-02 前後)および The Decoder / The New Stack 報道。外部の品質監査は途上。
05 · BENCHMARKS
| 領域 | ベンチ | スコア | メモ |
|---|---|---|---|
| Coding Agent | TerminalBench-2.1 | 86.6 | 先頭級。GPT-5.6 Sol は 88.8 との比較あり |
| Coding Agent | SWE-bench Pro | 67.7 | 実リポジトリ系 |
| Coding Agent | FrontierSWE | 73.5 | 前世代 40.7 から大幅改善との主張 |
| Research | PaperBench | 93.0 | 比較内最高と公式 |
| Reasoning | GPQA Diamond | 92.6 | 一般能力 |
| Visual Agent | OSWorld-Verified | 86.1 | デスクトップ操作 |
| Cowork | CoWorkBench | 74.8 | 業務生産性 |
| Long ctx | MRCR v2 256K | 92.9 | 8-needle |
Caveat: 上記は主に Alibaba 自己報告。Artificial Analysis / LMArena 等の独立評価は 8/3 時点で揃っていない。内部インデックスは 0.474 → 0.725 上昇、最適は約 4,000 訓練環境付近とブログが述べる。比較表は必ず自前で再測定すること。
06 · LONG-HORIZON DEMOS
デモ群は「単一ベンチで勝つ」より「環境に長時間住み、改善サイクルを回せる」ことを示すためのポートフォリオ。再現可能な公開資産は oh-my-cli が中心。
07 · ECONOMICS · OPEN WEIGHTS
| 項目 | Qwen3.8-Max | Kimi K3 | 示唆 |
|---|---|---|---|
| 総パラメータ | 2.4T | 2.8T | 同クラス |
| Active / token | 95B | 104B | どちらも sparse |
| Input / M | $2.00 | $3.00 | Qwen が安い |
| Output / M | $6.00 | $15.00 | 長考ループで差が拡大 |
| Cache hit | ~$0.20–0.25 | $0.30 | 反復エージェント向き |
| オープンウェイト | 来週予定 | 07-27 公開済 | K3 が先行実在 |
| 1M context 課金 | フラット | — | 長文リポに有利 |
API で今できること
QwenCloud / Alibaba Cloud Model Studio。OpenAI Chat Completions および Anthropic Messages 互換。エージェント・長考は reasoning_effort=xhigh を試す。thinking トークンは output 単価。
OW 待ちの注意
8/3 時点でウェイト未配布。「来週」= おおよそ 8/10 前後の報道。ライセンス・量子化フォーマット・必要 VRAM は未確定。27B 級の軽量版併せて予告する報道もあり。
08 · CAVEATS
主要スコアはベンダー内部。独立 third-party が揃うまで「公式表 = 確定性能」としない。
oh-my-cli 以外はトレースが薄い。論文再現・チップ・Eコメは条件・シード・失敗率の公開が不足。
K3 のようにファイルが落ちてからが本番。遅延・制限ライセンス・巨大量子化の可能性。
16 日デモはモデル単体ではなく Issue 状態機械・自己テスト・マージポリシー込み。移植しないと比較不能。
長時間自律ほど権限範囲が効く。本番リポジトリへの無監督書込・課金 API・社外通信はゲート必須。
クラウド利用時のデータの所在・契約条件を確認。コンプラ要件が高い組織は OW 後のオンプレを並行検討。
09 · NEXT EXPERIMENTS
推奨の最初の一手: 本番ではなくサンドボックス monorepo で「Issue 1 本 → テスト緑 → PR」を 24h 放置し、介入ログを取る。成功条件を先に数値で決めてから 16 日級にスケールする。
10 · THE BOTTOM LINE
Qwen3.8-Max は「巨大チャット」ではなく、 長時間自律 × 公開トレース × $2/$6 × Max 級 OW 予告 の四点セットで座標を動かした。エンジニアが追うべきはパラメータ数ではなく、 自社ハーネスに移植可能な閉ループと、実効コスト付きの再現実験。
DO
API で小さく試す / 16日トレースを読む / E2E 必須化 / 介入回数を測る / OW 到着に備える
DON'T
公式ベンチを確定値扱い / 無監督で本番書込 / OW 前に self-host 前提 / 単発チャット比較で打ち止め
WATCH NEXT
OW 実配布日 · ライセンス · 独立ベンチ · 27B 軽量版 · 他社 16日級デモの対抗
SOURCES
Qwen 公式ブログ(qwen.ai · id=qwen3.8, 2026-08-02 前後)· Alibaba Qwen / QwenCloud 公式投稿 · The Decoder · The New Stack · Developer-Tech · Pulse2 · Apidog 比較 · Bloomberg / MarkTechPost 報道 · X 上の実測・エンゲージメント(8/3 時点)
Day Slide 2026-08-03 · 数値は公式・主要報道を優先。ベンチは自己報告を含み、独立検証前。仕様・価格・OW 日程は変更されうる。