通常版で広く探し、編集版で条件を読む
今回は、選んだ5件(編集版)がすべて通常版とCSV版に載っていました。そのため拾い漏れの差は比べられず、差が出たのは、載っている項目から「公開済みか」「数字は何の条件か」を読み取れるかどうかでした。ただし、正確さの優劣を数値で判定できるほどの全件検証はしていません。
選定の基準は、公式発表日が10/6であることです。公開時刻・タイムゾーンが明記されないものがあり、「直近24時間以内」かどうかの厳密な判定まではできていません。実務への示唆はVisionHubの編集上の解釈です。
01 調査・検証 / 公式発表日 2026-10-06
OpenAI:AIが出した数学の原稿722本を公開。Lean形式化は全件ではない
内部のフロンティアモデルが出した数学の新しい結果を、OpenAIがGitHubで公開しました。原稿722本(372グループ)のほか、リポジトリにはLean(証明を機械で検査できる言語)による形式化(全件ではありません)、10件の推論の要約、使った計算量の見積もりが含まれます。
- 新しさ
- 公開の仕方に特徴があります。IAS(高等研究所)の独立した諮問グループの助言を参考に、原稿の改訂と引用の手順を決め、訂正は新しい版として残して過去の版も見られるようにするとしています。モデルに約4,000問を出題し、重要度の基準を満たした結果を原稿にまとめたという説明で、挑戦した数も分かります。
- 実務への示唆
- AIの成果を社内で評価するときの型として使えます。成果物だけでなく、機械で検証できる形式(ここではLean)、1件あたりの計算量、挑戦した問題数をそろえて出させる、という観点です。
一次情報:OpenAI「Sharing AI progress in mathematics」 · 公開リポジトリ(README) · 公式発表日 10/6
02 オープンウェイト / 公式発表日 2026-10-06
Mistral:Large 4を先行公開。重みは10月末予定、10/6時点はAPIのプレビュー
Mistralが総パラメータ1兆級のマルチモーダルモデルMistral Large 4を発表しました。プレビューAPIは10/6から使え、重みは10月末に公開する予定です。
- 新しさ
- 学習は欧州にある自社データセンターのNVIDIA Grace Blackwell 3,800基で行い、サイバーセキュリティ、金融、法務の性能を前面に出しています。重みの公開前に、審査済みの協力先へモデレーションを緩めた版を渡して安全性を試験しています。コンテキストは100万トークンで、料金は入力100万トークンあたり1.36ドル、出力4.18ドルが定価で、更新履歴はローンチ価格として2週間は半額と書いています。
- 実務への示唆
- 「オープンウェイト」(学習済みモデルの重みを公開する方式)と呼ばれていても、重みが出るまで自社環境では動かせません。いま評価するなら、プレビューAPIで自社の代表的な業務を試し、重みの公開後に自社運用の費用と要件を見積もる、という二段階が現実的です。
サイバー指標(Artificial Analysis)の1試験で82%と全モデル最高とされています。ただし、Claude Opus 5.5やGPT-6 Astraなどが作業を拒否してほぼ0点になる試験だとMistral自身が説明しており、能力の差と拒否方針の差が混ざった数字です。
プレビューは改良の途中で、重みの公開までに数字が変わりえます。パラメータ数は発表記事が1兆(推論時に使う分は490億)、ドキュメントのモデルカードが1.05兆(推論時に使う分は520億)で、揃っていません。ライセンスは、ドキュメントの表に「Open」とあるだけで、条件は確認できませんでした。
一次情報:Mistral「Introducing Mistral Large 4」 · モデルカード · 公式発表日 10/6
03 ローカルAI / 公式発表日 2026-10-06
Google:EmbeddingGemma 2、画像・動画・音声・コードを同じ空間で検索できる7.4億パラメータのモデル
テキスト・コード・画像・動画・音声を、1つの768次元ベクトル空間に写す7.4億パラメータのモデルです。ライセンスはApache 2.0で、重みはHugging FaceとKaggleにあります。
- 新しさ
- テキストだけなら2.7億パラメータの部分で足り、画像用(1.7億)と音声用(3.0億)のエンコーダは必要な時だけ読み込めます。ベクトルは768次元から128次元まで切り詰められ、保存容量を最大6分の1にできます。コード検索の指標MTEB Codeは、前世代の68.76から78.68に上がりました。8Kトークンの入力で、音声なら5.5分ぶんまで扱えます。
- 実務への示唆
- 議事録の音声、画面録画、リポジトリを端末内で検索するRAG(検索で見つけた資料をAIに渡して答えさせる仕組み)の部品として検討できます。クラウドへ送らずに済む構成の候補になるので、まず手元のデータで検索精度を測るところから始められます。
保存容量が6分の1になるのは、768次元を128次元に切り詰めた場合です。その場合、コード検索(MTEB Code)は78.68から71.41、画像・動画を含む総合(MMEB v2)は59.01から45.65に下がります。モデルカードは、256次元(3分の1)までは影響が小さく、128次元はテキストのみ向けとしています。
メモリ使用量の最小値として示された約191MB(テキストのみ)と約567MB(全機能)は、量子化(精度を落としてモデルを軽くする処理)をしてPixel 11 Proで測った値で、他の端末では変わることがあります。
モデルカードは100以上の言語に対応するが性能は言語ごとに同じとは限らないとしており、日本語の音声・動画検索の精度は確認できていません。
一次情報:Google「EmbeddingGemma 2」 · モデルカード · 公式発表日 10/6
04 開発API / 公式発表日 2026-10-06
OpenAI:Decisions API、文章を書かず確率・選択・スコアだけ返す判定API(β版)
テキストと画像を入力に、条件が真である確率、選択肢からの選択、基準に沿ったスコアを返すAPIが公開β版(試験提供)になりました。対応モデルはgpt-6-lunaのみで、エンドポイントはPOST /v1/decisionsです。
- 新しさ
- OpenAIはResponses APIの約10倍高速と説明しています。/v1/decisionsの課金は入力トークンだけで、gpt-6-lunaは100万トークンあたり0.10ドル、出力とキャッシュの課金はありません。処理地域を指定した場合の割増と、長い入力にかかる料金の倍率が、別に加わります。GA(正式提供)は、10/6時点で数週間以内の見込みと書かれています。
- 実務への示唆
- 問い合わせの振り分け、コンテンツの分類、優先度付けのように、判定だけで足りる処理の置き換え候補です。確率が返るので、ラベル付きの実例でしきい値を決め、誤検知と見逃しのどちらが高くつくかで調整する、とドキュメントが勧めています。どの選択肢にも当てはまらない入力のために「その他」を用意します。
一次情報:OpenAI「Decisions API」ガイド · 変更履歴(10/6) · 公式発表日 10/6
05 業務の再設計 / 公式発表日 2026-10-06
OpenAI×Ironclad:契約ソフトの設定をAIに任せる評価で、GPT-6 Astraの平均スコアは55.0%
OpenAIは契約管理のIroncladと組み、承認ルールや契約テンプレートの設定といった実務ソフトの作業を、AIエージェントの訓練と評価の課題にしました。
- 新しさ
- 実務ソフトに詳しい人と11の課題(秘密保持契約の設定、調達の承認フローの作成、選んだ管轄に合わせた条項の更新など)を作り、1課題あたり8〜50項目の基準で採点しました。GPT-6 Astraの平均スコアは55.0%で、GPT-5.6 Solの41.6%を上回りました。1回の試行にかかる推定時間は、Solの37.0分に対してAstraは19.2分でした。
- 実務への示唆
- 自社の業務ソフトでAIに任せたい作業を、合格基準つきの課題として書き出す手順が参考になります。「一定額以上は財務の承認」といった条件が最後まで保たれているかを、1手順ごとではなく、できあがった設定全体で見る点も実務に使えます。
一次情報:OpenAI「Advancing computer use with Ironclad」 · 公式発表日 10/6
通常版・CSV版との差を、夜の具体例で比較する
比較対象は10/7 08:28生成の通常版と、10:09生成のCSV版を21:57までに確認した内容です。どちらも10/7の生成なので、今回は同日の比較になります。
| 観点 | 通常版で確認したこと | CSV版で確認したこと | 今回の編集版 |
|---|---|---|---|
| 重要度・並び順 | 先頭は光遺伝学のノーベル賞(score 90、AI以外の話題)で、OpenAIの数学成果は2番目(score 85)でした。「見逃せない」とされる48件のうち20件は、同じscore 85のGitHub Trendingのリポジトリ(TensorFlowやAutoGPTなど)でした。 | 1位はRedditのAMA告知(「見逃せない」)で、OpenAIの数学成果は6位でした。「見逃せない」19件、「チェック推奨」18件に分かれていました。 | 公式発表日が10/6の話題から、実務との関わりで5件を選びました。 |
| 拾い漏れ | 5件とも載っていました。経路は、Mistral Large 4がTechCrunchとHacker News、EmbeddingGemma 2がHacker NewsとHugging Face、Decisions APIがHacker News(公式ドキュメントへのリンク)です。 | 5件とも載っていました。Decisions APIはHacker News経由、EmbeddingGemma 2はMarkTechPost経由でした。 | 今回は拾い漏れの差はありませんでした。全記事を網羅検索した結果ではなく、確認時の見出しの観測です。 |
| 正確さ・出典 | 要約はAIによる自動生成で、一次情報と食い違う例がありました。 (1) Decisions APIの項目は「Googleが」公開したと書きますが、リンク先はOpenAIのドキュメントです。 (2) 数学成果の項目は、証明を形式化して検証過程を公開したとだけ書き、READMEにある、形式化は全件ではないこと、未形式化の結果には問題がありうることには触れていません。通常版が全体として誤りだと断定する比較ではありません。 | 要約は短く、取得元の記述に近い内容でした。ただしDecisions APIの項目は、本文ではなくHacker Newsの得点・コメント数が要約欄に出ていました。Mistral Large 4は「プレビュー公開」と書きますが、重みの公開時期は載っていません。 | 一次情報の公式発表日と、「重みは未公開」「全件ではない」「シミュレーション推定」といった読み違えやすい条件を添えました。 |
| 重複 | Mistral Large 4が2件、EmbeddingGemma 2が2件並んでいました。ほかにも、BeamとGeminiの無料枠変更が2件ずつありました。 | OpenAIの数学成果が3件(OpenAI、The Verge、日本語の要約)あり、ほかに、Hacker News経由で公開リポジトリ内の個別の原稿へのリンクも1件ありました。 | 話題単位で1件にまとめました。重複率を全件で測ったものではありません。 |
| 読みやすさ・鮮度 | AI以外の話題(ノーベル賞、ハンバーガーやフラペチーノの新商品)が混ざっていました。夜の確認時は「13時間以上更新されていません」と表示されていました。 | 見出しは英語の原題が中心で、37件中、日本語は3件でした。要約欄は途中で省略されるものがあります。 | 「何が新しいか・何に使えるか・未確認事項」を揃えました。読む時間の短縮は未計測です。 |
編集版の弱点
5件に絞ったため、通常版の広さや、X(旧Twitter)の現場の声は拾い切れていません。提供企業の公式発表が中心で、独立した評価も限られます。10/7に出た発表は、両版が朝の生成のため今回の比較に含めていません。読む時間や費用の改善は未計測です。
今回は5件とも通常版・CSV版に載っていたため、拾い漏れを減らす効果は示せませんでした。編集版のねらいは、条件の読み落としを減らすことです。通常版・CSV版を候補の一覧として使い、判断に使う前に一次情報で条件を確かめる、という使い分けの提案であり、効果を実証した結論ではありません。
今回見送った主な話題は次のとおりです。
- Claude Startupsの拡充(Anthropic、10/6)。対象は、創業5年以内、または直近2年以内に資金調達した企業です。応募して承認された企業にはAPIクレジット1,000ドルが付き、新たにTeamを使う組織は最大5席を1年間無料で使えます。プログラムページのFAQによると、クレジットは付与から6か月で失効し、BedrockやVertex AIでは使えません。「最大7,000ドル相当」は、5席の年額定価6,000ドルとクレジット1,000ドルを足した試算です。応募できる企業が限られるため見送りました。
- Geminiの無料枠の変更(Google、個人アカウント)。10/9から、有料プランのない利用者が選べるモデルはFlash-Liteのみになります。AI Plusの契約者はFlashまで、ProモデルはAI ProとAI Ultraの契約者に残ります。AI Plusの切り替え時期はメールで個別に通知されます。ヘルプに日付が見当たらず、公式発表日が10/6という基準を満たせないため見送りました。The VergeはDeep ThinkをAI ProとUltraの両方のように書いていますが、Googleのヘルプでは AI Ultra の項に書かれています。
- Atlassianとの提携拡大(OpenAI、10/6)。AtlassianのRovoでOpenAIのモデルを使う契約と、Atlassian社内で3,000人を超える開発者がCodexを使っているという内容です。Jiraとのさらに深い連携は検討中の段階で、すぐ使える機能の発表ではないため見送りました。
- Reflection「Beam」(10/5)。公式発表日が10/5で基準外です。通常版には「公開しました」と書く要約がありますが、公式は最終のレッドチーム評価中で、重みは10月中に公開予定、現時点は早期アクセスの申し込みだけとしています。
一覧と解説を行き来する
通常版・CSV版は現在のページへ移動します。夜の件数・比較対象を確認する場合は、この記事の観測記録を参照してください。