YES / NO
条件に当てはまるか
例:この回答は返金を約束しているか。真である確率を返す。
MICROSOFT-DECISION-1 / 10月9日発表
汎用AIのGPT-6 Solと比較。Microsoft自社ベンチマークのP50(応答時間の中央値)での結果。
問い合わせをどの部署へ渡すか。どれを急いで確認するか。Microsoft-Decision-1は、こうした選択肢が決まった判断を、数値と確率で返すモデルです。担当部署の選択と回答文の作成を分けることで、AIの使い方を見直せます。
「約35倍」はモデルの応答時間の比較です。問い合わせ対応全体の高速化や、日本語の自社業務での効果を保証するものではありません。料金は2026年10月9日発表時点のUSD。
出典:Microsoft公式発表。本稿の業務フローと評価計画は編集部提案です。
ONE-PAGE BRIEF
Microsoftの自社ベンチマークでは、Microsoft-Decision-1のP50応答速度はGPT-6 Sol比で約35倍。入力料金は100万トークンあたり0.042米ドル、出力は無料です。業務への組み込み例は、問い合わせの担当部署と緊急度を判定し、低確信・判断不能・重要案件は人に戻す構成。回答文が必要なときは汎用LLMを使います。この構成の実務効果は未検証で、誤分類、差し戻し、待ち時間、総費用を比較する必要があります。
入力するのは、判断に必要な文章やJSONと、あらかじめ定義した質問・選択肢。返ってくるのは、選択結果や確率、順序尺度の値です。自由な回答文や判断理由の説明は返しません。
入力例 / 架空の問い合わせ
「決済画面でエラーになり、購入を完了できません」
同じ本文に「担当部署は?」「緊急度は?」という複数の質問をまとめて送る想定。
返り値のイメージ / 数値は説明用
定義した段階に沿う値と、各段階の確率を取得。
APIの概念を示した例で、実行結果や実測の正解率ではありません。仕様の出典:Microsoft Learn「Choose a question type」。
YES / NO
例:この回答は返金を約束しているか。真である確率を返す。
CHOICE
例:担当は技術・請求・一般窓口のどこか。選択結果と各候補の確率を返す。
SCORE
例:軽微・中程度・重大を低い順に定義。返るスコアは各段階の確率で重み付けした順序番号の平均で、段階の間の値も取ります。
選択肢と判断基準の設計が、実装の仕事になる。「その他」「判断不能」を用意し、情報不足の問い合わせに無理な分類を強いない構成を検討します。
Microsoftは、学習時に伏せたベンチマークを含む36種類・約15万問で比較し、最も高い正解率と速い応答を報告しました。見出しの約35倍は、GPT-6 Solと比べたP50応答時間に基づきます。独立した第三者による再現結果ではありません。
P50の相対応答時間 / 小さいほど速い
公表された比率を図示。Microsoft-Decision-1を1とした相対値で、実測のミリ秒ではありません。P50は観測の半分がその時間以下になる中央値です。
出典:Microsoft公式発表「Speed」「Quality that generalizes」(2026-10-09)。
決まった選択肢から判断する処理で、専用モデルを使うと応答待ちを減らせる可能性があります。
日本語の問い合わせでの正解率、混雑時の遅延、人の確認を含む完了時間。文章を生成しないことだけが速度差の原因だとも、この比較だけでは断定できません。
1億入力トークン × $0.042 / 100万 = $4.20
編集部による単純計算。10万件すべてが1,000入力トークンで、料金が変わらないと仮定。再試行、後段の汎用LLM、システム運用、人の確認にかかる費用は含みません。入力トークン数は文字数と同じではありません。
単価の出典:Microsoft公式発表「Pricing」。実際の請求条件は、利用する提供先で要確認。
最初の試行は、問い合わせの仕分けに絞ります。担当部署や緊急度を決めた後、必要な案件だけに回答生成を行う構成です。
スコアは、承認権限の代わりになりません。たとえば担当部署へ回す判断と、返金を実行する判断では影響が違います。自動化する範囲を工程ごとに区切り、誤った分類を修正できる経路を残します。
構成の背景:Microsoft Learn「When to use Microsoft-Decision-1」は、判断モデルで振り分けた後に生成モデルを使う組み合わせを説明しています。上記の運用設計と採用条件は編集部提案です。
Microsoft Learnは、判断理由を返さないことに加え、次の制約を明記しています。導入時は平均の正解率だけで判断せず、どの失敗が誰に影響するかを確認する必要があります。
同じ意味のつもりでも、書き方や並べ方でスコアが動く可能性があります。曖昧な問いにも数値は返ります。
確率の校正は慣れたタスクで最も強いとされています。自社のデータでも「0.9の案件が約9割正しいか」を確かめます。
スコアだけで根拠をたどれません。現行の規程や対象範囲を入力し、元の問い合わせと判定条件を記録します。
無害な内容を止めたり、有害な内容を見逃したりする可能性があります。個人に関する重要な決定の唯一の根拠にしません。
制約の出典:Microsoft Learn「Known limitations and risks」。検証・記録の方法は編集部提案。
本稿では未検証 日本語の実問い合わせ、業界特有の言い回し、短文・誤字・複数依頼が混ざる文章、運用時のP95遅延。多言語を含む公表ベンチマークだけで、自社の日本語業務の性能を推定しないでください。
担当者の確認が増え、ほかの対応を遅らせるかもしれません。
障害対応や顧客への連絡が遅れるかもしれません。両者の損失は同じとは限りません。
この2例は運用上のリスクを考えるための例示です。モデルの実測の誤り率を示していません。
同じ問い合わせ、同じ判断基準で、現行の仕分け方法と比較します。価格と中央値が良くても、重大な見逃しや確認待ちが増えるなら、そのまま採用しません。
利用許可と匿名化を確認した日本語データを用意。担当者が正解・保留・重要案件を整理し、調整に使うデータと最終評価用を分けます。表現と選択肢の順序も変えて試します。
最初はAIの提案を記録するだけにし、担当者の判断との差を確認。次に、許可した低影響の範囲で試すかを決めます。件数・期間・閾値は責任者と事前に合意します。
担当違い、急ぎの見逃し、不要なエスカレーションを別々に数える。分母と、人に戻した割合も残す。
見送り条件の例:重大案件の見逃しが許容条件を超える、または正解が曖昧で評価できない。
AI単体と、受付から担当者確定までを分けて計測。P50に加え、遅い側のP95や混雑時も比較する。
見送り条件の例:モデルが速くても、人の確認待ちを含む完了時間が改善しない。
判断API、再試行、後段LLM、人の確認・修正、運用費を合計。保留を減らすための無理な自動化を避ける。
見送り条件の例:確認・修正の増加で、合意した費用と品質の条件を満たさない。
コピーは端末内の操作です。このページからデータや依頼文を外部へ送信しません。
Microsoft-Decision-1は、選択肢が決まった処理を軽くする候補です。日本語の自社データで、誤分類と人の確認を含めた待ち時間・費用を比べる。その結果を見て、任せる工程を決めます。
2026年10月11日確認。性能の数値は提供元による発表で、本稿はモデルのAPIを実行していません。料金や提供条件は変更される可能性があります。
図の問い合わせ・確率は説明用の例です。評価計画は編集部提案で、有効性を実証した運用手順ではありません。本稿の作成時点で、API実行、日本語業務での性能測定、個別の導入可否判定は行っていません。