VisionHub AI NEWS2026.09.19 / No.416 / プロダクト / BACKFILL
XAI · GROK VOICE TRANSCRIBE 2.0 · SPEECH-TO-TEXT

同価格のまま、
書き起こしが2倍正確になった。

2026年9月18日、xAIはGrok Voice Transcribe 2.0を公開しました。
実世界評価で1.0の2倍正確・同価格。Artificial Analysisの公開リーダーボードでは、ストリーミング32モデル中で精度1位です。

一次:x.ai/news 9/18日枠 09/19 JST(BACKFILL)Adsではない/プロダクト
最初に1枚で、2.0の骨格を見る
編集用の概念図です。公式画像ではありません。数値はx.ai公式の「twice as accurate」「same price」「first among 32 streaming」「WER 20.6%→6.8%」「$0.10 / $0.20」のみを使っています。[1]
今回の要点/まずは、この3つ
01 / 何が起きた

2.0が同価格で出た

1.0の2倍正確。Batch $0.10/h・Streaming $0.20/h。diarization・timestamps・key terms込み。

02 / 公式数字

AA streaming #1/32

公開リーダーボードでストリーミング精度1位。短フレーズWERは20.6%→6.8%(19言語)。

03 / 切る点

Loom→Cursor

翌日開発パスが通る。既存STT APIはコード変更なしで精度が上がる。

読み分け:公式発表編集の整理移行・未確定/末尾の数字から根拠へ移動できます。
01
WHAT HAPPENED

Grok Voice Transcribe 2.0が、同価格で出た。

xAIは最新のspeech-to-textモデル、Grok Voice Transcribe 2.0を公開しました。実世界評価では、今日いちばん正確な部類のモデルのひとつで、1.0の2倍正確・同価格です。

土台はGrok Voiceの音声基盤です。顧客サポート通話、動画ナレーション、Tesla車内のGrokアシスタントなど、実地の雑音多言語音声で訓練されています。[1]

対象の音

きれいな単話者だけでなく、不安定な回線、重なる声、地域アクセント、読み上げの電話番号やメール。実世界の難しい音向けです。[1]

既存統合

既存のSpeech-to-Text API統合は、コード変更なしで精度が上がります。バッチとストリーミングの両方です。[1]

本号の日枠は2026-09-19 JST(ユーザー選択)。公式ページのdatePublishedは2026-09-18です。BACKFILLのためLATESTではありません。

02
BROKEN ASSUMPTION

「STTはコモディティ」が、折れた。

STTはコモディティで精度差はもう効かない。音声は開発の主入力ではない — この前提が、同価格2×とLoom→Cursorで更新されます。

折れた前提(1行)

STTはコモディティ/精度差はもう効かない。音声は開発の主入力パスではない。

これまで多かった像

精度は十分に揃った。価格とレイテンシで選ぶ。書き起こしは下準備で、コードや設計の入口ではない。

いま見える像

同価格で2倍正確。公開LBでstreaming精度1位。Loomで録った計画がtranscript経由でCursorのコード更新まで流れる、という翌日開発パスが公式に示されています。[1]

03
OFFICIAL NUMBERS

公式数字は、2×・価格・AA #1。

編集の推測は入れません。x.aiが書いた数字だけを並べます。

vs 1.0

実世界評価でtwice as accurate。価格は1.0と同一。[1]

価格

Batch $0.10/h。Streaming $0.20/h。diarization・timestamps・key terms込み。[1]

AA公開LB

Artificial Analysis公開リーダーボードで、ストリーミング32モデル中・精度1位[1]

多言語の短フレーズWER

コンテキストが少ない車内コマンドなどの短フレーズ集合で、WERが20.6% → 6.8%。19言語。多言語精度が1.0からの最大改善、と公式は書いています。[1]

04
INTERNAL WER

内部WERは、4セットすべてで改善。

本番トラフィック由来の内部集合です。公開ベンチの補完として測っています。

セット内容公式の言い方
Telephony顧客サポート通話・英語・8 kHz対応検証したモデルの中で先頭
ConversationalGrokとの会話・英語1.0より改善
Credentials電話番号・メール・住所の読み上げ・英語1.0より改善
Short Phrases音声アシスタント発話・19言語WER 20.6%→6.8%

個別のWER表の全セルは、公式ページのチャート画像以外では数値公開が限られます。本号は文章で明示された「全4セットで改善」「telephonyは検証モデル中で先頭」「短フレーズ20.6→6.8」だけを使います。[1]

05
LOOM → CURSOR

録画が、コード更新まで通る。

Atlassian Loomは、Grok Voice Transcribe 2.0を採用し、従来より正確だと述べています。

1Loomで録るアクションプランを画面録画
2書き起こすGrok Voice Transcribe 2.0
3Cursorへtranscriptを渡す
4コード更新直接の差分まで運ぶ
引用/Sanchan Saxena(SVP of Teamwork Collection, Atlassian)

「We've always believed the best way to move work forward is to capture context once and let it flow everywhere. With Grok powering Loom's speech-to-text and Cursor turning that into code, we're closing the loop from context to code: record what you mean, and the work gets done. It's a glimpse of where AI-assisted development is headed.」[1]

日本デスクが切る点のひとつは、ここです。音声が「下準備」ではなく、翌日の開発入力になるパスが公式に示された日です。

06
FEATURES · MIGRATION

機能は込み。移行はピン留め。

高度な設定は、追加料金なしで載っています。デフォルト切替に備えて、1.0をピン留めできます。

機能(公式列挙)

batch+streaming/単語タイムスタンプ+confidence/speaker diarization(追加料金なし)/最大8チャネル/key term biasing(≤100)/数値・日付などの整形/filler除去/smart turn detection。[1]

移行

2.0はまもなくSpeech-to-Text APIのデフォルトになります。1.0は今後数週間で非推奨。移行中はgrok-voice-transcribe-1.0をピン留め。[1]

PIN DURING TRANSITION grok-voice-transcribe-1.0 DEFAULT SOON grok-voice-transcribe-2.0(デフォルト化予定)
07
JAPAN DESK · CUT

切る点は短い。翌日開発と、同価格2×。

日本デスクの一文はこれです。Loom→Cursorの翌日開発パス。同価格で2×正確。AA streaming #1/32。

日本デスク/読みの固定

STTをコモディティと決め打ちしない。価格は据え置きで精度が2倍、公開LBでstreaming精度1位。音声→書き起こし→Cursorという開発入力が、公式事例として出た。既存APIはコード変更なし。移行だけピン留めを忘れない。

精度と価格2× / same price。Batch $0.10・Streaming $0.20。コスト交渉より先に、精度差が効くワークロードかを見る。
翌日開発Loomで録る → transcript → Cursor。音声を設計・実装の入口として試す。
AA #1公開ストリーミング精度1位/32。社内比較の基準点にする。
短フレーズ多言語WER 20.6→6.8(19言語)。車内・コマンド系の多言語を再評価。
移行ピンデフォルト切替前にgrok-voice-transcribe-1.0をピン。1.0は数週間で非推奨。
CLOSING

同価格。2倍正確。
AA streaming #1。Loom→Cursorが通る。

次に見るのは、自ワークロードでのtelephony/credentials/短フレーズの差分です。「STTは揃った」で閉じない。

情報源

一次はx.ai公式のみ。数値は公式が出した「twice as accurate」「same price」「first among 32 streaming」「WER 20.6%→6.8%」「$0.10 / $0.20」に限定しています。

1xAI|Introducing Grok Voice Transcribe 2.0 ↗

2026-09-18(datePublished)。2× vs 1.0・同価格、AA streaming #1/32、内部WER 4セット、多言語WER 20.6→6.8、機能一覧、Loom→Cursor引用、価格、$0.10/$0.20、移行ピン。

2Artificial Analysis(公開リーダーボード)

公式文中の参照先。ストリーミング32モデル中・精度1位という主張の根拠。本号はx.aiの記述を一次とし、LBの独自スクレイプはしていない。

確認範囲:x.ai/news/grok-voice-transcribe-2。未確認:内部WERチャートの全セル数値、AA LBの当該時点スナップショットURL、1.0非推奨の正確な日付。市場インパクトの推計は掲載していません。Adsではない。