2.0が同価格で出た
1.0の2倍正確。Batch $0.10/h・Streaming $0.20/h。diarization・timestamps・key terms込み。
2026年9月18日、xAIはGrok Voice Transcribe 2.0を公開しました。
実世界評価で1.0の2倍正確・同価格。Artificial Analysisの公開リーダーボードでは、ストリーミング32モデル中で精度1位です。
1.0の2倍正確。Batch $0.10/h・Streaming $0.20/h。diarization・timestamps・key terms込み。
公開リーダーボードでストリーミング精度1位。短フレーズWERは20.6%→6.8%(19言語)。
翌日開発パスが通る。既存STT APIはコード変更なしで精度が上がる。
xAIは最新のspeech-to-textモデル、Grok Voice Transcribe 2.0を公開しました。実世界評価では、今日いちばん正確な部類のモデルのひとつで、1.0の2倍正確・同価格です。
土台はGrok Voiceの音声基盤です。顧客サポート通話、動画ナレーション、Tesla車内のGrokアシスタントなど、実地の雑音多言語音声で訓練されています。[1]
きれいな単話者だけでなく、不安定な回線、重なる声、地域アクセント、読み上げの電話番号やメール。実世界の難しい音向けです。[1]
既存のSpeech-to-Text API統合は、コード変更なしで精度が上がります。バッチとストリーミングの両方です。[1]
本号の日枠は2026-09-19 JST(ユーザー選択)。公式ページのdatePublishedは2026-09-18です。BACKFILLのためLATESTではありません。
STTはコモディティで精度差はもう効かない。音声は開発の主入力ではない — この前提が、同価格2×とLoom→Cursorで更新されます。
STTはコモディティ/精度差はもう効かない。音声は開発の主入力パスではない。
精度は十分に揃った。価格とレイテンシで選ぶ。書き起こしは下準備で、コードや設計の入口ではない。
同価格で2倍正確。公開LBでstreaming精度1位。Loomで録った計画がtranscript経由でCursorのコード更新まで流れる、という翌日開発パスが公式に示されています。[1]
編集の推測は入れません。x.aiが書いた数字だけを並べます。
実世界評価でtwice as accurate。価格は1.0と同一。[1]
Batch $0.10/h。Streaming $0.20/h。diarization・timestamps・key terms込み。[1]
Artificial Analysis公開リーダーボードで、ストリーミング32モデル中・精度1位。[1]
コンテキストが少ない車内コマンドなどの短フレーズ集合で、WERが20.6% → 6.8%。19言語。多言語精度が1.0からの最大改善、と公式は書いています。[1]
本番トラフィック由来の内部集合です。公開ベンチの補完として測っています。
| セット | 内容 | 公式の言い方 |
|---|---|---|
| Telephony | 顧客サポート通話・英語・8 kHz対応 | 検証したモデルの中で先頭 |
| Conversational | Grokとの会話・英語 | 1.0より改善 |
| Credentials | 電話番号・メール・住所の読み上げ・英語 | 1.0より改善 |
| Short Phrases | 音声アシスタント発話・19言語 | WER 20.6%→6.8% |
個別のWER表の全セルは、公式ページのチャート画像以外では数値公開が限られます。本号は文章で明示された「全4セットで改善」「telephonyは検証モデル中で先頭」「短フレーズ20.6→6.8」だけを使います。[1]
Atlassian Loomは、Grok Voice Transcribe 2.0を採用し、従来より正確だと述べています。
「We've always believed the best way to move work forward is to capture context once and let it flow everywhere. With Grok powering Loom's speech-to-text and Cursor turning that into code, we're closing the loop from context to code: record what you mean, and the work gets done. It's a glimpse of where AI-assisted development is headed.」[1]
日本デスクが切る点のひとつは、ここです。音声が「下準備」ではなく、翌日の開発入力になるパスが公式に示された日です。
高度な設定は、追加料金なしで載っています。デフォルト切替に備えて、1.0をピン留めできます。
batch+streaming/単語タイムスタンプ+confidence/speaker diarization(追加料金なし)/最大8チャネル/key term biasing(≤100)/数値・日付などの整形/filler除去/smart turn detection。[1]
2.0はまもなくSpeech-to-Text APIのデフォルトになります。1.0は今後数週間で非推奨。移行中はgrok-voice-transcribe-1.0をピン留め。[1]
grok-voice-transcribe-1.0
DEFAULT SOON
grok-voice-transcribe-2.0(デフォルト化予定)
日本デスクの一文はこれです。Loom→Cursorの翌日開発パス。同価格で2×正確。AA streaming #1/32。
STTをコモディティと決め打ちしない。価格は据え置きで精度が2倍、公開LBでstreaming精度1位。音声→書き起こし→Cursorという開発入力が、公式事例として出た。既存APIはコード変更なし。移行だけピン留めを忘れない。
grok-voice-transcribe-1.0をピン。1.0は数週間で非推奨。次に見るのは、自ワークロードでのtelephony/credentials/短フレーズの差分です。「STTは揃った」で閉じない。
一次はx.ai公式のみ。数値は公式が出した「twice as accurate」「same price」「first among 32 streaming」「WER 20.6%→6.8%」「$0.10 / $0.20」に限定しています。
2026-09-18(datePublished)。2× vs 1.0・同価格、AA streaming #1/32、内部WER 4セット、多言語WER 20.6→6.8、機能一覧、Loom→Cursor引用、価格、$0.10/$0.20、移行ピン。
公式文中の参照先。ストリーミング32モデル中・精度1位という主張の根拠。本号はx.aiの記述を一次とし、LBの独自スクレイプはしていない。