WHAT HAPPENED
何が発表されたのか
Artificial Analysisが2026年8月24日、Speech Agent Arenaを公開した。既存のSpeech to Speechベンチが推論・模擬エージェント・ターンテイキングを測る一方、こちらは人間が実世界の課題をライブで完了させ、会話の好みとツール使用の成功を同時に見る。
- 人間が同じ割り当てシナリオで、隠された2体と別々にライブ会話する
- エージェント型15(テイクアウト注文などツール呼び出しあり)+非エージェント型20
- ペアワイズ投票からPreference Eloを推定。エージェント型では適格会話のうち、正しい最終ツール呼び出しで要求を完了した割合がTask Success Rate
- 会話1位のGemini Minimal(Elo 1,046)は完了74.6%。完了の先頭はGrok Voice Think Fast 2.0 Highの94.7%
TECHNICAL SPECS
測り方と二つの指標
指標は二つ。混ぜない。人間のライブペアワイズ会話が入力で、Eloと完了率は別計算になる。
- Preference Elo — 同じシナリオで2体と別々に話し、どちらを好んだかの投票をEloにフィットする
- Task Success Rate — エージェント型のみ。逸脱・検証不能を除いた適格会話のうち、正しい最終ツール呼び出し(または複数)で要求アクションを完了した割合
- エージェント型 15 — ツール呼び出しが必要。例:テイクアウト注文
- 非エージェント型 20 — ツール呼び出しなし
- 失敗の見え方 — 好みの会話は、最終ツール呼び出しが失敗していても完了したように聞こえることがある
LEADERBOARD
好み vs 完了 — Gemini と Grok が割れる
同じアリーナ、同じ人間対話。先頭が指標で入れ替わる。
好み Elo とタスク完了率は、同じアリーナで割れる
PREFERENCE ELO会話の好み
Gemini 3.1 Flash Live Preview - Minimal
完了率 74.6%
入力音声 $1.50/時
TTFA 0.96秒
High は Elo 1,014
TASK SUCCESSタスク完了
SpaceXAI Grok Voice Think Fast 2.0 High
価格 $4.80/時
GPT-Realtime-2.1 High は完了 91.5%($10.75/時)
会話なら左。注文・予約なら右。一本の「音声エージェント1位」は切らない。
| モデル | 好み Elo | タスク完了率 | 価格 |
|---|---|---|---|
| Gemini 3.1 Flash Live Preview - Minimal | 1,046 | 74.6% | 入力音声 $1.50/時 |
| Gemini 3.1 Flash Live Preview - High | 1,014 | ||
| OpenAI GPT-Realtime-1.5 | 1,000 | ||
| GPT Realtime (Aug '25) | 944 | ||
| ElevenLabs Agents(default cascade) | 937 | 90.5% | |
| SpaceXAI Grok Voice Think Fast 2.0 High | 94.7% | $4.80/時 | |
| OpenAI GPT-Realtime-2.1 High | 91.5% | $10.75/時 |
空欄は一次情報に数値が無いセル。埋めない。
DIFFERENCES FROM EXISTING
既存の類似製品と何が違うポイントか
「音声モデルを並べる」ベンチは既にある。違いは、人間のライブ課題で好みと完了を分けて測る点にある。
従来・類似既存の Speech to Speech ベンチ
- 推論、模擬エージェント、ターンテイキングや割り込み処理
- 会話の自然さとタスク完了を一本の順位に畳みやすい
- 「話しやすい」が本番の注文・予約の代理指標になりがち
今回Speech Agent Arena
- 人間のペアワイズ・ライブ会話
- 好みEloとタスク完了率を別指標
- エージェント型15(ツール呼び出し)+非エージェント型20
- 完了は「正しい最終ツール呼び出し」で判定
- 好み1位と完了1位が一致しない初日データ
NEWNESS & PRICING
最近出た新しい製品か・価格
はい。アリーナ自体が新しい。 Artificial Analysisが2026年8月24日にSpeech Agent Arenaを発表した。ネイティブとカスケードのSpeech to Speechを、同じ人間課題で並べる。
価格(一次情報にあるもの)
- Gemini 3.1 Flash Live Preview - Minimal:入力音声 $1.50/時(Elo 1,046、完了74.6%、TTFA 0.96秒)
- SpaceXAI Grok Voice Think Fast 2.0 High:$4.80/時(完了94.7%)
- OpenAI GPT-Realtime-2.1 High:$10.75/時(完了91.5%)
$1.50/時の会話1位を、完了94.7%の代替にはできない。安さと話しやすさ、完了、単価は別列。
FOR ENGINEERS
エンジニア向け示唆・どう切るか
- 好みと完了を分けて切る — 日本デスクの結論。評価表を1列にしない。会話体験と、注文・予約の完了を別ゲートにする
- 会話なら Gemini Minimal — Elo 1,046、入力音声 $1.50/時、TTFA 0.96秒。話しやすさと応答の速さ側
- 注文・予約なら Grok Voice — Think Fast 2.0 High、完了94.7%、$4.80/時。最終ツール呼び出しが通るかで選ぶ
- 「終わった」音声を信じない — 好みの会話は、最終ツール呼び出しが失敗していても完了したように聞こえる。ログの最終コールを見る
- 代替の位置 — GPT-Realtime-2.1 Highは完了91.5%で$10.75/時。ElevenLabs Agents default cascadeはElo 937 / 完了90.5%
注意: 好み1位を本番の注文・予約の既定にしない。完了率は別指標。会話が終わったように聞こえても、最終ツール呼び出しが失敗している場合がある。
TAKEAWAY
話しやすい相手が、仕事も終わらせる、が嘘。好みと完了を分けて切る。会話ならGemini Minimal、注文・予約ならGrok Voice。
発表:2026-08-24 | 本スライド:2026-08-24 | Day Slide No.389