今日の深掘り — 音声エージェント

SPEECH AGENT ARENA

話しやすい相手が、仕事も終わらせる、が嘘

壊れている仮定はこれだ。「話しやすい相手が、仕事も終わらせる」。Artificial AnalysisのSpeech Agent Arenaは、人間が同じシナリオで2体の隠れた音声エージェントとライブ対話し、好みEloタスク完了率を別指標で取る。会話1位はGemini 3.1 Flash Live Preview - MinimalでElo 1,046、入力音声$1.50/時、TTFA 0.96秒。だが完了率は74.6%。完了の先頭はSpaceXAI Grok Voice Think Fast 2.0 Highの94.7%($4.80/時)。好みの会話は、最後のツール呼び出しが失敗していても「終わった」ように聞こえる。

📅 AA発表:2026-08-24 🏆 好みElo:1,046(Gemini Minimal) ✅ 完了率:94.7%(Grok Voice) 💰 Gemini:$1.50/時(入力音声)
1,046
好み EloGemini Minimal・会話1位
74.6%
Gemini 完了率好み1位のタスク完了
94.7%
Grok 完了率Think Fast 2.0 High
$1.50
Gemini /時入力音声
0.96s
TTFAGemini Minimal
15+20
シナリオエージェント15/非エージェント20
No.389
Day Slide2026-08-24 AI Intelligence Hub
01

WHAT HAPPENED

何が発表されたのか

Artificial Analysisが2026年8月24日、Speech Agent Arenaを公開した。既存のSpeech to Speechベンチが推論・模擬エージェント・ターンテイキングを測る一方、こちらは人間が実世界の課題をライブで完了させ、会話の好みツール使用の成功を同時に見る。

  • 人間が同じ割り当てシナリオで、隠された2体と別々にライブ会話する
  • エージェント型15(テイクアウト注文などツール呼び出しあり)+非エージェント型20
  • ペアワイズ投票からPreference Eloを推定。エージェント型では適格会話のうち、正しい最終ツール呼び出しで要求を完了した割合がTask Success Rate
  • 会話1位のGemini Minimal(Elo 1,046)は完了74.6%。完了の先頭はGrok Voice Think Fast 2.0 Highの94.7%
「a preferred conversation does not always result in successful task completion - some conversations can sound as though the requested action was completed even when the required final tool call was unsuccessful」 — Artificial Analysis 公式記事(2026-08-24)
02

TECHNICAL SPECS

測り方と二つの指標

指標は二つ。混ぜない。人間のライブペアワイズ会話が入力で、Eloと完了率は別計算になる。

  • Preference Elo — 同じシナリオで2体と別々に話し、どちらを好んだかの投票をEloにフィットする
  • Task Success Rate — エージェント型のみ。逸脱・検証不能を除いた適格会話のうち、正しい最終ツール呼び出し(または複数)で要求アクションを完了した割合
  • エージェント型 15 — ツール呼び出しが必要。例:テイクアウト注文
  • 非エージェント型 20 — ツール呼び出しなし
  • 失敗の見え方 — 好みの会話は、最終ツール呼び出しが失敗していても完了したように聞こえることがある
01同一シナリオ
02隠れた2体とライブ会話
03好み投票 → Elo
04最終ツール呼び出し → 完了率
03

LEADERBOARD

好み vs 完了 — Gemini と Grok が割れる

同じアリーナ、同じ人間対話。先頭が指標で入れ替わる。

COMPARISON BOARD

好み Elo とタスク完了率は、同じアリーナで割れる

PREFERENCE ELO会話の好み

1,046

Gemini 3.1 Flash Live Preview - Minimal
完了率 74.6%
入力音声 $1.50/時
TTFA 0.96秒

High は Elo 1,014

TASK SUCCESSタスク完了

94.7%

SpaceXAI Grok Voice Think Fast 2.0 High
価格 $4.80/時

GPT-Realtime-2.1 High は完了 91.5%($10.75/時)

会話なら左。注文・予約なら右。一本の「音声エージェント1位」は切らない。

モデル 好み Elo タスク完了率 価格
Gemini 3.1 Flash Live Preview - Minimal 1,046 74.6% 入力音声 $1.50/時
Gemini 3.1 Flash Live Preview - High 1,014
OpenAI GPT-Realtime-1.5 1,000
GPT Realtime (Aug '25) 944
ElevenLabs Agents(default cascade) 937 90.5%
SpaceXAI Grok Voice Think Fast 2.0 High 94.7% $4.80/時
OpenAI GPT-Realtime-2.1 High 91.5% $10.75/時

空欄は一次情報に数値が無いセル。埋めない。

04

DIFFERENCES FROM EXISTING

既存の類似製品と何が違うポイントか

「音声モデルを並べる」ベンチは既にある。違いは、人間のライブ課題で好みと完了を分けて測る点にある。

従来・類似既存の Speech to Speech ベンチ

  • 推論、模擬エージェント、ターンテイキングや割り込み処理
  • 会話の自然さとタスク完了を一本の順位に畳みやすい
  • 「話しやすい」が本番の注文・予約の代理指標になりがち

今回Speech Agent Arena

  • 人間のペアワイズ・ライブ会話
  • 好みEloとタスク完了率を別指標
  • エージェント型15(ツール呼び出し)+非エージェント型20
  • 完了は「正しい最終ツール呼び出し」で判定
  • 好み1位と完了1位が一致しない初日データ
05

NEWNESS & PRICING

最近出た新しい製品か・価格

はい。アリーナ自体が新しい。 Artificial Analysisが2026年8月24日にSpeech Agent Arenaを発表した。ネイティブとカスケードのSpeech to Speechを、同じ人間課題で並べる。

価格(一次情報にあるもの)

  • Gemini 3.1 Flash Live Preview - Minimal:入力音声 $1.50/時(Elo 1,046、完了74.6%、TTFA 0.96秒)
  • SpaceXAI Grok Voice Think Fast 2.0 High:$4.80/時(完了94.7%)
  • OpenAI GPT-Realtime-2.1 High:$10.75/時(完了91.5%)

$1.50/時の会話1位を、完了94.7%の代替にはできない。安さと話しやすさ、完了、単価は別列。

06

FOR ENGINEERS

エンジニア向け示唆・どう切るか

  • 好みと完了を分けて切る — 日本デスクの結論。評価表を1列にしない。会話体験と、注文・予約の完了を別ゲートにする
  • 会話なら Gemini Minimal — Elo 1,046、入力音声 $1.50/時、TTFA 0.96秒。話しやすさと応答の速さ側
  • 注文・予約なら Grok Voice — Think Fast 2.0 High、完了94.7%、$4.80/時。最終ツール呼び出しが通るかで選ぶ
  • 「終わった」音声を信じない — 好みの会話は、最終ツール呼び出しが失敗していても完了したように聞こえる。ログの最終コールを見る
  • 代替の位置 — GPT-Realtime-2.1 Highは完了91.5%で$10.75/時。ElevenLabs Agents default cascadeはElo 937 / 完了90.5%

注意: 好み1位を本番の注文・予約の既定にしない。完了率は別指標。会話が終わったように聞こえても、最終ツール呼び出しが失敗している場合がある。

TAKEAWAY

話しやすい相手が、仕事も終わらせる、が嘘。好みと完了を分けて切る。会話ならGemini Minimal、注文・予約ならGrok Voice。

発表:2026-08-24 | 本スライド:2026-08-24 | Day Slide No.389