ONE-PAGE BRIEF
この1枚で、本号の要点を読む
数値の条件と詳しい説明は下の各章に記載。画像を押すと拡大できます。
THE ANNOUNCEMENT
Cloudflareが公開した、判定用の重み
10/1、CloudflareはClefとClef-flashを発表。Workers AIでホストし、Hugging FaceにApache 2.0で重みを公開しました。
見出しの98.8%は、Clef-flashのBFCL case exact accuracy 98.76%を丸めた値です。Cloudflareの自社評価で、すべての判定に共通する精度ではありません。
STATE AND CHOICES
状態を読み、許可した選択肢に確率を返す
入力は状況を表すstateと、型を持つ質問のquestions。モデルは各質問の許可された選択肢をまとめて評価します。
返すのは選択肢ごとの確率。文章を1tokenずつ生成する手順を省き、コードで分岐や担当振り分けに使える出力を作ります。
- 問い合わせをどの担当へ送るか。
- 緊急度を何段階に分けるか。
- 確信が低い判定を、人の確認へ回すか。
TWO MODEL SIZES
Clefは27B、flashは9B
ClefはQwen3.8-27B、Clef-flashはQwen3.5-9Bを基に追加学習しています。公式仕様はテキスト・JSONに加え、画像と動画も入力対象としています。
| 仕様 | Clef | Clef-flash |
|---|---|---|
| モデル規模 | 27B | 9B |
| 基盤モデル | Qwen3.8-27B | Qwen3.5-9B |
| Workers AI context | 65,536 tokens | 65,536 tokens |
WHERE THEY SCORE WELL
道具の選択と分類で高いスコア
公式記事の代表値を、同じ列順で比較します。BFCLと家電シミュレーターではflash、BANKING77ではClefが高い値を示しました。
| 指標(%) | Clef | flash | Jev |
|---|---|---|---|
| BFCL / case exact accuracy | 98.47 | 98.76 | 95.75 |
| 家電 / case exact accuracy | 82.95 | 97.73 | 52.27 |
| BANKING77 / macro-F1 | 94.20 | 90.93 | 79.74 |
LATENCY UNDER THE TEST
flashの中央値は38.8 ms
Cloudflareは評価群でのrequest latencyを掲載。flashは中央値38.8 ms、p95は122.4 msでした。p95は遅い側も含めて読むための値です。
| 遅延(ms) | Clef | flash | Jev |
|---|---|---|---|
| 中央値 | 209.3 | 38.8 | 524.1 |
| p95 | 238.6 | 122.4 | 536.0 |
THE LOSING METRICS
Jevが上回るタスクも残る
When2CallとBRIGHTはJevが上回ります。公式HFのGPQA Diamondでも差があり、選択式の課題すべてでClefが優位とは言えません。
| 指標(%) | Clef | flash | Jev |
|---|---|---|---|
| When2Call / accuracy | 72.37 | 65.58 | 80.97 |
| BRIGHT / nDCG@10 | 45.91 | 39.26 | 47.52 |
| GPQA Diamond / accuracy | 48.0 | 51.0 | 78.3 |
A TYPED REQUEST
noul・choice・scoreで質問を定義
APIはJev / SystemOne互換。noulはtrueの確率、choiceは選択と選択肢ごとの確率、scoreは順序のある候補に基づく期待スコアを返します。
下は依頼を振り分けるための説明用入力例です。実測結果や確率の架空値は載せていません。
{
"model": "clef-flash",
"state": "決済時にエラーが出て、注文を完了できない。",
"questions": {
"urgent": {"type": "noul", "instructions": "緊急の対応が必要か"},
"team": {"type": "choice", "criteria": {
"billing": "請求・返金", "technical": "障害・設定"
}},
"severity": {"type": "score", "criteria": ["軽微", "重大", "致命的"]}
}
}HOSTED OR LOCAL
重みは公開、実行環境ごとに対応が違う
公式HFはApache 2.0で配布。Workers AIのホスト版に加え、Ollama公式ライブラリにもClefの掲載があります。
- Hugging Face:公式の重みと独自の判定head、利用コードを確認できます。
- Workers AI:ホスト版の仕様・入力上限・料金をDocsで確認できます。
- llama.cpp:PR #29831は確認時点でOpen。text-only対応案で、visionは未対応です。
INPUT TOKEN PRICING
入力単価はClef $0.24、flash $0.09
100万入力tokensあたりの掲載単価です。JevはTypeSafe公式記事の価格を並べています。
| モデル | 入力100万tokens | 掲載元 |
|---|---|---|
| Clef | $0.24 | Workers AI Docs |
| Clef-flash | $0.09 | Workers AI Docs |
| Jev | $0.042 | TypeSafe公式記事 |
FINE-TUNING AND ADOPTION
RL支援はFDE伴走から始まる
Cloudflareは、用途に合わせてClefを調整するFDEチームの支援を開始すると説明しています。セルフサービスの学習・再デプロイ環境は、その後に提供する計画です。
- 試す業務:実際の判定を1種類選び、正解ラベルを人が確認する。
- 比較:Clef・flash・既存手段で、同じ入力と合格条件を使う。
- 運用:誤判定の損失、遅延、人への引継ぎ率、総コストを記録する。
コピー後に [ ] を書き換えてください。編集部の評価用ひな形です。