Cloudflare Clef / 10章で読む

DAILY AI BRIEFING

判定モデルが開いた。
文章を書かず、98.8%で選ぶ98.8%は Clef-flash の BFCL case exact accuracy 98.76%を丸めた値。Cloudflareの自社評価で、総合精度ではありません。

推論をホストするCloudflareが、判定用モデルClefとClef-flashの重みを公開しました。状態と選択肢を渡すと、それぞれの確率を返す仕組みです。10/1の公式発表を10/2版で整理し、強いタスクと苦手なタスク、導入条件を分けて読みます。

対象ニュース日:2026-10-02 JST公式発表:2026-10-01一次情報確認・制作:2026-10-03 JST
98.8%
flash の BFCLcase exact accuracy 98.76%の丸め・自社評価
27B / 9B
2つの判定モデルClef / Clef-flash
38.8 ms
flash の中央値Cloudflareの測定条件内・API保証ではない
Apache 2.0
重みを公開Hugging Faceで配布
$0.09
flash の入力単価100万入力tokensあたり・総コストとは別

ONE-PAGE BRIEF

この1枚で、本号の要点を読む

数値の条件と詳しい説明は下の各章に記載。画像を押すと拡大できます。

本号の要点を画像化。公式画面のスクリーンショットではありません。 画像を原寸で開く

THE ANNOUNCEMENT

Cloudflareが公開した、判定用の重み

10/1、CloudflareはClefとClef-flashを発表。Workers AIでホストし、Hugging FaceにApache 2.0で重みを公開しました。

見出しの98.8%は、Clef-flashのBFCL case exact accuracy 98.76%を丸めた値です。Cloudflareの自社評価で、すべての判定に共通する精度ではありません。

STATE AND CHOICES

状態を読み、許可した選択肢に確率を返す

入力は状況を表すstateと、型を持つ質問のquestions。モデルは各質問の許可された選択肢をまとめて評価します。

返すのは選択肢ごとの確率。文章を1tokenずつ生成する手順を省き、コードで分岐や担当振り分けに使える出力を作ります。

  • 問い合わせをどの担当へ送るか。
  • 緊急度を何段階に分けるか。
  • 確信が低い判定を、人の確認へ回すか。

TWO MODEL SIZES

Clefは27B、flashは9B

ClefはQwen3.8-27B、Clef-flashはQwen3.5-9Bを基に追加学習しています。公式仕様はテキスト・JSONに加え、画像と動画も入力対象としています。

Clefは27B、flashは9B
仕様ClefClef-flash
モデル規模27B9B
基盤モデルQwen3.8-27BQwen3.5-9B
Workers AI context65,536 tokens65,536 tokens

WHERE THEY SCORE WELL

道具の選択と分類で高いスコア

公式記事の代表値を、同じ列順で比較します。BFCLと家電シミュレーターではflash、BANKING77ではClefが高い値を示しました。

道具の選択と分類で高いスコア
指標(%)ClefflashJev
BFCL / case exact accuracy98.4798.7695.75
家電 / case exact accuracy82.9597.7352.27
BANKING77 / macro-F194.2090.9379.74

LATENCY UNDER THE TEST

flashの中央値は38.8 ms

Cloudflareは評価群でのrequest latencyを掲載。flashは中央値38.8 ms、p95は122.4 msでした。p95は遅い側も含めて読むための値です。

flashの中央値は38.8 ms
遅延(ms)ClefflashJev
中央値209.338.8524.1
p95238.6122.4536.0

THE LOSING METRICS

Jevが上回るタスクも残る

When2CallとBRIGHTはJevが上回ります。公式HFのGPQA Diamondでも差があり、選択式の課題すべてでClefが優位とは言えません。

Jevが上回るタスクも残る
指標(%)ClefflashJev
When2Call / accuracy72.3765.5880.97
BRIGHT / nDCG@1045.9139.2647.52
GPQA Diamond / accuracy48.051.078.3

A TYPED REQUEST

noul・choice・scoreで質問を定義

APIはJev / SystemOne互換。noulはtrueの確率、choiceは選択と選択肢ごとの確率、scoreは順序のある候補に基づく期待スコアを返します。

下は依頼を振り分けるための説明用入力例です。実測結果や確率の架空値は載せていません。

{
  "model": "clef-flash",
  "state": "決済時にエラーが出て、注文を完了できない。",
  "questions": {
    "urgent": {"type": "noul", "instructions": "緊急の対応が必要か"},
    "team": {"type": "choice", "criteria": {
      "billing": "請求・返金", "technical": "障害・設定"
    }},
    "severity": {"type": "score", "criteria": ["軽微", "重大", "致命的"]}
  }
}

HOSTED OR LOCAL

重みは公開、実行環境ごとに対応が違う

公式HFはApache 2.0で配布。Workers AIのホスト版に加え、Ollama公式ライブラリにもClefの掲載があります。

  • Hugging Face:公式の重みと独自の判定head、利用コードを確認できます。
  • Workers AI:ホスト版の仕様・入力上限・料金をDocsで確認できます。
  • llama.cpp:PR #29831は確認時点でOpen。text-only対応案で、visionは未対応です。

INPUT TOKEN PRICING

入力単価はClef $0.24、flash $0.09

100万入力tokensあたりの掲載単価です。JevはTypeSafe公式記事の価格を並べています。

入力単価はClef $0.24、flash $0.09
モデル入力100万tokens掲載元
Clef$0.24Workers AI Docs
Clef-flash$0.09Workers AI Docs
Jev$0.042TypeSafe公式記事

FINE-TUNING AND ADOPTION

RL支援はFDE伴走から始まる

Cloudflareは、用途に合わせてClefを調整するFDEチームの支援を開始すると説明しています。セルフサービスの学習・再デプロイ環境は、その後に提供する計画です。

  • 試す業務:実際の判定を1種類選び、正解ラベルを人が確認する。
  • 比較:Clef・flash・既存手段で、同じ入力と合格条件を使う。
  • 運用:誤判定の損失、遅延、人への引継ぎ率、総コストを記録する。

コピー後に [ ] を書き換えてください。編集部の評価用ひな形です。

本号の要点画像
本号の要点画像

Escキーで閉じます。原寸表示では縦横にスクロールできます。