文章を書かないAIが同日に2本公開。判定だけで入力100万トークン9セント
10月1日にCloudflareのClefとStrands Decider 2Bが公開。選択肢に確率を返すだけで出力課金が消え、月50万件の分類で1000ドル超の差が出ます。しきい値を検収条件に書く方法まで整理します。
AI の費用の話は、ほぼいつも「生成」の費用の話だった。文章を作らせ、出力トークンに課金される。だが業務システムの中で AI がやっていることの多くは、作文ではなく判定である。この問い合わせはどの部署か。この申請は差し戻すか。この画像は不良か。
2026 年 10 月 1 日、文章を書かないモデルが同じ日に 2 つ公開された。Cloudflare の Clef / clef-flash、Strands Agents の Strands Decider 2B。どちらも自由な文章を生成せず、あらかじめ決めた選択肢に確率を返すことだけをする。
発注側に効くのは 2 点である。判定の単価が桁で変わることと、確率が返ることで検収条件が書けるようになること。

公表されている事実
Cloudflare の Clef / clef-flash(2026 年 10 月 1 日)
| 項目 | Clef | clef-flash |
|---|---|---|
| ベースモデル | Qwen 3.8-27B | Qwen 3.5-9B |
| コンテキスト長 | 65,536 トークン | 65,536 トークン |
| 入力単価 | 100 万トークンあたり 0.24 ドル | 100 万トークンあたり 0.09 ドル |
| 応答時間(中央値) | 209.3 ms | 38.8 ms |
| 応答時間(p95) | 238.6 ms | 122.4 ms |
| ライセンス | Apache 2.0(Hugging Face で公開) | Apache 2.0(同) |
- 状態(state)をテキスト・JSON・画像・動画で受け取り、型付きの質問のスキーマに対して、許可された選択肢ごとに確率を返す。質問の型は boolean(yes/no)・choice(N 択)・score(順序尺度)
- 画像は 1 リクエストに 4 枚まで(PNG / JPEG / WebP)。ビジョンエンコーダを備える
- Cloudflare は Workers AI 上でホストし、あわせて Clef を強化学習で追加学習させる支援を提供するとしている。当初は担当エンジニアが入る個別対応で、将来のセルフサーブ化が計画段階
Strands Agents の Strands Decider 2B(2026 年 10 月 1 日)
- 20 億パラメータ。
Qwen3.5-2B-Baseに LoRA アダプタを当て、言語モデルのヘッド(文章を出す部分)を外して、選択肢を採点する小さな読み出しヘッドに置き換えている - 質問の型は bool・choice・score の 3 つ。各回答に校正済みの確信度が付く
- 応答時間は Nvidia RTX 3090 で小さなタスクの中央値およそ 115 ms、M3 MacBook の CPU でおよそ 153 ms。タスクの大きさにほぼ比例して伸びる
- JevBench の公開セットで 2B クラス 33 件中 3 位、2B をわずかに超えるモデルを除くと 30 件中 1 位。easy 区分は 100% 正解
- 重み・学習データ・学習スクリプトがすべて公開されている(重みは Hugging Face、コードと学習データは GitHub)
- 想定用途として、モデルの振り分け、ツールの選択、引数の検査、トリアージ、ガードレール、評価、記憶・文脈の管理、ポリシーの分類が挙げられている
ここまでが事実である。以下は見立てになる。
論点 1. 判定だけなら、出力側の課金がほぼ消える
生成モデルで分類させる設計では、入力と出力の両方に課金される。しかも出力単価は入力の数倍に設定されているのが普通である。
公表されている単価を並べると差がはっきりする。
| モデル | 入力(100 万トークン) | 出力(100 万トークン) |
|---|---|---|
| clef-flash(判定専用) | 0.09 ドル | 選択肢への確率を返す(生成しない) |
| Clef(判定専用) | 0.24 ドル | 同上 |
| Gemini 3.5 Flash-Lite | 0.30 ドル | 2.50 ドル |
| Claude Haiku 4.5 | 1.00 ドル | 5.00 ドル |
| Strands Decider 2B | 自社環境で実行(重みは無償配布) | 同上 |
判定の答えは「A か B か C か」と確率である。返ってくるトークン数はごく小さい。つまり単価表のいちばん高い列を使わなくて済む。
同じ処理を比べてみる。1 件あたり入力 2,000 トークン・出力 100 トークンの分類を月 50 万件回す場合、入力は合計 10 億トークンになる。
- clef-flash: 10 億 × 0.09 ドル / 100 万 = 約 90 ドル
- Claude Haiku 4.5: 入力 10 億 × 1.00 ドル / 100 万 + 出力 5,000 万 × 5.00 ドル / 100 万 = 約 1,250 ドル
月額で 1,000 ドル超の差が出る。為替 150 円なら月 17 万円、年 200 万円規模である。運用費の月額が見積書の争点になる案件では、この差は PoC の設計段階で効く。
ただし条件がある。判定専用モデルは文章を書けない。 要約・返信文の作成・説明の生成は従来どおり生成モデルが要る。だから設計の作業は「安いモデルに替える」ではなく、要件を「判定」と「生成」に切り分けることになる。切り分け方の考え方はAI APIの料金体系と月額の試算方法と主要LLM APIの選び方にまとめた。
論点 2. 確率が返るなら、しきい値と「人に回す割合」を契約に書ける
実務でより大きいのは、価格よりこちらだと考えられる。
両モデルは「A です」ではなく「A が 0.82、B が 0.15、C が 0.03」を返す。これは検収条件の書き方を変える。
生成モデルに「分類してください」と頼むと、返ってくるのはラベルだけである。自信があるのか迷っているのかが分からないため、全件を人が確認するか、全件を無検査で通すかの二択になりやすい。
確率が返るなら、途中を設計できる。
| しきい値の設計 | 挙動 | 費用への効き方 |
|---|---|---|
| 0.9 以上は自動確定 | 高確度だけ自動化 | 人の工数が減る量が読める |
| 0.5〜0.9 は人へ回す | 迷った分だけ確認 | 人に回る割合が見積もれる |
| 0.5 未満は保留・差し戻し | 判定しない | 誤処理の責任範囲が切れる |
ここで決まるのは「AI が何%正しいか」ではなく、「人が何%見ることになるか」である。後者は人件費に直結するので、発注側が決めるべき数字になる。コールセンターの応対品質評価を題材にした試算は【モデルケース】コールセンターの応対品質評価をAIでで扱った。考え方はそのまま使える。
注意点として、「校正済みの確信度」という表現は確率の目盛りが実際の正解率と合っているという主張である。自社のデータでも合っているかは別途測る必要がある。確率 0.9 の判定が実際に 9 割当たるのかを、自社の未公開データで確認する工程を見積書に入れてもらうのが安全だと考えられる。
論点 3. 重みが公開されていることは、データ制約のある案件の選択肢になる
Strands Decider 2B は重み・学習データ・学習スクリプトが公開されており、自社環境で動かせる。RTX 3090 クラスの GPU で 115 ms、M3 MacBook の CPU でも 153 ms という数字は、判定を外部 API に出さずに済む可能性を示している。
Clef / clef-flash も Apache 2.0 で Hugging Face に公開されている一方、Cloudflare の提示する単価は同社のホスティング上での従量課金である。自社で動かすか、ホスティングを使うかで費用の形が変わる(固定費か従量課金か)。損益の分かれ目の計算はAI APIの利用と自社構築に整理した。
もう 1 点、見落ちやすい事実を書いておく。3 つのモデルはいずれもベースが Qwen 系のオープンウェイトである。 ライセンス上は商用利用が可能だが、発注側が確認すべきなのは「どこで推論するか」である。
- 自社環境で動かす場合: データは外に出ない。確認すべきはライセンス条項と、学習データの由来に関する表明
- ホスティングを使う場合: 推論が行われるリージョンと、入力データの保存・学習利用の扱い
ベースモデルの出自と、推論先・データの扱いは別の問題である。外部へ出してよいデータの線引きはAI開発で外部APIに送ってよいデータの決め方で 4 区分に分けた。
発注者・企業への影響
第一に、要件を「判定」と「生成」に分けて見積もりを取る。1 つの機能の中に両方が混ざっていることが多い。分けて書くだけで、どこが安くできる部分なのかが見える。
第二に、月額の試算を 1 件あたりのトークン量から出させる。「AI 利用料 月 10 万円」という 1 行だけの見積書は検算できない。件数 × 1 件あたりの入力トークン × 単価、という形で書いてもらう。
第三に、しきい値と「人に回す割合」を要件に書く。確率を返すモデルを使うなら、自動確定・人の確認・保留の 3 区分と、それぞれの想定割合を発注側が決める。ここが決まっていないと、運用に入ってから人の工数が膨らむ。
第四に、確率の正しさを自社データで測る工程を入れる。ベンチマークの順位は参考値である。自社の過去データ数百件で、確率と実際の正解率が合っているかを見る。この工程は PoC の中に置けるので、本開発の前に費用を切れる。
第五に、新しい選択肢が出たことを理由に、既存の見積もりを値切る材料にはしない。単価が下がっても、設計・評価・運用の工数は残る。判定部分の API 費用が下がることと、案件の総額が下がることは別である。安くできる部分と削ってはいけない部分の切り分けは「AIで安くできます」の見積書を点検する5工程にまとめた。
まとめ
判定だけをするモデルが同じ日に 2 つ出たことは、AI の使い方が「何でも生成モデルに聞く」段階から一段進んだことを示していると考えられる。安い理由は賢くなったからではなく、やらないことを決めたからである。文章を作らないので出力課金が消え、選択肢を固定するので確率が返る。
発注側がここから取れるものは 2 つある。判定部分の運用費を下げる余地と、確率を使って「人が何%見るか」を契約に書けるようになること。後者のほうが長く効く。
無料で相見積もりの案件票では、処理件数・精度要件・データを外部に出せるかどうかを選択式で揃えている。同じ条件を各社に渡せば、「判定を何で処理する想定なのか」を横並びで比べられる。
参考・出典
- Cloudflare「Introducing Clef: our open-source decision models, and new RL fine-tuning platform」(2026 年 10 月 1 日) https://blog.cloudflare.com/clef-decision-models/
- Cloudflare Workers AI ドキュメント「clef」「clef-flash」(単価・コンテキスト長・入力形式) https://developers.cloudflare.com/workers-ai/models/clef/ / https://developers.cloudflare.com/workers-ai/models/clef-flash/
- Strands Agents「Introducing Strands Decider 2B: a small, open source, decision model」(2026 年 10 月 1 日) https://strandsagents.com/blog/introducing-strands-decider/
- Hugging Face「StrandsAgents/strands-decider-2B-hobson-v19」 https://huggingface.co/StrandsAgents/strands-decider-2B-hobson-v19
- Google「Gemini Developer API pricing」(比較に用いた単価) https://ai.google.dev/gemini-api/docs/pricing
- Anthropic「Pricing」(比較に用いた単価) https://platform.claude.com/docs/en/about-claude/pricing
AI開発の見積もりを、同じ条件で比べる。
条件を整理した 1 枚の案件票で複数のAI開発会社に依頼。初期費用だけでなく、データ整備・API 費・精度検証・保守・権利まで同じ列で比較できます。