トークン課金とは。入力・出力・キャッシュの単価と、請求が膨らむ6か所
出力単価は入力の約5倍、キャッシュ読み取りは0.1倍。ツール定義だけで6600トークン、トークナイザ変更で約30%増。公式の計算例を使って月額を自分で検算する手順と、見積書で確認する5点をまとめます。
AI 開発の見積書で、いちばん検算しにくい行は「AI 利用料」である。初期費用は人の工数だから単価 × 人月で追える。だが運用費の中身はトークン課金で、仕組みを知らないと「月 15 万円」と書かれていても高いのか安いのか判断できない。
トークン課金は難しい計算ではない。ただし単価が 1 つではない。入力・出力・キャッシュ書き込み・キャッシュ読み取りで単価が違い、さらにツール定義や推論先の指定で金額が動く。この記事では、発注側が見積書を検算するために必要な範囲だけを整理する。

トークンとは何か
AI が文章を処理する最小単位である。単語より細かいことも、単語 1 つ分のこともある。
公式ドキュメントの説明はこうなっている。
- Google: 「Gemini のモデルでは、1 トークンは約 4 文字に相当する。100 トークンは英語の 60〜80 単語にあたる」
- Anthropic: 「おおよその目安として、1 トークンは英語で約 4 文字、または 0.75 単語。正確な数は言語と内容の種類によって変わる」
重要なのは後半である。「言語と内容によって変わる」と提供元自身が書いている。 日本語と英語で同じ内容を書いたときのトークン数は一致しない。そのため、日本語で何文字が何トークンかを一般的な比率で断定するのは危険である。
では、どう測るのか。方法は 1 つで、API のトークン計測機能を使う。
| 方法 | 何ができるか |
|---|---|
| トークン数え(count_tokens / token counting エンドポイント) | 送る前に、その文章が何トークンかを確認する |
レスポンスの usage フィールド |
実際に請求された内訳(入力・出力・思考・キャッシュ・ツール利用)を確認する |
見積書を検算するには、実際に使う日本語の文章サンプルで計測した数字が必要になる。「1 件あたり約 2,000 トークン」という前提が見積書に書かれていれば、それがどのサンプルで測った数字なのかを聞ける。コンテキスト長という別の制約についてはコンテキスト長とはで整理した。
単価は 1 つではない。5 つの枠がある
ここが見積書の読み方を左右する。公表されている料金表は、同じモデルでも枠ごとに単価が違う。
| 枠 | 何に対して課金されるか | 標準の単価感 |
|---|---|---|
| 入力 | 送った文章・データ | 基準 |
| 出力 | AI が返した文章 | 入力の約 5 倍が一般的 |
| キャッシュ書き込み | 繰り返し送る前提文を保存する | 入力の 1.25 倍(5 分保持)/ 2 倍(1 時間保持) |
| キャッシュ読み取り | 保存済みの前提文を再利用する | 入力の 0.1 倍(一部モデルは 0.05 倍) |
| 推論先の指定 | 特定地域内での処理を指定する | 全枠に 1.1 倍 |
公表されている実際の単価を並べると、出力が高いことがはっきり分かる(いずれも 100 万トークンあたり・米ドル)。
| モデル | 入力 | 出力 | キャッシュ読み取り |
|---|---|---|---|
| Claude Haiku 4.5 | 1.00 | 5.00 | 0.10 |
| Claude Sonnet 5.5 | 2.00 | 10.00 | 0.20 |
| Claude Opus 5.5 | 4.00 | 20.00 | 0.20 |
| Gemini 3.5 Flash-Lite | 0.30 | 2.50 | — |
| Gemini 3.5 Flash | 1.50 | 9.00 | — |
出力単価が入力の 5 倍前後という構造は、設計への示唆が 1 つある。AI に長く答えさせる仕様は、そのまま費用になる。 「丁寧に説明させる」「根拠を全部書かせる」は要件としては妥当だが、月額に跳ね返る。
もう 1 つ、まとめ処理には別の単価がある。即時の応答が不要な処理を非同期で流す仕組み(Batch API)では、入力・出力ともに 50% 引きと公表されている。夜間にまとめて処理できる業務なら、ここで半額になる。見積書に「リアルタイム処理」と書かれているとき、本当にリアルタイムが要るのかは発注側が決める論点である。
請求が膨らむ 6 か所
単価表だけ見ていると見落とす場所がある。公式ドキュメントに金額やトークン数が明記されているものだけを挙げる。
1. 会話履歴が毎回入力に乗る
対話型の機能では、ターンごとにそれまでの全履歴が入力として再送される。10 往復目の入力トークンは 1 往復目の数倍になる。件数ではなく「1 会話あたりの合計トークン」で見積もる必要がある。
2. ツールの定義そのものにトークンがかかる
AI に外部システムを操作させる場合、ツールの名前・説明・引数の定義が毎リクエストの入力に含まれる。公表されている数字では、ツールを 1 つ以上渡した時点で加わるシステムプロンプトが Claude Sonnet 5.5 で 286 トークン、さらに個別のツール定義が積まれる。
- テキスト編集ツールの定義: 約 700 トークン
- シェル操作ツールの定義: 244〜325 トークン
- 画面操作のツール群(既定構成): 約 4,500 トークン
- ブラウザ操作のツール群(既定構成): 約 6,600 トークン
ブラウザ操作を入れるだけで、1 リクエストの入力が 6,600 トークン増える。月 10 万件なら 6.6 億トークンである。「できることを増やす」と固定費的に入力が増える。
3. 取り込むファイル・Web ページの量
外部の文書を読ませる機能では、読ませた分がそのまま入力トークンになる。公式ドキュメントに載っている目安は次のとおりである。
| 対象 | おおよそのトークン数 |
|---|---|
| 一般的な Web ページ(10 kB) | 約 2,500 |
| 大きな文書ページ(100 kB) | 約 25,000 |
| 研究論文の PDF(500 kB) | 約 125,000 |
PDF を 1 本読ませるだけで 12 万トークン。何を読ませるかの絞り込みが、そのまま費用の設計になる。 RAG でチャンク分割の設計が費用に効く理由はここにある(チャンク分割とは)。
4. サーバー側のツールは別課金
トークンとは別枠で請求が立つものがある。公表されている例では、
- Web 検索: 1,000 回あたり 10 ドル(+検索結果が入力トークンとして課金される)
- コード実行: 1 組織あたり月 1,550 時間まで無償、超過分は 1 コンテナ 1 時間あたり 0.05 ドル(実行時間は最低 5 分から計上)
- セッションの実行時間: 1 セッション時間あたり 0.08 ドル(待機中は計上されない)
見積書の「AI 利用料」が 1 行しかない場合、この枠が入っているかどうかは分からない。トークン費と別に行を立てさせるのが安全である。
5. 推論先を限定すると全枠が 1.1 倍
データを特定の地域内で処理するよう指定すると、入力・出力・キャッシュ書き込み・キャッシュ読み取りのすべてに 1.1 倍がかかると公表されている。データの持ち出し制約がある案件では避けられない費用だが、見積書の単価がどちらの前提かで月額が 10% 変わる。外部へ出してよいデータの線引きはAI開発で外部APIに送ってよいデータの決め方にある。
6. トークナイザの変更で、同じ文章のトークン数が変わる
これは知らないと説明がつかない現象である。公式ドキュメントには、新しい世代のモデルが新しいトークナイザを採用しており、同じ文章で約 30% 多いトークンを生むと明記されている。
つまり、単価が同じでもモデルを新しくすると請求が増えうる。「単価据え置きで最新モデルに移行します」という説明を受けたときは、トークン数が変わらない前提なのかを確認する必要がある。モデル名が前提を固定しない構造についてはDeepSeekが9月14日の提供終了を撤回でも扱った。
月額の出し方
計算式は単純である。
月額 = 月間件数 × 1 件あたりの(入力トークン × 入力単価 + 出力トークン × 出力単価)
+ サーバー側ツールの費用
+ 実行環境の時間課金
公式ドキュメントに載っている計算例を 2 つ引く。前提つきの実数なので、自社の試算の型として使える。
例 1: 1 時間の作業セッション 1 回(入力 5 万トークン・出力 1.5 万トークン、入力単価 5 ドル・出力単価 25 ドル)
| 項目 | 計算 | 金額 |
|---|---|---|
| 入力 | 50,000 × 5 ÷ 1,000,000 | 0.25 ドル |
| 出力 | 15,000 × 25 ÷ 1,000,000 | 0.375 ドル |
| 実行時間 | 1.0 時間 × 0.08 | 0.08 ドル |
| 合計 | 0.705 ドル |
同じ処理で、入力 5 万のうち 4 万がキャッシュ読み取りになった場合は 0.525 ドル。キャッシュが効くと 25% 下がるという例である。
例 2: 問い合わせ 1 万件の処理(1 会話あたり平均約 3,700 トークン、入力単価 1 ドル・出力単価 5 ドル)→ 合計およそ 37 ドル
1 万件で 37 ドル(約 5,500 円)である。トークン単価そのものは、多くの業務システムでは人の工数より小さい。だからこそ、運用費が月数十万円になる見積書では、その金額のどこまでがトークン費で、どこからが保守の人件費なのかを分けて見る必要がある。運用費の内訳はAIシステムの運用費・ランニングコストに整理した。
見積書で確認する 5 点
- 1 件あたりの入力・出力トークン量と、その測り方。 「実際の日本語サンプルで計測した」と言えるか
- 月間件数の前提。 ピーク時と平常時の両方で試算されているか
- キャッシュを使う前提か。 使うなら、何をキャッシュに乗せるのか
- サーバー側ツールの費用が別行になっているか。 検索・コード実行・実行時間
- 単価の有効期限。 導入価格・期間限定価格が使われていないか(Gemini Flashの単価が2027年1月に2倍へ)
この 5 点は条件として書き出せるので、複数社に同じ文面で聞ける。無料で相見積もりの案件票では、処理件数・データ量・外部連携・精度要件を選択式で揃えている。同じ条件を渡せば、各社が「どのモデルで、どの単価で、何トークンの前提で」月額を出したのかを横並びで比べられる。すでに見積書を受け取っているなら、見積書チェックで前提が書かれていない項目を洗い出せる。
まとめ
トークン課金は、単価表を見るだけでは検算できない。入力・出力・キャッシュで単価が分かれ、ツール定義や取り込む文書の量で入力が増え、検索や実行環境は別枠で請求が立つ。トークナイザが変われば、同じ文章でもトークン数が動く。
発注側が押さえる順番は 3 つでよい。(1) 1 件あたりのトークン量を実際のサンプルで測る → (2) 月間件数を掛ける → (3) トークン費以外の枠を別行で出させる。 この 3 つが揃えば、月額は自分で検算できる。
検算できる見積書は、比較できる見積書である。単価の安さを競うより、前提が書かれているかどうかを先に見るほうが、結果として費用を外さない。モデルごとの単価と制約の比べ方は主要LLM APIの選び方、料金体系の全体像はAI APIの料金体系と月額の試算方法にまとめている。
AI開発の見積もりを、同じ条件で比べる。
条件を整理した 1 枚の案件票で複数のAI開発会社に依頼。初期費用だけでなく、データ整備・API 費・精度検証・保守・権利まで同じ列で比較できます。