AI開発コネクト
AI最新ニュースClaude・Anthropic

Claude Opus 5.5が単価2割減。思考を止められない仕様で運用費の前提が変わる

2026年9月22日公開。入力・出力とも20%、キャッシュ読み取りは60%下がりました。一方で思考を無効化できずtool_choiceも制限。単価ではなく想定トークン数を見積書で確認する3点を整理します。

公開: 2026.09.25 / 更新: 2026.09.25

AI開発の見積書で運用費を計算するとき、使う式はどの会社もほぼ同じである。単価 × 想定トークン数 × 想定件数。このうち発注側が確認しやすいのは単価だけで、残りの 2 つは開発会社の見立てに任せていることが多い。

2026 年 9 月 22 日に公開された新しい上位モデルは、その「単価は下がったが、トークン数は読みにくくなった」という形をしている。単価だけを見て見積もりを比べると、判断を間違える。

2つの計量皿と、蓋の外された歯車箱

公表されている事実

Anthropic は 2026 年 9 月 22 日、Claude Opus 5.5(モデル ID claude-opus-5-5)を公開した。同社の API リリースノートと料金ページに載っている内容は次のとおりである。

項目 Claude Opus 5 Claude Opus 5.5
入力(100万トークン) $5.00 $4.00
出力(100万トークン) $25.00 $20.00
キャッシュ読み取り $0.50(入力の 0.1 倍) $0.20(入力の 0.05 倍)
5分キャッシュ書き込み $6.25 $5.00
1時間キャッシュ書き込み $10.00 $8.00
バッチ(入力/出力) $2.50 / $12.50 $2.00 / $10.00
Fast mode(入力/出力) $10.00 / $50.00 $8.00 / $40.00

入力・出力はいずれも 20% 下がり、キャッシュ読み取りは 60% 下がっている。コンテキスト長は 100 万トークン、最大出力は 12.8 万トークン。提供先は Claude API のほか、Amazon Bedrock、Claude Platform on AWS、Google Cloud、Microsoft Foundry である。

ここまでは素直な値下げに見える。問題は同じリリースノートに並んでいる、仕様の変更のほうである。

  • 思考(thinking)を無効化できない。 thinking: {"type": "disabled"} を指定するとエラーになる
  • tool_choice は auto のみ。 any と tool はエラーになる
  • コンピュータ操作を使う場合は新しい computer_toolset_20260801 が必要

論点 1. 「出力トークン」の下限が上がった

単価表で見落とされやすいのは、出力の単価が入力の 5 倍であるという点である。Opus 5.5 なら入力 $4 に対して出力 $20。運用費の総額は、出力トークンが何トークン出るかでほぼ決まる。

そして思考を止められないということは、1 回の応答に必ず思考分の出力トークンが乗るということである。従来は「簡単な分類処理なので思考は切って、答えだけ返させる」という組み方ができた。このモデルではそれができない。

どのくらい効くかを、単価だけ見た場合と比べてみる。入力 1 万トークンの処理を 1 回動かすとする。

前提 入力 出力 1回あたり
Opus 5・思考なしで出力 2,000 トークン $0.050 $0.050 $0.100
Opus 5.5・思考込みで出力 6,000 トークン $0.040 $0.120 $0.160

単価は 2 割下がっているのに、出力トークンが 3 倍になれば 1 回あたりは 6 割高くなる。月 10 万回動かす業務なら、月額は 1 万ドルから 1 万 6 千ドルへ動く計算になる。

念のため書いておくと、この出力トークン数は筆者が置いた仮定であり、公表値ではない。思考が何トークン出るかは処理の内容によって変わる。ここで言いたいのは「6 割高くなる」という結論ではなく、単価が 2 割下がったという事実だけでは、運用費が下がるとも上がるとも言えないということである。

論点 2. 「想定トークン数」は誰が決めているか

そうなると、見積書で確認すべき場所が変わる。単価は公開情報なので、どの会社が出しても同じ数字になる。差がつくのは想定トークン数のほうで、こちらは公開情報ではない。

見積書に「月額運用費 45 万円」とだけ書いてある場合、その裏側には少なくとも次の 4 つの仮定が置かれている。

  1. 1 リクエストあたりの入力トークン数
  2. 1 リクエストあたりの出力トークン数(思考分を含むか)
  3. 月あたりのリクエスト件数
  4. キャッシュがどれだけ効くか(読み取り単価は書き込みの 25 分の 1 になる)

この 4 つが書かれていない運用費は、比較のしようがない。 3 社の見積もりが月額 30 万・45 万・80 万円と並んでいても、1 社だけ件数を半分で見ていれば、安いのは実力ではなく仮定の差である。この論点はAI開発の見積書の読み方でも整理した。

料金表の側にも、同じ単価で幅を生む区分がある。バッチ処理なら入力・出力とも半額、Fast mode なら 2 倍。Opus 5.5 で言えばバッチの入力 $2.00 から Fast mode の出力 $40.00 まで並んでいる。提供形態によって単価が何倍も動く構造は、OpenAIがGPT-6 Sol・Lunaを公開でも同じだった。

論点 3. 移行は「モデル名の差し替え」では終わらない

もう 1 つ、保守費に効く話がある。tool_choice の any と tool がエラーになるという変更である。

この 2 つは「必ずどれかのツールを呼べ」「このツールを呼べ」とモデルに強制する指定で、出力の形を固定したい処理でよく使われる。帳票から項目を抜き出す、問い合わせを分類する、といった用途である。ここを auto(呼ぶかどうかはモデルが決める)に変えると、ツールを呼ばずに文章で返してくる場合の処理を作り足す必要が出てくる。

つまり新しいモデルへの乗り換えは、設定ファイルのモデル名を 1 行書き換えて終わり、とはならない。動作確認と、場合によっては後処理の作り直しが要る。 料金表だけを見て「新しいほうが安いので切り替えます」と言われたときは、切り替え作業そのものの工数がどこに計上されているかを聞いたほうがよい。モデル名を指定しても前提が固定できない件は、DeepSeekが9月14日の提供終了を撤回でも触れた。

なお料金ページには、トークン数そのものについての注記もある。Claude 4.7 以降のモデルは新しいトークナイザを使っており、同じ文章でも従来より約 30% 多いトークンが出る(Sonnet 4.6 以前は従来のトークナイザ)。世代をまたぐ乗り換えでは、単価とトークン数の両方が動くことになる。

発注者・企業への影響

ここからは見立てである。

1 つ目。運用費の見積もりは、単価表ではなく仮定の突き合わせになると考えられる。 単価が四半期ごとに動く状況では、契約時点の単価で固定した月額はすぐ実態と合わなくなる。むしろ「1 件あたり何トークンを見込んでいるか」を見積書に書かせ、稼働後の実測と突き合わせて精算する形のほうが、双方にとって無理がない。

2 つ目。「思考する分は出力として課金される」という前提は、今後の標準になる可能性がある。 思考を常時有効にするモデルは Opus 5.5 だけではない。応答の質を上げる方向と、出力トークンを減らす方向は正面から衝突するため、「速くて安い」と「よく考える」は同じ設定では両立しないと見ておいたほうがよい。要件定義の段階で、処理ごとにどちらを取るかを決めておく必要がある。

3 つ目。モデルの選定を発注先に任せきりにしない。 ただし発注側が特定のモデル名を指定するのも得策ではない。半年で世代が変わる。指定すべきはモデル名ではなく、応答時間の上限・1 件あたりのコスト上限・精度の合格ラインの 3 つである。この 3 つが満たせるなら、どのモデルを使うかは開発会社の裁量でよい。

見積もりで確認する 3 点

  • 運用費の内訳に、1 リクエストあたりの入力・出力トークン数と月間件数が書かれているか
  • 出力トークンの見込みに、思考の分が含まれているか
  • モデルを乗り換えるときの動作確認・改修の工数が、保守費のどこに入っているか

同じ条件で複数社に出せば、この 3 点は自然に比較できる。条件をそろえた案件票で相見積もりを取りたい場合は無料の相見積もりから始められる。

まとめ

上位モデルの単価は 2 割下がり、キャッシュ読み取りは 6 割下がった。一方で思考は止められなくなり、出力トークンの下限は上がった。値下げの分がそのまま運用費の値下げになるとは限らない。

見積書で読むべきは単価ではなく、その隣に書かれていない想定トークン数のほうである。

参考・出典

AI開発の見積もりを、同じ条件で比べる。

条件を整理した 1 枚の案件票で複数のAI開発会社に依頼。初期費用だけでなく、データ整備・API 費・精度検証・保守・権利まで同じ列で比較できます。

無料で相見積もりを始める →
無料で相見積もり30秒で費用診断