Gemini 4 Argonは限定提供から。使えないモデルを前提にした見積書で聞く4点
9月30日公開のGemini 4 Argonは一部の防御側利用者から段階提供で、一般提供日は未公表です。出力上限100万トークン、入力2ドル・出力10ドル。提供状態を見積書に書かせる理由と確認4点を整理します。
見積書の「最新モデルを使います」という一行は、そのモデルが今日使えるかどうかを保証しない。
2026 年 9 月 30 日、Google が Gemini 4 Argon を公開した。ソフトウェア開発・法務や財務の知識労働・サイバー防御を対象に据えた最上位モデルで、出力の上限が 100 万トークンまで引き上げられている。ただし提供の始まりは一般公開ではない。Fairwind Program を通じた「信頼できるサイバー防御の担い手」への段階的な提供から始まり、そこから開発者・企業・一般利用者へ広げるとされている。
発注側にとっての論点は性能ではない。**「見積書に書かれたモデルは、契約時点で自社が使えるのか」**である。

公表されている事実
Google の発表(2026 年 9 月 30 日)に書かれている内容だけを並べる。
| 項目 | 内容 |
|---|---|
| 公開日 | 2026 年 9 月 30 日 |
| 対象領域 | 実務のソフトウェア開発、法務・財務などの知識労働、サイバー防御 |
| 出力上限 | 100 万トークン(従来の 64K から引き上げ) |
| 提供の開始 | Fairwind Program を通じた一部の防御側利用者へ段階提供。米政府の自主的な事前リリース手続きに沿って順次拡大 |
| その次の提供先 | 有料 API 利用者と Google AI Ultra 契約者から |
| 価格(公開時) | 100 万トークンあたり入力 2 ドル / 出力 10 ドル。キャッシュ済み入力は 95% 引き |
| 導入価格の後 | 入力 4 ドル / 出力 20 ドル |
公表されているベンチマークは次のとおりである。
- DeepSWE v1.1: 77.9%(長期的なソフトウェア開発タスク)
- AutomationBench: 51.3%
- LVBench: 91.7%
- CWE-bench v1: 68%(首位タイ)
- Vals Index、および間接プロンプトインジェクションへの耐性評価で首位水準
発表には「ガードレールを反復しながら早期テスターの意見を集め、できるだけ早く開発者・企業・一般利用者へ提供する」と書かれている。一般提供の日付は公表されていない。
ここまでが事実である。以下は見立てになる。
論点 1. 「段階提供」は見積もりの前提を 3 つに割る
AI 開発の見積書に出てくるモデル名は、実際には次の 3 つのどれかである。見積書はこれを区別して書かない。
| 状態 | 中身 | 見積もりへの影響 |
|---|---|---|
| 一般提供(GA) | 誰でも API から使える | 単価・レート制限が読める |
| 限定提供 | 招待・審査・特定プログラム経由 | 自社が使える保証がない |
| 発表のみ | 日付が決まっていない | 代替モデルで作る前提になる |
今回の Argon は 2 番目から始まり、その次が「有料 API 利用者と最上位の個人向け契約者」である。つまり開発会社が自社のアカウントで試せたとしても、発注側の名義・リージョン・契約形態で同じように使えるかは別の話になる。API の名義で請求先と引き継ぎが変わる構造はOpenAIのAPIキーに有効期限で整理した。
ここで実際に起きやすいのは、PoC は限定提供のモデルで通したのに、本番では使えず下位モデルに落とす、という流れである。精度が落ちれば作り直しになり、単価が違えば月額が変わる。どちらも追加費用の話になる。
論点 2. 出力 100 万トークンは「使える」とは別に「払える」かを問う
出力上限が 64K から 100 万トークンへ上がったことは、長い成果物を一度に出せるという意味で設計の幅を広げる。ただし出力は単価がいちばん高い枠である。
公開時の価格で、出力トークンだけを単純計算すると次になる。
| 1 回の出力量 | 公開時価格(10 ドル / 100 万トークン) | 導入価格後(20 ドル / 100 万トークン) |
|---|---|---|
| 1 万トークン | 0.10 ドル | 0.20 ドル |
| 10 万トークン | 1.00 ドル | 2.00 ドル |
| 100 万トークン(上限) | 10.00 ドル | 20.00 ドル |
1 回 10 ドルの処理を 1 日 100 件回せば、月額は 3 万ドルの規模になる。「長く出力できる」は「長く出力させてよい」ではない。1 件あたりの出力トークン量を決めるのは要件であり、要件を決めるのは発注側である。試算の手順はAI APIの料金体系と月額の試算方法にある。
キャッシュ済み入力が 95% 引きという条件も、設計次第で効き方が変わる。同じ前提文(社内規程・マニュアル・過去のやりとり)を毎回送る処理ではキャッシュが効くが、1 件ごとに内容が全部変わる処理では効かない。見積書に「キャッシュ前提で算定」と書いてあるなら、何をキャッシュに乗せる想定なのかを聞く必要がある。
論点 3. ベンチマークの数字は、業務の合格ラインの代わりにならない
DeepSWE v1.1 で 77.9%、CWE-bench v1 で 68%。どちらも公表された測定値であり、モデルの比較には使える。
ただし発注側が決めるべきなのは「このモデルが何点か」ではなく「自社の業務で何%なら合格か」である。77.9% は 22.1% が通らなかったという意味でもあり、残りを人が拾う工程がどれだけ要るかは業務によって変わる。評価の設計そのものを誰が持つかはAIの精度評価は誰がやるかで 3 つの型に分けた。
とくにサイバー防御の文脈では、「脆弱性を自動で直せる」ことと「直した結果を誰が承認するか」が別である。承認の手順を決めずに自動修正を入れると、止めるべき変更が通る。この種の線引きは外注の仕様に落とさないと実装されない。
発注者・企業への影響
第一に、見積書のモデル名の横に「提供状態」を書かせる。GA か、限定提供か、発表のみか。限定提供のモデルを前提にした見積もりは、本番で別モデルになる可能性を含んでいる。モデル名が前提を固定しない構造はDeepSeekが9月14日の提供終了を撤回でも起きている。
第二に、本番で使う候補を 2 つ以上書かせる。第 1 候補が使えなかった場合の代替モデルと、そのときの単価差・精度差を見積書の時点で出してもらう。あとから聞くと「再見積もり」になる。
第三に、導入価格の期限を確認する。Argon は公開時 2 ドル / 10 ドル、導入価格の後は 4 ドル / 20 ドルと公表されている。運用費の試算がどちらの単価なのかで月額は 2 倍変わる。導入価格を前提にした見積もりの読み方はGemini Flashの単価が2027年1月に2倍へに整理した。
第四に、合格ラインを自社の数字で決める。ベンチマークの順位ではなく、自社の業務データで何%通れば使うのか。ここを決めないまま「最高性能のモデルを使うので大丈夫」という説明を受け入れると、検収で基準がなくなる。会社選びで先に見るべき場所はAI開発会社の選び方にまとめた。
見積依頼に書く 4 行
- 使用モデルと、その提供状態(GA / 限定 / 未提供)を明記する
- 第 1 候補が使えない場合の代替モデルと、単価差・精度差を書く
- 1 件あたりの想定入力・出力トークン量と、キャッシュに乗せる対象を書く
- 導入価格の期限後の単価で、月額をもう 1 本試算する
この 4 行は条件として書き出せるため、複数社へ同じ文面で聞ける。無料で相見積もりの案件票では処理量・精度要件・外部連携の条件を選択式で揃えているので、各社がどのモデルを前提に金額を出したのかを同じ形で比べられる。すでに見積書を受け取っているなら、見積書チェックで前提の書かれていない項目を洗い出せる。
まとめ
最上位モデルの公開は、性能の話として報じられる。だが受託開発の現場に効くのは、提供の順番である。発表から一般提供までの間に契約を結ぶと、見積書の前提と本番の環境がずれる。
発注側が守る線は 1 本で足りる。「契約時点で自社が使えるモデルで、金額と精度を出してもらう」。先の性能を織り込んだ見積もりは、その性能が届かなかったときの責任の所在が書かれていない。
参考・出典
- Google「Gemini 4 Argon: our next era of frontier intelligence」(2026 年 9 月 30 日) https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-4-argon/
- Google DeepMind「Gemini 4 Argon with cybersecurity defense capabilities」 https://deepmind.google/models/gemini/cyber/
- Google「Gemini Developer API pricing」 https://ai.google.dev/gemini-api/docs/pricing
AI開発の見積もりを、同じ条件で比べる。
条件を整理した 1 枚の案件票で複数のAI開発会社に依頼。初期費用だけでなく、データ整備・API 費・精度検証・保守・権利まで同じ列で比較できます。