AI開発コネクト
AI最新ニュース日本のAI・国内報道

KDDI傘下ELYZAが国産33Bモデルを商用可で公開。推論費67%減の数字をどう読むか

ELYZAが10月2日、NIIのLLM-jp-4をもとにした2モデルをApache 2.0で公開し、推論コスト67%減などの数字を示しました。0円になるのはどの行か、閉域案件で何が変わるかを見積書の内訳で整理します。

公開: 2026.10.02 / 更新: 2026.10.02

「国産モデルが無料で商用利用できる」と聞いたとき、見積書のどの行が安くなるのかはすぐには分からない。2026 年 10 月 2 日、KDDI 子会社の ELYZA が、国立情報学研究所(NII)の国産オープンモデルをもとに事後学習した 2 つのモデルを、商用利用を認める Apache 2.0 ライセンスで Hugging Face に公開した。あわせて、日本語のカスタマーサービス業務を測る評価ベンチマークと、推論コストを 67% 削減したという自社の数字も公表している。

モデルの利用料が 0 円になることは、案件の総額が下がることと同じではない。何が消えて、何が残るのかを分けて読んでおきたい。

開いた南京錠が置かれた装置と、その奥に立つサーバーの棚

公表されている事実

ELYZA が 2026 年 10 月 2 日に公表した内容は次のとおりである。

  • 「AI による AI 開発」と再帰的自己改善(RSI)を研究する組織 ELYZA RSI Research を設立した
  • モデル ELYZA-Thinking-1.0-llm-jp-4-33b(約 330 億パラメータ)と ELYZA-Thinking-1.0-llm-jp-4-32b-a3b の 2 つを Hugging Face で公開した。ライセンスは Apache 2.0 で、商用利用を認めている
  • どちらも NII の国産オープンモデル LLM-jp-4 系を事後学習したもの。NII が 9 月 28 日に公開した LLM-jp-4.1 系に対して、一部のベンチマークで上回るスコアを示したとしている
  • 評価用のベンチマーク ELYZA Agent Tasks: Customer Service を GitHub で公開した。日本語のカスタマーサービス業務について、手順の選択・社内規程(SOP)の遵守・ツールの使い方・タスクの完了をあわせて測る
  • AI エージェントにハーネス(モデルの外側にあるプロンプト・ツール・手順の作り)を自律的に改善させた結果、2 つのベンチマークでタスク成功率が 14.4 ポイントと 27.2 ポイント向上したとしている
  • カスタマーサービスのテストでは、完了率が 34.3% から 52.9%(18.6 ポイント)に上がった
  • 同じ精度を保ったまま推論コストを 67% 削減したとしている
  • 安全性を「重要な研究テーマ」と位置づけている

ベースとなった NII 側の仕様も関係する。LLM-jp-4 の 32B-A3B は、総パラメータ約 320 億のうち推論時に実際に計算する部分を約 38 億に絞る MoE 構成で、学習データは約 12 兆トークンとされている。

ここまでが公表されている内容である。以下は見立てになる。

論点 1. 0 円になるのはライセンス料と従量課金だけ

Apache 2.0 で商用利用できることで消える費用は、モデルのライセンス料と、クラウド API の従量課金である。それ以外は消えない。

費目 クラウド API を使う オープンモデルを自社で動かす
モデルの利用権 従量課金に含まれる 0 円(Apache 2.0)
推論の計算資源 従量課金に含まれる GPU の確保と月額が自社負担
モデルの差し替え 提供側が更新する 自社で検証して入れ替える
監視・障害対応 一部は提供側 すべて自社または委託先
評価データの整備 自社 自社
ハーネスの作り込み 自社 自社

330 億パラメータのモデルを業務時間中ずっと動かすなら、GPU の月額がそのまま運用費に乗る。利用量が少ない案件では、従量課金の API のほうが安く収まることが多い。この分かれ目はAI APIの利用と自社構築で損益分岐として整理した通りで、オープンモデルが増えても計算の構造は変わらない。費目の全体像はAI開発の運用費・ランニングコストの実態にある。

国産のオープンモデルが商用可で増えることの実務的な意味は、「安くなる」ではなく閉域やオンプレミスでしか動かせない案件に選択肢が増えることだと考えられる。外部 API にデータを出せない要件を抱えた案件では、ここが効く。可否の線引きは外部APIに送ってよいデータの決め方で 4 区分にしている。

論点 2. 伸びたのはモデルではなく、その外側

公表された数字のうち、発注の判断に直接効くのは 14.4 ポイントと 27.2 ポイントのほうである。これはモデルを作り替えて得た差ではなく、モデルの外側にあるハーネス(プロンプト・ツールの定義・手順)を改善して得た差として示されている。

見積書を読む場面に置き換えると、次のようになる。

  • モデルの選定は見積書の 1 行で済むことが多い。どのモデルを使うかは差し替え可能な前提として書かれる
  • ハーネスの作り込みと評価は工数として積まれる。ここが薄い見積もりは、同じモデルを使っても結果が出ない
  • したがって、モデル名の格の高さで見積もりを比べても差は読めない。比べるべきは、手順とツールをどう作り、どう測るかの工数である

精度の話が「どのモデルを使うか」で終わっている提案は、この順序が逆になっている。評価の指標そのものの考え方はAIの精度をどう評価するかにまとめた。

論点 3. 67% という数字の出どころ

  • 主張: 精度を保ったまま推論コストを 67% 削減した
  • 根拠: ELYZA が自社で設計したベンチマークでの測定結果。評価コードは GitHub で公開されている
  • 第三者の検証: 現時点では公表されていない。ベンチマーク自体が公開されたのが同日である
  • 自社案件で再現するか: ベンチマークのタスクと自社の業務が一致している範囲でしか参考にならない。業務の手順・扱う文書・許容できる誤りの種類が違えば、削減率も変わる

評価コードが公開されていることは、数字を確かめられる余地があるという点で前進である。ただし「67% 下がる」を自社の見積もりの前提に置くのは早い。誰が採点するかで結果が変わる構造はAIの精度評価は誰がやるかで 3 つの型に分けている。

発注者・企業への影響

第一に、「国産モデルだから安い」という提案は内訳で確かめる。安くなるのはライセンス料の行だけで、GPU・監視・モデル更新の行は増えることもある。初期費用と月額を分けて出させるのが先である。

第二に、閉域要件のある案件では候補が増えたと考えてよい。これまで「外部 API が使えないので見送り」になっていた案件が、商用可のオープンモデルで成立する可能性が出てくる。ただし成立するかどうかは、必要な精度が 33B 級で足りるかの検証にかかる。

第三に、公開されたベンチマークは相見積もりの材料になる。日本語のカスタマーサービス業務を測る評価セットが公開されたということは、各社に「このベンチで何点か」を同じ条件で聞けるということである。自社の業務に近いなら、提案書の抽象的な精度表現より具体的な比較ができる。

第四に、RSI(AI が AI を改善する)の研究成果は、まだ発注の前提にしない。公表されているのは研究組織の設立と初期の数字であり、受託開発の工程に落ちた形ではない。

見積依頼に書く 3 行

  1. モデルの前提を固定しない。「オープンモデルの自社運用」と「クラウド API」の両案で、初期費用と月額を分けて出してもらう
  2. GPU の費用を明示させる。どの構成を何時間動かす想定か。利用量が倍になったときの月額も聞く
  3. 評価の方法と評価データを書かせる。公開ベンチの点数か、自社データでの測定か。どちらなのかを区別する

この 3 点は案件の条件としてそのまま書き出せるので、複数社に同じ文面で聞ける。無料で相見積もりの案件票では、外部 API の可否・閉域要件・想定利用量を選択式で揃え、各社に同じ形式で答えてもらっている。

まとめ

商用利用できる国産モデルが増えたことで変わるのは、見積書の「モデル費用」の行ではなく、選べる構成の幅である。ライセンス料は 0 円になるが、計算資源と運用の費用は自社側に移る。そして今回の公表値のうち発注判断に効くのは、モデルの性能ではなくハーネスと評価を作り込むと成功率が二桁ポイント動くという部分だった。提案書を読むときは、モデル名の行ではなく、その外側に積まれた工数を見るほうが差が出ると考えられる。

参考・出典

AI開発の見積もりを、同じ条件で比べる。

条件を整理した 1 枚の案件票で複数のAI開発会社に依頼。初期費用だけでなく、データ整備・API 費・精度検証・保守・権利まで同じ列で比較できます。

無料で相見積もりを始める →
無料で相見積もり30秒で費用診断