【モデルケース】コールセンターの応対品質評価をAIで。月2万件の通話をどこまで採点できるか
月2万件の通話のうち人が採点できるのは0.3%。20項目中13項目を全件自動判定する場合の費用・期間・体制をモデルケースで示します。PoC90万円から本番650万円、月額19万〜52万円の内訳まで整理します。
本記事はモデルケースです。 特定企業の実際の導入事例ではありません。通信販売事業者が自社コールセンターの応対品質評価(モニタリング)にAIを入れる場合の費用・効果・体制を、一般的な条件をもとに構成したものです。実際の数値は要件によって変動します。
コールセンターの応対品質評価は、AIを入れる前にいまどれだけ見られていないかを数えると、話が一気に具体的になる業務である。
月2万件の通話に対して、人が聴いて採点できているのは数十件。率にすると 0.3% 前後というセンターは珍しくない。残り 99.7% は、クレームになるまで誰も中身を知らない。ここは「人の作業を速くする」案件ではなく、いままで見ていなかった範囲を見る案件になる。だから費用対効果の出し方も、人件費削減とは別の置き方になる。

想定する状況
- 通信販売事業者。自社コールセンターを運営、席数60(受注・問い合わせ・返品対応)
- 月間の着信 2万件、平均通話時間 6分 → 月間の通話時間は約2,000時間
- 全通話を録音済み。録音は電話システム側に90日保持、音声ファイルの書き出しは可能
- 応対品質評価はスーパーバイザー(SV)6名が担当。1人月10件、合計月60件を抜き取りで採点
- 評価表は20項目・各5点の100点満点。紙の様式をExcelに移しただけで、判定基準の文章は項目名のみ
- 1件の採点に約30分(聴き直し・記入・本人へのフィードバックを含む)
- 離職率が高く、新人の立ち上がりに時間がかかっている
現状の数値化
先にいまの数字を置く。ここを飛ばすと、導入後に「見える化できた」で終わる。
| 項目 | 現状 |
|---|---|
| 月間の通話件数 | 20,000件 |
| 人が採点できている件数 | 60件(0.3%) |
| 採点にかかる時間 | 月30時間(SV6名の合計) |
| 同・人件費(時間単価3,500円で換算) | 月約10.5万円 → 年間約126万円 |
| 評価者間のばらつき | 同じ通話を2名が採点すると**±12点**程度ずれる |
| クレーム化してから発覚した案件 | 月8〜15件 |
| 新人が独り立ちするまで | 平均3.5か月 |
人件費は年126万円しかない。 ここを削る目的で数百万円の開発を発注すると、絶対に回収できない。この案件の投資対効果は、クレームの早期発見と新人の立ち上がり短縮に置くしかない。効果指標の決め方はAIプロジェクトのKPI設計の手順に沿って、発注前に決めておく。
何を任せ、何を残すか
20項目を性質で割ると、AIに任せられる範囲がはっきり分かれる。
| 項目の性質 | 例 | AIで判定できるか |
|---|---|---|
| 言ったか言わないか | 名乗り、本人確認、録音の告知、決まり文句 | できる(有無の確認) |
| 数えられる事実 | 保留の回数と秒数、沈黙の長さ、話した割合 | できる(計測) |
| 内容の分類 | 用件の種別、解約の示唆、競合名の言及 | できる(分類) |
| 手順の順守 | 規定の案内順、必須の確認事項 | おおむねできる(基準を文章化できれば) |
| 感じの良さ・寄り添い | 共感の表現、声の調子 | 人に残る(基準が揺れる) |
| 評価の確定と本人への伝達 | 最終点数、指導 | 人に残る(責任の所在) |
下の2つは残る。 「応対品質を自動評価」とだけ書かれた提案は、20項目のうち何項目を判定対象にするのかを工程表と照らして確認したほうがよい。
現実的な目標は、20項目のうち13項目を全件自動判定し、残り7項目は人の抜き取りを続けることである。SVの作業は「全部を少しだけ見る」から「AIが引っかけた通話を優先して見る」に変わる。
フェーズ0:買わずに済む範囲を先に確かめる(3週間・社内作業)
発注の前に、次の3つを社内で確認する。ここで止まる判断もある。
- 評価表の判定基準が文章になっているか。 項目名だけではAIに渡す正解がない。まず「名乗り」「本人確認」など5項目について、合格・不合格の例を各3件ずつ書き出す。この作業は外注できず、しかも評価者間のばらつきにも効く
- いま使っている電話システム(CCaaS)に品質評価の機能が無いか。 標準搭載または追加オプションで足りる場合がある。開発を発注する前に提供元へ確認する
- 録音を外部のAPIへ送ってよいか。 顧客との通話は、録音の告知内容・利用目的・保存先の3点を先に確認する。ここは判断次第で構成が変わるので、技術検討より先に片付ける。線引きの手順はAI開発で外部APIに送ってよいデータの決め方にまとめた
次の条件に全部当てはまるなら、開発を発注しないほうが安い。
- 判定したい項目が「名乗り」「録音告知」など定型の有無確認にほぼ限られる
- 既存の電話システムに文字起こしと全文検索が付いている
- 集計は月次でよく、担当者が手作業で表にできる件数である
フェーズ1:PoC(1.5か月・90万〜160万円)
検証範囲
過去の通話300件に絞る。うち60件は人が採点済みのものを混ぜる。正解が分かっている通話を入れないと、精度を測れない。
- 対象は受注の問い合わせに限定(返品対応は言い回しが複雑なので後回し)
- 判定対象は5項目だけ(名乗り・本人確認・録音告知・保留時の断り・クロージングの確認)
- 出力は「項目ごとの合否」と「根拠になった発話の引用」まで。点数の自動算出はこの段階では評価対象に入れない
測る指標
| 指標 | 意味 | 置き方の目安 |
|---|---|---|
| 文字起こしの用件単位の正答率 | 単語の一致ではなく、用件が伝わるか | 90%以上 |
| 項目判定の一致率(人の採点との比較) | 人が合格としたものをAIも合格とするか | 項目ごとに85%以上 |
| 見逃し率 | 不合格を合格と判定した割合 | 5%以下(ここが最重要) |
| 1件あたりの処理時間 | 夜間バッチが朝までに終わるか | 通話6分あたり30秒以内 |
見逃し率を他の指標と並べない。 品質評価では「できていないのに合格にした」が最も困る。ここに合格ラインを置かないと、導入後に信用されなくなる。精度の測り方そのものはAIの精度をどう評価するかで整理している。
典型的な結果
- 名乗り・録音告知のような定型句は一致率95%前後まで届く
- 本人確認は、顧客が先に名乗る・途中で保留が入るなど順序が崩れると落ちる(80%前後)
- 専門用語と商品名の誤認識が精度を押し下げる。用語辞書を作ると数ポイント改善する
- 「感じの良さ」は、この段階で評価対象から外す判断になることが多い
フェーズ2:本番構築(4か月・520万〜780万円)
費用の内訳(650万円規模の場合)
| 工程 | 比率 | 金額 | 内容 |
|---|---|---|---|
| 要件定義 | 12% | 78万円 | 判定13項目の基準文書化、出力設計 |
| 音声の取り込み | 18% | 117万円 | 電話システムからの録音取得、日次バッチ |
| 文字起こしの調整 | 17% | 110万円 | 用語辞書、話者分離、無音除去 |
| 判定ロジックの実装 | 22% | 143万円 | 項目ごとの判定、根拠の引用 |
| 画面・レポート | 19% | 124万円 | 通話検索、優先度順の一覧、月次集計 |
| 精度評価 | 12% | 78万円 | 評価データでの測定、合格判定 |
**音声の取り込みと文字起こしで約35%**を占める。既存の電話システムとの連携は、見積もり段階で軽く見積もられやすい工程である。分野全体の相場は音声AI・文字起こしの費用相場に、電話AIの見積もりを層に分けて読む方法は電話AIの費用を3社で比べるにまとめた。
設計上の判断
- 全件をリアルタイムに処理しない。 夜間バッチにすると単価が下がり、設計も単純になる。即時性が要るのは有人エスカレーションの判断だけで、品質評価は翌朝で足りる
- 点数を自動確定させない。 AIは項目ごとの合否と根拠を出すところまで。合計点と評価の確定はSVが行う
- SVの画面は「低い順」に並べる。 全件のスコアを見せても使われない。要確認の通話だけを上に出す
- 根拠の発話を必ず引用させる。 根拠が出ない判定は、SVがAIを信用しなくなる最大の原因になる
フェーズ3:試験運用(1.5か月)
SV6名のうち2名で先に回す。ここで必ず出る論点は3つある。AIとSVの判定が割れる項目が出るので、割れた件を10件ずつ持ち寄って判定基準の文章のほうを直す(モデルを直すより早い)。オペレーターが「監視されている」と受け取るので、目的を「減点」ではなく新人支援に置き、個人の順位付けに使わないことを先に決める。そして要確認の通話が想定より多く出るため、閾値は運用開始後に2〜3回調整する前提で工数を確保しておく。
運用費
月間2,000時間の通話を処理する前提での内訳である。
| 項目 | 月額 | 変動要因 |
|---|---|---|
| 音声認識API | 3万〜8万円 | 通話の総時間に比例 |
| 生成AI API(判定・要約) | 6万〜15万円 | 件数と判定項目数に比例 |
| 音声・文字起こしの保存 | 2万〜6万円 | 保存期間と件数 |
| インフラ | 3万〜8万円 | 構成による |
| 保守 | 5万〜15万円 | 契約範囲による |
| 合計 | 19万〜52万円 |
判定項目を増やすと生成AIの費用が比例して増える。 20項目すべてを自動判定にすると月額は1.5倍前後になるが、追加で判定できるのは精度の落ちる項目が中心になる。項目を絞ることが、そのまま費用対策になる。
保守の範囲に「判定基準の見直し」が含まれるかは、契約前に確認する。含まれない場合、基準を直すたびに個別見積もりになる。定額保守と従量精算の分け方はAI運用費は定額保守か従量精算かで整理した。
効果の測定
人件費削減で測らない。測るのは次の4つである。
| 指標 | 導入前 | 6か月後の目安 |
|---|---|---|
| 品質評価の対象率 | 0.3%(月60件) | 100%(13項目)+人の抜き取り月60件 |
| クレーム化してから発覚した案件 | 月8〜15件 | 月4〜8件 |
| 評価者間のばらつき | ±12点 | ±6点前後(基準が文書化されるため) |
| 新人の独り立ちまでの期間 | 3.5か月 | 2.5〜3か月 |
ばらつきの縮小は、AIの効果というより基準を文章化した効果である。実際、フェーズ0の作業だけで一定の改善が出る。これは「開発を発注しなくても取れる効果」なので、効果の見積もりに二重計上しないよう注意したい。
金額換算するなら、クレーム1件あたりの対応コスト(二次対応の時間+返品・返金の発生率)を自社の実績から出し、月4〜7件の減少分を掛ける。年間の回収額が初期費用650万円に届かない場合、この案件は規模が合っていないと判断してよい。試算の手順はAI投資のROI計算にある。
運用体制とよくある失敗
| 役割 | 担当 | 工数の目安 |
|---|---|---|
| 判定基準の管理・用語辞書の更新 | SVリーダー1名 | 月10時間 |
| 要確認通話の確認・指導 | SV6名 | 月40時間(従来30時間から増える) |
| 障害対応・改修依頼 | 情報システム1名 | 月4時間 |
SVの作業時間は減らない。むしろ増える。 見る範囲が0.3%から全件に広がるのだから当然である。削減を約束する提案があれば、何を削るのかを具体的に聞いたほうがよい。
失敗しやすいのは次の4つである。20項目すべてを初めから自動化する(精度の出ない項目が混ざると全体が信用されなくなる)。オペレーターの順位付けに使う(現場の協力が得られなくなる)。根拠の発話を出さない設計にする(「78点」とだけ出る画面は使われない)。録音の告知内容を確認しないまま進める(法務で止まると作り直しになる)。
費用を抑えた場合の代替案
案1:文字起こしと全文検索だけ(初期120万〜250万円、月額8万〜18万円)
判定はせず、全通話を検索できる状態にする。「返金」「解約」「上司」などの語で引いて、SVが自分で確認する。クレームの早期発見という目的だけなら、これで半分は達成できる。
案2:対象を絞る(初期280万〜420万円)
全席ではなく新人10席のみ、判定項目も5つに絞る。新人の立ち上がり短縮という目的に絞れば、規模は3分の1以下になる。効果が確認できてから広げる。
案3:既製サービスの検討(初期0〜80万円、月額15万〜50万円)
品質評価機能を持つコールセンター向けサービスを使う。自社固有の判定基準が少なく、既存の電話システムと接続できるなら、開発しないほうが安い。開発せずに済ませる選択肢は生成AI導入を安くする方法に整理した。
まとめ
応対品質評価のAI化は、人件費を削る案件ではなく、見ていなかった99.7%を見る案件である。この前提を取り違えると、投資対効果の説明が最後まで噛み合わない。
進め方としては、フェーズ0で判定基準を文章化し、PoCで見逃し率を測り、出る項目だけを全件自動化する。残りは人の抜き取りを続ける。SVの作業時間は減らないという前提を、稟議の段階で共有しておくと後が楽になる。
同じ条件で複数社に見積もりを取ると、音声の取り込み工程と判定項目数の扱いで金額が大きく割れる。無料で相見積もりの案件票では、通話件数・判定項目数・録音の取得方法・保存先の条件を選択式で揃えているので、各社の見積もりを同じ土俵で並べられる。見積書を比較する手順そのものはAI開発の相見積もりを比較する方法にまとめている。
AI開発の見積もりを、同じ条件で比べる。
条件を整理した 1 枚の案件票で複数のAI開発会社に依頼。初期費用だけでなく、データ整備・API 費・精度検証・保守・権利まで同じ列で比較できます。