音声・ナレーション生成AIの費用。人の声とどう使い分けるか
動画ナレーション、電話応答、社内研修。音声生成AIの費用相場と、人の声を使うべき場面との使い分けを整理します。
動画のナレーション、電話の自動応答、社内研修の音声。人の声が必要な場面は多いが、収録には時間と費用がかかる。修正のたびに録り直しが必要になる点も負担だ。
音声生成AIは、この制約をどこまで外せるのか。費用と、人の声を使うべき場面との使い分けを整理する。

1. 音声生成AIの現在地
数年前の合成音声は、聞けば機械だと分かるものだった。現在は用途によっては人の声と区別がつかない水準に達している。
ただし「どんな場面でも人の代わりになる」わけではない。実力を用途別に整理する。
実用水準にある用途
説明・解説のナレーション。淡々と情報を伝える音声。研修動画、マニュアル、商品説明。違和感なく使える。
定型的な案内。電話の自動応答、施設内アナウンス、注意喚起。
多言語版の音声。同じ内容を複数言語で。ネイティブ話者を手配するより圧倒的に速い。
下読み・仮ナレーション。本番収録の前に、尺やタイミングを確認する用途。
大量のコンテンツ。商品ごとの説明音声など、本数が多いもの。
まだ人の声が必要な用途
感情を伝える表現。喜び、驚き、共感。細やかな感情表現は不自然になりやすい。
ブランドの顔となる声。CMのナレーション、企業の代表的なメッセージ。
掛け合い・対話。複数人の自然な会話。
長時間の視聴。30分を超えると、微妙な不自然さが疲れにつながる。
信頼が重要な場面。重要な契約説明、医療情報の案内。
2. 費用の比較
10分のナレーションを制作する場合。
声優・ナレーターへの依頼
| 項目 | 費用 |
|---|---|
| ナレーター費用 | 3万〜15万円 |
| スタジオ費用 | 1万〜5万円 |
| ディレクション・編集 | 2万〜8万円 |
| 合計 | 6万〜28万円 |
| 修正時の追加 | 1万〜10万円(再収録) |
| 期間 | 1〜3週間 |
音声生成AI
| 項目 | 費用 |
|---|---|
| サービス利用料 | 月1,000円〜3万円(使い放題または従量) |
| 10分の生成 | 数十円〜数百円 |
| 原稿調整の工数 | 1〜3時間 |
| 期間 | 数分〜数時間 |
修正が容易な点が最も大きい違いだ。原稿を1行直すだけで、その部分を再生成できる。人の収録では再度スケジュールを押さえる必要がある。
3. 声の種類をどう選ぶか
既製の音声
サービスが提供する声を選ぶ。数十〜数百種類から選択できる。
費用:月1,000円〜3万円 利点:即日使える。費用が安い。 制約:他社と同じ声になる可能性がある。
自社専用の音声(声のクローン)
特定の人物の声を学習させ、その声で読み上げる。
費用:初期10万〜50万円 + 月額数千円〜2万円 必要な素材:10〜60分程度の音声収録 利点:一貫した声で運用できる。ブランドの声として使える。 制約:本人の同意と、利用範囲の整理が必要。
使い分け
社内向けなら既製の音声で十分だ。対外的に継続発信するなら、自社専用の音声に価値がある。

4. 品質を上げる原稿の書き方
音声生成の品質は、原稿で大きく変わる。技術的な調整より、原稿の改善のほうが効果的だ。
一文を短くする。長い文は不自然な息継ぎになる。40〜60文字を目安にする。
読み方の指定が必要な語を減らす。数字、英字、固有名詞。読み間違いが起きやすい箇所は、ひらがなで書くか、読み方を指定する。
句読点で間を作る。読点の位置が間の長さを決める。声に出して読み、自然な位置に置く。
接続詞を減らす。書き言葉では自然でも、話し言葉では冗長になる。
同音異義語を避ける。「開始」と「回시」など、文脈で判断が必要な語は誤読の原因になる。
箇条書きは文章に直す。箇条書きをそのまま読ませると不自然になる。
数字の表記を統一する。「1,000」を「せんこ」と読むか「いっせん」と読むか。指定が必要な場合がある。
5. 電話応答への活用
音声生成AIの用途として増えているのが、電話の自動応答だ。
一次受付。営業時間、場所、基本的な案内。定型的な質問への回答。
用件の振り分け。内容を聞き取り、適切な担当につなぐ。
折り返し予約。混雑時に用件を記録し、後から折り返す。
時間外対応。営業時間外の受付。
費用:初期100万〜500万円、月額3万〜20万円
注意点:音声認識の精度が課題になる。騒音環境、方言、早口。日本語の電話応答は、想定より難易度が高い。PoCでの検証が必須になる。
そして、人につながらないことへの不満は根強い。「担当者と話したい」という要求には、すぐ応じる設計が必要だ。
6. 法的・倫理的な確認事項
本人の同意。声をクローンする場合、書面での同意を得る。利用範囲、期間、退職後の扱いを明記する。
なりすましの防止。他人の声を無断で複製することは、権利侵害にあたる可能性がある。
AI音声であることの明示。用途によっては明示が求められる。電話応答では、冒頭で伝えるのが一般的だ。
録音の同意。電話応答で通話を録音する場合、事前の告知が必要になる。
声優との契約。既存の収録音源を学習に使う場合、契約上の可否を確認する。
これらは技術ではなく運用の問題であり、導入前に整理しておく必要がある。
7. 費用対効果の試算
社内研修動画に導入する場合
導入前:年20本 × ナレーション費用8万円 = 年160万円 導入後:サービス利用料 月1万円 = 年12万円 + 原稿調整 年40時間 = 12万円
年136万円の削減。加えて、内容の更新が容易になる効果がある。
多言語展開に導入する場合
導入前:5言語 × 1本あたり20万円 = 100万円/本 導入後:翻訳費用 + 音声生成 = 15万円/本
1本あたり85万円の削減。年10本なら850万円になる。
効果が大きいのは、本数が多い場合と多言語の場合である。年数本なら、人に依頼するほうが品質面で有利だ。
8. 導入の進め方
第1段階(1週間・無料〜数千円) 実際の原稿でサンプルを作る。社内の複数名に聞いてもらい、違和感の有無を確認する。
第2段階(1〜2か月・月1,000円〜3万円) 社内向けコンテンツで運用する。研修動画、マニュアル。品質への要求が緩い用途から。
第3段階(2〜3か月) 対外的なコンテンツへ展開する。この段階で、自社専用の音声を検討する。
第4段階 電話応答など、リアルタイム性のある用途へ。ここは別途PoCが必要になる。
サンプルを社内で聞いてもらう工程を飛ばさない。 担当者が良いと思っても、他の人が違和感を持つことは多い。
9. 聞き手の受け止め
技術的な品質と、聞き手の受容は別の問題だ。
慣れの効果。最初は違和感があっても、繰り返し聞くうちに気にならなくなる。社内向けでは特にそうだ。
用途による期待の差。研修動画では受け入れられても、顧客向けの重要な案内では不信感につながることがある。
明示の影響。「AI音声です」と明示すると、かえって受け入れられやすいという傾向もある。隠すより誠実だ。
年代による差。若い層のほうが抵抗が少ない傾向がある。対象者を考慮したい。
小規模に試して反応を見るのが確実だ。
10. よくある失敗
原稿をそのまま読ませた。書き言葉のまま生成し、不自然な音声になる。
確認を省いた。固有名詞の読み間違いが本番で発覚する。
尺を長くしすぎた。30分の音声は聞き続けられない。
BGMや効果音を入れなかった。合成音声だけが続くと単調になる。適度な音楽が違和感を和らげる。
本人の同意なく声を複製した。法的なリスクに加え、信頼の問題になる。
電話応答で人につながらない設計にした。不満が蓄積し、かえって評判を落とす。
11. まとめ
音声生成AIは、説明ナレーション、定型案内、多言語版、大量コンテンツで実用段階にある。人への依頼と比べ、費用は10分の1以下、期間は数分〜数時間で済む。
一方、感情表現、ブランドの顔となる声、対話、長時間の視聴では、まだ人の声が必要になる。
品質を左右するのは技術より原稿の書き方だ。一文を短く、読み間違いの起きやすい語を整理し、句読点で間を作る。これだけで印象が変わる。
そして、声をクローンする場合は本人の同意と利用範囲の整理を先に行う。技術的な検討より優先すべき論点になる。
自社の場合の費用はAI開発費用の無料診断で確認できる。音声AI全般の相場は音声AIの費用相場、映像とあわせた活用はAIアバター・デジタルヒューマン制作の費用で解説している。
AI開発の見積もりを、同じ条件で比べる。
条件を整理した 1 枚の案件票で複数のAI開発会社に依頼。初期費用だけでなく、データ整備・API 費・精度検証・保守・権利まで同じ列で比較できます。