>
>
公開日
2026年9月23日(米国時間)、Googleはテキストから音声を生成するAIモデル「Gemini 3.8 Flash TTS」と「Gemini 3.8 Flash-Lite TTS」を公開しました。用意された声から選ぶ方式に加えて、文章の指示で声そのものを作れるようになり、30秒ほどの録音から本人の声を再現する機能も加わっています。
本記事では、Googleの公式ブログ、モデルカード、料金ページ、APIドキュメントをもとに、2モデルの違いと料金を整理します。そのうえで、情シスが社内展開の前に決めておきたい利用ルールと、合成音声によるなりすましへの備えを解説します。
本記事のポイント
Flash TTSは声の設計や演技の指示など表現力重視、Flash-Lite TTSは吹き替えや音声エージェントなど大量処理向けです。
選べる声は30種類から2,000種類以上に増え、100を超える言語・方言に対応します。日本語は人による聞き比べ評価で上位に入っています。
有償枠の料金は、音声1時間あたりFlash TTSで約0.81ドル、Flash-Lite TTSで約0.54ドルです(2026年末までの価格。2027年1月から2倍)。
無料枠では送信内容がGoogleの製品改善に使われます。業務の原稿は有償枠か、提供予定のGemini Enterprise経由で扱うのが前提です。
声の複製には本人の同意録音が必須で、生成音声には電子透かしが入ります。それでも、声だけで本人確認する業務フローは見直しが必要です。
Gemini 3.8 TTSとは|2モデルの違いと位置づけ
Gemini 3.8 TTSは、表現力を重視する「Flash TTS」と、大量処理を低コストで回す「Flash-Lite TTS」の2モデル構成です。どちらも発表当日から、開発者向けのGemini APIとGoogle AI Studioで利用できます。
項目 | Gemini 3.8 Flash TTS | Gemini 3.8 Flash-Lite TTS |
|---|---|---|
モデルID | gemini-3.8-flash-tts | gemini-3.8-flash-lite-tts |
主な用途 | キャラクターの声づくり、オーディオブック、ポッドキャスト、ゲームなど表現を作り込む用途 | 大量の吹き替え、音声コンテンツの量産、音声エージェント |
文章の指示による声の設計 | 対応 | ― |
声の複製 | 対応 | 対応 |
一般向けの搭載先 | Gemini Notebook | Google Vids |
入出力 | テキスト入力(最大8Kトークン)→ 音声出力(最大64Kトークン) | 同左 |
今回の2モデルは、Googleの音声AI群「Gemini Audio」の新しいラインナップです。同社はこれまでに、リアルタイム翻訳の「3.5 Live Translate」、文字起こしの「3.5 Transcribe」、音声対話の「3.8 Live」を順に公開してきました。今回は「音声を出力する側」を強化した位置づけです。モデルカードによると、Gemini 3.8 Audioの各モデルはGemini 3 Proをベースにしています。
従来のテキスト読み上げモデル「Gemini 3.1 Flash TTS(プレビュー版)」と比べると、長時間の読み上げや2人の話者による掛け合いで、品質が大きく改善したと公式は説明しています。
あわせて読みたい:Geminiの全体像や業務での使いどころは、Gemini(ジェミニ)とは?特徴やビジネス最新活用事例を解説で紹介しています。
あわせて読みたい:同じ3.8世代のテキスト生成モデルについては、「Gemini 3.8 Flash」公開|情シス向け性能・料金・導入判断ガイドで解説しています。
主な新機能|声を「選ぶ」から「作って演出する」へ
いちばん大きな変化は、用意された30種類の声から選ぶ方式から、2,000種類以上のライブラリと、文章の指示で新しい声を作る方式に広がった点です。台本の1行ごとに話し方を指定できるため、ナレーションや対話の仕上がりを細かく調整できます。
声を作る・増やす・複製する
機能 | 内容 |
|---|---|
声の設計 | 役柄、なまり、声質を自然な文章で指示し、新しい声をゼロから作れます(Flash TTS)。100を超える言語・方言に対応します。 |
ボイスライブラリ | すぐに使える2,000種類以上の声を用意。メキシコのスペイン語、ケベックのフランス語、スコットランドの英語のような地域差も含みます。 |
声の複製 | 本人の声、または使用権を持つ声であれば、30秒程度の録音から一貫した声を再現できます。同意確認の仕組みが組み込まれています。 |
保存と再利用 | 作った声を保存して管理でき、継続的なプロジェクトでも声のぶれを抑えられます。 |
声のリミックス(近日提供) | ライブラリの声をもとに、声色、高さ、話す速さ、なまりを文章の指示で微調整できる機能です。 |
話し方を1行ごとに演出する
声を決めたあとは、どちらのモデルでも、台本の1行ごとに話し方を指定できます。落ち着いたカスタマーサポートの口調から、ささやき声のような演出まで、ト書き(話し方の指示)を書き込むか、台本の文脈からGeminiに任せるかを選べます。
長時間の音声でも声質や話す間合いを保てるため、オーディオブックやポッドキャストのような数時間規模のコンテンツにも使えると公式は説明しています。1つの台本から2人の話者の掛け合いを生成する機能もあり、話者の声が混ざらないよう分けたまま、自然な順番で会話を進められます。
さらに、笑い声やため息といった声以外の表現や、「うんうん」「なるほど」といったあいづちも台本に書き込めます。社内向けの対話形式コンテンツを作る場合、この機能で機械的な印象を和らげられます。
性能の評価|日本語は上位評価、ただし自社の原稿で聞き比べを
公式発表では、第三者による音声評価で首位を獲得し、人による聞き比べでも日本語で上位に入ったとしています。一方で、社名や製品名、社内用語の読み方はこうした評価では測れないため、導入前に自社の原稿で確かめることが欠かせません。
評価 | 公式発表の結果 |
|---|---|
Hume AI 音声設計ベンチマーク | Flash TTSが71.4で総合1位 |
Hume AI なまりの再現 | Flash TTSが60.8で1位 |
Hume AI 総合品質指標 | Flash TTSが1位、Flash-Lite TTSが2位 |
Voice Arena(人による目隠し聞き比べ) | 日本語、ブラジルのポルトガル語、ベトナム語、現代標準アラビア語、メキシコのスペイン語、ヒンディー語などで上位 |
日本語で上位に入った点は、日本企業にとって追い風です。ただ、ベンチマークは一般的な文章で測られています。情シスが検証するなら、次のような観点で自社の原稿を読み上げさせ、聞き比べるのが現実的です。
社名、製品名、SaaS名、英字の略語(SSO、MDMなど)を正しく読むか
数字、日付、金額、型番の読み方が崩れないか
10分を超える長い原稿で、声や話す速さが途中で変わらないか
音声エージェントに使う場合、応答までの待ち時間が業務に耐えるか
料金|1時間分の音声は約0.5〜0.8ドル、2027年1月から2倍に
有償枠の料金を音声1時間あたりに換算すると、Flash TTSで約0.81ドル、Flash-Lite TTSで約0.54ドルです(2026年12月31日までの価格)。2027年1月1日からは標準価格に移り、単価は2倍になります。
公式料金(100万トークンあたり、米ドル)
モデル | 入力(テキスト) | 出力(音声) | 2027年1月1日以降 |
|---|---|---|---|
Gemini 3.8 Flash TTS | 0.50ドル | 9.00ドル | 入力1.00ドル/出力18.00ドル |
Gemini 3.8 Flash-Lite TTS | 0.50ドル | 6.00ドル | 入力1.00ドル/出力12.00ドル |
(参考)Gemini 3.1 Flash TTS プレビュー版 | 1.00ドル | 20.00ドル | ― |
急ぎでない処理をまとめて実行する「Batch」や、処理の優先度を下げる代わりに安くなる「Flex」を使うと、いずれのモデルも入出力の単価が半額になります。反対に、優先的に処理する「Priority」は割高です。
音声1時間あたりの試算
料金ページでは、音声1秒を25トークンとして計算すると定めています。1時間の音声は90,000トークンになるため、出力側の費用は次のとおりです。
モデル | 2026年末まで(標準) | 2027年1月以降(標準) | 2026年末まで(Batch/Flex) |
|---|---|---|---|
Flash TTS | 約0.81ドル | 約1.62ドル | 約0.41ドル |
Flash-Lite TTS | 約0.54ドル | 約1.08ドル | 約0.27ドル |
※出力音声のみの試算です。入力テキストの料金は音声に比べて小さいため含めていません。
前世代のプレビュー版と比べると、2027年の標準価格に戻っても出力単価は下がっています。社内研修や手順書を大量に音声化する場合、費用が導入のハードルになることは少ないでしょう。
無料枠を業務で使わない理由
無料枠でも入出力は無料で使えますが、料金ページでは、無料枠に送った内容は「Googleの製品改善に使われる」と明記されています。有償枠では使われません。
音声化したい原稿には、未公開の製品情報、顧客名、社内の手順が含まれがちです。無料枠を業務で使わないことを、利用ルールの最初に明記しておくのが安全です。
あわせて読みたい:AI関連の予算をどこから捻出するかは、クラウドコスト最適化でAI投資予算を創出する情シス実践ガイドが参考になります。
あわせて読みたい:部門ごとに増えるAIサービスの支払いを一覧で把握するなら、SaaSコスト管理|マネーフォワード Adminaをご覧ください。
Claude Codeの社内展開やAPIキーの管理方法については、こちらで整理しています。 【2026年8月最新】Claude Code 企業利用の統制ガイド|APIキー管理・MCP連携・シャドーAI対策
提供範囲と今後の動き|企業向けのGemini Enterpriseは「近日提供」
現時点で業務システムに組み込めるのは、開発者向けのGemini APIとGoogle AI Studioです。企業向けのGemini Enterpriseでの提供は「近日」とされているため、統制を重視する企業はその開始を待つ判断もあり得ます。
利用者 | Flash TTS | Flash-Lite TTS |
|---|---|---|
開発者 | Gemini API、Google AI Studio | Gemini API、Google AI Studio |
企業 | Gemini Enterprise(API経由で近日提供) | Gemini Enterprise(API経由で近日提供) |
一般利用者 | Gemini Notebook | Google Vids |
情シスが見落としやすいのは、社員がAPIを使わなくても、Gemini NotebookやGoogle Vidsを通じて新しい音声生成に触れる点です。Google Workspaceを全社導入している企業では、動画や資料の音声化が「いつのまにか始まっている」状態になり得ます。
外部サービス経由の利用にも目を向けておきましょう。Agora、LiveKit、Pipecat、Vercelといった開発基盤がGemini API経由で対応しているほか、Figma、HeyGenなどが自社サービスへの組み込みを進めています。社内で使っているSaaSのAI機能として、Gemini 3.8 TTSが間接的に使われる場面も増えていきます。
利用規約は経路によって異なります。Gemini APIとGoogle AI Studioは「Gemini API追加利用規約」、Gemini Enterprise Agent Platformは「Google Cloud利用規約」が適用されます。
なお、Google AI Studioでの声の複製は、米国イリノイ州・テキサス州、EEA(欧州経済領域)、英国、スイス、インドでは提供されていません。日本は対象地域に含まれていませんが、海外拠点を持つ企業は、拠点ごとに使える機能が異なる点に注意が必要です。
あわせて読みたい:Gemini Notebookの管理上のポイントは、Gemini Notebookは何が変わった?改称と情シス対応で整理しています。
あわせて読みたい:Google AI Studioのセキュリティ情報は、Google AI Studio|セキュリティDBで確認できます。
今後の変更は公式の4つの情報源で追う
提供範囲や価格は、今後も変わる部分が残っています。判断にはメディア記事ではなく、Googleの一次情報を使うのが確実です。
公式ブログ:機能の全体像と提供範囲
モデルカード:入出力の上限、提供チャネル、安全性評価
Gemini APIの料金ページ:価格、無料枠と有償枠でのデータの扱い
APIドキュメント(音声生成・声の設計・声の複製):同意の条件、保存方式と期間
特に追いかけたいのは、Gemini Enterpriseでの提供開始時期、声のリミックス機能の公開、2027年1月の価格改定、声の複製の提供地域の変化の4点です。
安全対策の仕組み|同意確認・保存期間・電子透かしを押さえる
声の複製には本人の同意録音が必須で、生成されたすべての音声には人の耳では聞き取れない電子透かしが入ります。ただ、どちらも音声を受け取った側の本人確認までは守れないため、声を使ったなりすましへの備えは社内の業務フローで補う必要があります。
声の複製の条件と保存期間
APIドキュメントによると、声を複製するには、同じ成人の話者による2種類の録音が必要です。
参照用の音声:再現したい話者が自然に話している10〜30秒の録音
同意の音声:同じ話者が、決められた同意文を読み上げた録音
同意文は日本語を含む30の言語・地域で用意されています。日本語では「私はこの音声の所有者であり、Googleがこの音声を使用して音声合成モデルを作成することを承認します。」と読み上げます。システムは、同意の音声と参照用の音声が同じ話者かを照合し、一致しなければ声を作成できません。
複製した声の保存方式は2種類あり、上限と保存期間が異なります。
保存方式 | 識別子 | 上限 | 保存期間 |
|---|---|---|---|
Google側で保存(既定) | voice_… で始まるID | 1プロジェクトあたり200件(設計した声と複製した声の合計) | 1年 |
自社側で鍵を保管 | voicekey_… で始まる暗号化キー | 自社で管理 | 7日 |
声は、指紋や顔と同じく個人を識別できる情報に近い性質を持ちます。誰の声を、どのプロジェクトに、いつまで保存するのかを台帳で管理し、退職や契約終了のときには削除まで行える体制を整えておくと安心です。保存した声は、API経由で一覧表示・削除ができます。
あわせて読みたい:退職者のアカウントや権限を漏れなく処理する仕組みは、アカウント管理|マネーフォワード Adminaで紹介しています。
SynthIDによる電子透かしとC2PA
Gemini Audioで生成した音声には、Google DeepMindの電子透かし技術「SynthID」が埋め込まれます。人の耳には聞こえない形で音声そのものに織り込まれ、あとからAIで生成された音声かどうかを検出できるようにする仕組みです。
声の複製では、SynthIDに加えて「C2PA」の来歴情報も保護策として挙げられています。C2PAは、コンテンツがいつ、どのツールで作られ、どう加工されたかを記録するための業界標準です。
ただし、電子透かしは、受け取った側が検出の手段を持って初めて役に立ちます。電話やオンライン会議で流れてきた音声を、その場で透かしから見分けるのは現実的ではありません。
あわせて読みたい:AIの電子透かしで「わかっていること」と「わかっていないこと」の整理は、Claude電子透かしの実態と誤解|確認済み情報と未確認仕様を分けた情シスの実務対応が参考になります。
声を使ったなりすましへの備え
合成音声が自然になるほど、経営層や取引先の声をまねて送金や情報提供を求める「音声を使ったソーシャルエンジニアリング」のリスクは高まります。Gemini 3.8 TTSには同意確認の仕組みがありますが、同意確認のない別のサービスや、悪意ある開発者のツールが存在しないとは言い切れません。
情シスが見直したいのは、声だけで相手を信用している業務です。
電話やボイスメッセージによる送金依頼、パスワードリセット、権限付与の依頼は、声だけで本人確認しない
依頼を受けたら、登録済みの連絡先へ折り返す、チャットで確認するなど、別の経路で裏を取る
ヘルプデスクの本人確認手順から「声で判断する」工程を外す
セキュリティ研修に、合成音声によるなりすましの事例を加える
あわせて読みたい:なりすましの手口と組織的な対策は、ソーシャルエンジニアリングとは?手口や対策をわかりやすく解説でまとめています。
あわせて読みたい:音声通話による認証を減らしていく流れは、Microsoft Entra ID パスキー既定化とSMS・音声認証廃止|情シスの実務ポイントでも解説しています。
情シスの活用ポイント|社内向けの音声化から始め、利用ルールを先に決める
まず取り組みやすいのは、社内マニュアルや研修の音声化、多言語での案内など、社内向けで誤りの影響が小さい用途です。展開の前に利用経路や声の複製の扱いを決めておけば、部門ごとにばらばらに使い始める事態を防げます。
情シスの業務で使いやすい用途
用途 | 向くモデル | ポイント |
|---|---|---|
セキュリティ研修や社内手順の音声・動画化 | Flash-Lite TTS(Google Vidsを含む) | 量が多くても費用を抑えやすい。原稿の更新に合わせて作り直せる |
海外拠点向けの多言語アナウンス | Flash TTS | 100を超える言語・方言と地域の言い回しに対応 |
社内ヘルプデスクの音声応答 | Flash-Lite TTS | 公式が音声エージェント向けとしているモデル。問い合わせの一次受付に向く |
社内報やIT部門からのお知らせの音声配信 | Flash TTS | 2人の掛け合い形式で、聞き流しやすい内容にできる |
ヘルプデスクの音声化を考える場合は、回答の元になるFAQやナレッジが整っていることが前提です。音声は読み返しにくいため、誤った回答が伝わったときの影響がテキストより大きくなります。まずはテキストでの自動応答を固め、そのうえで音声を足す順番が堅実です。
あわせて読みたい:社内問い合わせの自動化は、AIヘルプデスク|社内問合せ対応を効率化|マネーフォワード Adminaで詳しく紹介しています。
あわせて読みたい:Geminiで動画そのものを生成・編集する場合の統制は、動画生成・編集AI「Gemini Omni 1.1 Flash」|情シス向け機能・料金・統制ガイドで解説しています。
社内で決めておきたい利用ルール
ルール | 決めておく内容 |
|---|---|
利用経路 | 業務では有償枠のAPIか、提供開始後のGemini Enterpriseに限る。無料枠は使わない |
APIキーの管理 | 情シスが管理するGoogle Cloudプロジェクトに集約し、個人のプロジェクトでの発行を避ける |
声の複製 | 事前承認制とし、本人の書面同意、用途、保存期間を記録する。退職・契約終了時に削除する |
生成音声の表示 | 社内外に公開する音声には、AIで生成したことを明記する |
外部サービスのAI機能 | 利用中のSaaSに音声生成機能が加わっていないかを定期的に確認する |
こうしたルールは、既存のAI利用ガイドラインに「音声生成」の項目として追記すると運用しやすくなります。
あわせて読みたい:ガイドラインに盛り込む項目と雛形は、AI利用ガイドラインの作り方|社内規定に盛り込むべき10項目と雛形【2026】で紹介しています。
あわせて読みたい:申請されずに使われるAIサービスのリスクと対策は、シャドーAIとは?情報漏洩リスクと情シス向け検知・対策ガイドで解説しています。
企業規模別|情シスが今やるべきこと
必要な対応は、IT担当者の人数とAI利用の広がり方によって変わります。自社の規模に近いものから着手してください。
50名未満の企業
無料枠のAI Studioに業務の原稿を入れないことを、全社に周知する
社員の声の複製は、当面は原則禁止にする
電話での送金・パスワード変更の依頼は、別の経路で確認するルールを決める
50〜300名の企業
音声生成の利用を申請制にし、APIキーを情シス管理のプロジェクトに集約する
セキュリティ研修や手順書など社内向けの用途で小さく試し、日本語の読み上げ品質を検証する
声の複製を認める場合は、同意書の様式と保存期間、削除手順を先に用意する
利用中のSaaSに音声生成機能が追加されていないかを棚卸しする
300名超の企業
Gemini Enterpriseでの提供開始を待ち、契約・監査・データの扱いを一本化した経路で展開する
法務・広報と連携し、生成音声の表示ルールや、社外公開する音声の承認フローを定める
経理・人事・ヘルプデスクなど、声による本人確認が残る業務を洗い出して手順を改める
海外拠点ごとに、声の複製の提供可否や現地の規制を確認する
あわせて読みたい:社内で使われているAIサービスを横断的に把握するなら、200以上のAIサービスを検知。シャドーAI管理プラットフォーム|マネーフォワード Adminaをご覧ください。
よくある質問(FAQ)
Q. Gemini 3.8 Flash TTSとFlash-Lite TTSは、どう使い分ければよいですか?
A. 声を作り込みたい、演技の細かい指示を入れたいといった表現重視の用途にはFlash TTSが向いています。研修動画の吹き替えや音声エージェントなど、量が多く費用を抑えたい用途にはFlash-Lite TTSが向いています。文章の指示で新しい声を作る機能はFlash TTSで提供されています。
Q. 日本語に対応していますか?
A. 対応しています。100を超える言語・方言に対応しており、人による目隠しの聞き比べ評価「Voice Arena」では、日本語で上位に入ったと公式が発表しています。社名や専門用語の読み方は、自社の原稿で事前に確認してください。
Q. 無料で使えますか?業務で使っても問題ありませんか?
A. Gemini APIとGoogle AI Studioには無料枠があります。ただし、無料枠に送った内容はGoogleの製品改善に使われると料金ページに明記されています。業務の原稿を扱う場合は、送信内容が製品改善に使われない有償枠か、提供予定のGemini Enterprise経由で利用するのが前提です。
Q. 社員の声を複製して、社内動画のナレーションに使えますか?
A. 技術的には可能です。本人による10〜30秒の参照音声と、決められた同意文を読み上げた録音の両方が必要で、同じ成人の話者でなければ作成できません。社内で運用する場合は、本人の書面同意、用途、保存期間、退職時の削除手順をあらかじめ決めておくことをおすすめします。
Q. 生成された音声がAIで作られたものか、見分けられますか?
A. Gemini Audioで生成した音声には、SynthIDという人の耳には聞こえない電子透かしが埋め込まれ、検出の手段があればAI生成かどうかを判別できます。ただ、電話や会議の最中に透かしで見分けることは現実的ではありません。声だけで本人確認しない業務ルールと組み合わせることが大切です。
Q. Gemini Enterpriseでは、いつから使えますか?
A. 公式ブログでは、Gemini EnterpriseでのAPI提供は「近日」とされており、具体的な日付は示されていません。提供開始は公式ブログや管理者向けの案内で確認してください。
Q. ElevenLabsなど、既存の音声生成サービスとはどう比べればよいですか?
A. 日本語の読み上げ品質、料金の単位(トークン課金か文字数課金か)、声の複製時の同意確認、生成音声の電子透かし、送信データの扱い、既存契約との重複の6点で比べると判断しやすくなります。どのサービスでも、自社の原稿で聞き比べてから決めるのが確実です。
あわせて読みたい:ElevenLabsの料金や商用利用の条件は、ElevenLabsの使い方・料金・商用利用で解説しています。
まとめ|音声AIの活用と「声のなりすまし」対策をセットで進める
Gemini 3.8 TTSにより、自然で表現力のある音声を、1時間あたり1ドルを下回る費用で作れるようになりました。社内研修や多言語案内、ヘルプデスクの音声化など、情シスが業務改善に使える場面は広がっています。
一方で、声を複製できること、合成音声が本物と聞き分けにくくなったことは、利用ルールと本人確認の手順を見直すきっかけでもあります。Gemini Enterpriseの提供開始を待つ企業も、今のうちに利用経路と声の扱いを決めておくと、展開をスムーズに進められます。
情シス向けチェックリスト
無料枠に業務の原稿を入れないルールを周知した
業務での利用経路(有償APIまたはGemini Enterprise)を決めた
APIキーを情シス管理のGoogle Cloudプロジェクトに集約した
声の複製の承認手順、同意書、保存期間、削除手順を定めた
生成音声をAI生成と明示するルールを決めた
Gemini NotebookやGoogle Vids、利用中SaaSの音声生成機能を把握した
声だけで本人確認している業務を洗い出し、別経路での確認に切り替えた
自社の原稿で日本語の読み上げ品質を検証した
社内で使われているAIサービスとアカウントを一覧で把握することが、あらゆる統制の出発点になります。
あわせて読みたい:SaaSとAIの利用状況をまとめて可視化するなら、SaaS可視化|利用状況の見える化|マネーフォワード Adminaをご覧ください。
本記事の内容に誤り等がございましたら、こちらからご連絡ください。
監修
Admina Team
情シス業務に関するお役立ち情報をマネーフォワード Adminaが提供します。
SaaS・アカウント・デバイスの管理を自動化し、IT資産の可視化とセキュリティ統制を実現。
従業員の入退社対応や棚卸し作業の工数を削減し、情報システム部門の運用負荷を大幅に軽減します。
中小企業から大企業まで、情シス・管理部門・経営層のすべてに頼れるIT管理プラットフォームです。









