GoogleのAIに自分の声を入れたら大変なことになった — Gemini 3.8 TTS 音声クローン実験
21秒の録音、7秒の待ち時間、そして自分の声
2026年9月23日、Googleが新しい音声合成モデル Gemini 3.8 TTS を公開しました。テキストを音声に変えるTTSですが、今回のバージョンは短い録音だけで 自分の声をクローン できます。そこで自分の声を入れてみたところ — 大変なことが一つや二つではありませんでした。
📌 動画は 韓国語 です。主要な公開ランキングには韓国語のスコアがないため、自分で試しました。動画内の 「本物はどれ?」ブラインドテスト に挑戦したい方は、先に動画をご覧ください。この記事の「大変なこと③」にはネタバレがあります。
Gemini 3.8 TTSとは
モデルは2種類です。
- Gemini 3.8 Flash TTS — 表現力の高いモデル。キャラクター、オーディオブック、ナレーション向け
- Gemini 3.8 Flash-Lite TTS — 安くて速いモデル。大量の吹き替え、音声エージェント向け
Flashは130言語、Flash-Liteは101言語に対応し(韓国語を含む)、用意された声は2,000種類以上あります。新機能の柱は2つ。文章で説明して声を新しく作るボイスデザイン と、短い録音から声を複製する音声クローン です。
大変なこと① 価格が安すぎる
料金表どおりに計算すると、1時間分の音声が約0.81ドル(Flash)。Flash-Liteは約0.54ドルです。

Artificial Analysisがまとめた100万文字あたりの価格(英語基準)で比べると、差はさらに明確です。
| モデル | 100万文字あたり |
|---|---|
| Gemini 3.8 Flash TTS | $16.5 |
| Cartesia Sonic 3.6(標準音声1位) | $49 |
| ElevenLabs v3 Conversational | $50 |
| ElevenLabs Eleven v3 | $100 |
1位モデルの3分の1、ElevenLabsの最新モデルの 3分の1から6分の1 の水準です。さらに無料で使える枠もあります — この「無料」が、後で本当の問題になります。
大変なこと② 高いサブスクをやめたくなる
安いだけではありません。人々がブラインドで聞いて投票する Artificial Analysisのランキング(英語・標準音声) で、Gemini 3.8 Flash TTSは 2位 です。1位のCartesia Sonic 3.6(1,279点)との差は14点で、誤差範囲(±17)より小さく、事実上横並びです。ElevenLabsの最新モデル2つ(1,196点・1,169点)はその下です。

ところが 音声クローンのランキングは別 です。同じ8つのクローン音声で競うランキング(Controlled Voice・英語)では、Gemini 3.8 Flash TTSは 12位 に下がり、ElevenLabs Eleven v3が 6位 で上です。標準音声だけなら高いサブスクを見直す価値はありますが、クローンの品質は別に見るべきです。
では、韓国語で、自分の声ならどうか。実際に試しました。
本物はどれ? — ブラインドテスト
同じ文を3つの声で用意しました。
- 本当に自分で録音したもの
- Geminiでクローンした自分の声
- ElevenLabs v3でクローンした自分の声

動画ではA・B・Cに並べ替えて2ラウンド聞いていただきます(1:47から)。一つ断っておくと、テストの文はGeminiのクローン作成に使った元の録音に含まれていた文なので、Geminiに少し有利なテスト です。何問正解したか、動画のコメントで教えてください。
大変なこと③ 自分の声が要らなくなった
⚠️ ネタバレ:動画のどんでん返しです。
本物の録音だと明示した部分を除けば、動画のナレーションは 最初から最後まですべてGeminiでクローンした自分の声 です。台本を文字で入力しただけです。

クローンに必要なのは2つでした。
- 自分の声の録音 — 10〜30秒。私は21秒を使いました。
- 同意文の録音 — 本人が自分で読み上げる必要があります。同意文はドキュメントに30言語分用意されていて、「この声の持ち主であり、Googleがこの声を使って音声合成モデルを作ることを許可する」という内容です。
本人が読んだ同意録音がなければ、クローンはできません。2つのファイルをアップロードして 7秒ほど で、自分の声ができあがっていました。
面白いのは声の年齢です。以前ElevenLabsで作ったクローンは数年前の録音から作ったので、自分には少し若く聞こえます。Geminiの方は最近の録音から作りました。AIは声の年齢までまねる わけです。
大変なこと④ 台本に演技まで書くことになる
もう声を選ぶのではなく、文章で説明して作ります。「温かくハスキーな60代の語り手」「興奮しやすい20代のスポーツ実況」のように、一、二文で十分です。
台本の中に演技の指示も入れられます。<short pause>、<sigh>、<laugh> のようなタグでため息・笑い・間を書き、スタイルに「ささやくように」と書けばささやきます。2人の会話も1回で作れます(標準音声の場合)。声優のキャスティングを文章で行う時代が来たわけです。
実際に使ってみる — Google AI Studio
コードなしで、Google AI Studioの音声生成画面 からすぐに試せます。

- AI Studioで音声生成(Generate speech)画面を開き、モデルを Gemini 3.8 Flash TTS にします。
- 読ませる文を入力して Run を押すと、すぐに読み上げます。
- 声のボタンから用意された声(2,000種類以上)を選ぶか、クローン・デザインで新しい声 を作ります。どちらも 請求先を設定したAPIキー が必要です。クローン用の2つの録音もここで直接録れます。
- 話し方は Style 欄に文章で書きます(例:「呆れて悔しそうな口調で」)。入力したら Enterで確定しないと 適用されません — そのまま閉じると反映されません。
- 演技タグは覚えなくても、Expression の一覧から選べばカーソル位置に入ります。
- ボイスデザインは説明を書いて Generate を押すと候補が3つ出るので、聞き比べて選びます。
💡 Get codeの注意: 右上のGet codeでPythonコードを取得できますが、Styleに書いた話し方は抜け落ち、クローン音声はIDではなく 表示名だけ が入ります。そのまま実行するとエラー(HTTP 400)になるので、声のIDと話し方は自分で書き直す必要があります。
本当の問題① 無料で使うと
ここまでの「大変なこと」は、実はすべて自慢でした。ここからが本当の問題3つです。
自分の声が要らなくなったと書きました。でも 無料で使うと、Googleには必要かもしれません。
- Gemini APIの料金表には、無料枠の利用はプロダクト改善に使われる と書かれています(有料は使われない)。
- 規約によると、無料で送った内容と結果はGoogleのプロダクトやAIの改善に使われ、人間のレビュアーが読むこともあります。 レビュー前にアカウントとは切り離すとしていますが、声はそれだけで誰なのかが分かります。規約には個人情報を送らないようにとも書かれています。
- ところが音声クローンは 自分の声を送らないと作れない機能 です。AI Studioではクローンは有料キーでしか開きませんが、APIの無料キーでも使えないのかはドキュメントに書かれていません。
- 利用記録を見ると、クローン音声で話すたびに 元の録音の分量が入力として計上 されています。
実は私も、クローンを作り終えてからこれを読みました。幸い、私のキーは請求先が設定された有料でした。請求アカウントを設定した有料利用はプロダクト改善に使わない と書かれています。ただし不正利用監視用の記録は一定期間残ります。欧州経済領域・英国・スイスは無料でもこの条項の対象外ですが、日本や韓国は対象外になりません。
本当の問題② 思ったほど安くないかもしれない
- 英語以外では差が縮まります。 先ほどの価格比較は英語の文字数基準でした。Geminiは音声の長さで課金しますが、韓国語は1秒に読む文字数が英語より少なく(この動画のナレーションで約8.3文字/秒、英語は推定約13.6文字/秒)、文字数で課金するサービスと比べると差は縮まります。
- 今の価格は期間限定です。 2027年1月1日から、FlashとFlash-Liteの価格はどちらも 2倍 になります。1時間0.81ドルが1.62ドルになります。
本当の問題③ まだできないこと
- 韓国語のスコアがありません。 私が調べた主要な公開ランキングには、韓国語のスコアがまったくありません。だから動画で実際に聞いていただきました。
- 海外のレビューでは、標準音声がどれも似ている という評価もありました。
- 1回で会話できるのは 2人まで、しかも標準音声の場合だけ です。クローン音声同士は別々に作ってつなぐ必要があります。
- 応答速度の公開数値がありません。 リアルタイムのサポート用途なら慎重に確認が必要です。
- 一部の地域(AI Studio基準で英国・欧州経済領域・スイス・インド・米テキサス州・イリノイ州)では クローンがまったく使えません。
悪用が心配かもしれませんが、Googleは本人の同意録音を求め、すべての音声にSynthIDの透かし を入れています。ただし、この透かしは耳では聞こえません。
結局、使うべき?

| 用途 | おすすめ |
|---|---|
| YouTubeのナレーション・オーディオブック | Gemini 3.8 Flash TTS — 十分使えます。ただし請求先を設定した有料で |
| 大量の吹き替え・低予算 | Flash-Lite、または半額の Batch |
| リアルタイムのサポートボット | 応答速度を公開しているサービスとまず比較(Voice Arena 米国英語の中央値:Sonic 3.6 341ms・Inworld TTS-2 169ms・Simba 3.2 123ms、Gemini 3.8は未計測) |
| キャラクターの個性・クローン品質 | まだ ElevenLabs も良い選択 |
本当に気をつけるべきは3つ。無料枠の規約、2027年の価格、そして英語以外の言語は実際に聞いて選ぶこと。
この動画の作り方
ナレーションを作る間に私がマイクの前で話したのは 1分未満 — クローン用の元録音と同意文、ブラインドテスト用の本物の録音だけです。残りはすべて文字でした。
動画そのものも、AIコーディングツール Claude Code に渡した数行から始まりました。最初のプロンプトは、Googleの発表記事のURLとこの2行(韓国語)です。
gemini 3.8 tts 가 매우 좋다고 하는데, 장단점과 타사와 비교등을 해서 가장 중요한 것을 궁금한 것으로(훅) 만들어서,
영상을 제작했으면 해. 먼저 관련 정보를 조사를 해도 되고, 해줄 수 있어?
「Gemini 3.8 TTSがとても良いらしいので、長所と短所、他社との比較などをして、一番重要な点を気になる問い(フック)にして動画を作ってほしい。先に関連情報を調べてもいい。できる?」
その後の会話で、長尺の形式、「損したように見せる」フック、自分の声のクローン、台本レビューといった方向を決めました。調査から台本、ナレーション生成、動画の組み立てまで、この流れの上で作られています。
出典
2026年9月23〜26日に確認した内容で、数値は変わる可能性があります。
