Gemini 3.8 Flash TTSがおすすめな理由|日本語が自然で声も作れる、ショート1本約3円
かつ
2026/09/28
AIの声(音声合成)を探しているなら、2026年9月23日に Google が出した Gemini 3.8 Flash TTS をおすすめします(発表日は Google の公式ブログ)。
実際にショート動画のナレーションと、短い映画風の動画のセリフで使ってみて、日本語のイントネーションが自然で、声を一から作れて、しかも安いことが分かりました。使って分かった注意点も合わせてまとめます。
3行でまとめると
- 日本語のイントネーションが自然。これまで使っていた有料の声と聞き比べて、「Gemini の方が自然」という判定だった
- 声を一から作れる・自分の声を複製できる。前のモデルでは、用意された声から選ぶことしかできなかった
- 安くて速い。ショート動画1本(9カット)の声が約0.02ドル、1カット10秒足らずで返ってくる。商用にも使える
聞いてみてください
どれも Gemini 3.8 Flash TTS で作った声です。
自分の声を複製した声(演技の指示なし)
「9月22日、Opus 5.5と、GPT-6のSolとLunaが、同じ日に出ました。売りは、どちらも安さです。」
同じ声に、緊迫した演技を付けた声
「ああ。ティラノサウルスの足あとだ。まだ新しい。」
「走れ!森の中へ、こっちだ!」
文章で説明して、一から作った声(20歳前後の女性)
「博士、これ……足あと?」
「地面が……ふるえてる。」
おすすめする理由
1. 日本語のイントネーションが自然
自分の声を複製して、ショート動画のナレーション(9カット)を読ませました。これまで使っていた有料の音声サービスと同じ台本で聞き比べると、本人の判定は「Gemini の方が自然なイントネーション」でした。
9カットを文字起こしのAIにかけて台本と比べると、違って聞き取られたのは2か所だけでした(カツプロ調べ)。
聞き比べの音声は、こちらの記事で聞けます。
ショート動画の声を0円に|有料の声のクローン・Irodori-TTS・Gemini 3.8を聞き比べた
2. 声を一から作れる・自分の声を複製できる
| できること | 中身 |
|---|---|
| 声の設計 | 年齢・声の質・話し方を文章で説明して、新しい声を作る |
| 声の複製 | 30秒ほどの録音から、本人の声を複製する(本人の同意の録音が必要) |
| 用意された声 | 2,000以上の声から選ぶ |
| 言語 | 100以上の言語で話せる |
出典:Google の公式ブログ(2026年9月23日の発表)
Gemini 3.8 text-to-speech says helloGemini 3.8 Flash-Lite TTS and Gemini 3.8 Flash TTS are our most expressive audio models ye...
前のモデル(2.5)のころは、用意された声から選ぶだけで、自分で新しい声を作ることはできませんでした(以前の記事)。作った声はIDで保存され、何度でも同じ声で話せます(1つのプロジェクトで200個まで・1年間。Gemini API のドキュメント)。
演技も、文章で付けられます。「緊迫して、少し速めに、自然な声で」のように書くと、そのとおりの調子で読みます。
3. 安くて速い
| 実際にかかったもの | |
|---|---|
| ショート動画1本(9カット・声の合計70.3秒) | 約0.020ドル(約3円) |
| 映画風の動画のセリフ(37本・作り直し込み) | 0.030ドル(約5円) |
| 1カットを作る時間 | 8.7秒(1本目で測った値) |
出典:カツプロ調べ(API 使用量の記録)。円は1ドル157.59円で換算。
料金は、2026年12月31日までは作った音声100万トークンあたり9ドル、2027年1月1日からは18ドルです。音声10秒あたり約0.00225ドルの計算です(Gemini API の料金ページ)。無料枠もあります。
Gemini Developer API pricing | Gemini API | Google AI for DevelopersGemini Developer API Pricing
4. 商用に使える
- 作ったものの所有権を、Google は主張しない(Gemini API 追加利用規約)
- 有料枠なら、送った台本が Google の改善に使われない。無料枠では使われるので、公開前の台本を送るなら有料枠がおすすめ(同規約)
- 作った音声には、AIで作ったことが分かる電子透かし SynthID が入る(Google の公式ブログ)
使って分かった注意点
演技を強くすると、複製した声が本人に聞こえなくなる
複製した自分の声に「小声で」「叫んで」と強い演技を付けると、本人が聞いて「私の声に聞こえない」と感じました。声の主が同じ人かを見分けるAIモデル(microsoft/wavlm-base-plus-sv)で測っても、はっきり差が出ました(1に近いほど本人。カツプロ調べ)。
| 演技の指示 | 本人の録音との似ている度合い |
|---|---|
| なし | 0.970〜0.975 |
| 緊迫して、少し速めに、自然な声で | 0.881〜0.915 |
| 小声で・叫んで | 0.614〜0.841 |
| (目安)別人の声 | 0.726 |
自分の声らしさを残すなら、演技の指示は控えめにするのがおすすめです。
子どもの声は作れない
「10歳くらいの少女」の声を頼むと、「Voice prompt was blocked by safety policies.」(安全ポリシーで止めた)と返ってきて、作れませんでした(カツプロ調べ)。
漢字の読みは間違えることがある
「博士」を「はかせ」と読ませたいときは、声に渡す文だけ「はかせ」とひらがなにしました。字幕は漢字のままにできます。
自分の声の複製は、手本と同意文を1本の録音で
声を複製するには、手本の録音と、本人が決まった同意文を読んだ録音の2つが必要です。声が同じ人かを Google が照合します(Gemini API のドキュメント)。ここで何度か断られました(カツプロ調べ)。
| 試したこと | 結果 |
|---|---|
| 手本と同意文を別々に録った | 「別人」と判定された |
| 2つの音量をそろえる加工をした | 「AIで作った声か、透かしが入っている」と判定された |
| 日本語の手本に、英語の同意文を付けた | 「読んだ文が違う」と判定された |
| スマートフォンで1本の録音に、手本と日本語の同意文を続けて読んだ | 通った |
日本語の同意文は「私はこの音声の所有者であり、Googleがこの音声を使用して音声合成モデルを作成することを承認します。」です(Gemini API のドキュメント)。手本は、発声練習のような読み方ではなく、ふだん話すような20秒ほどの録音が向いています。
0円にこだわるなら
費用を完全に0円にしたいなら、自分のPCで動く無料の Irodori-TTS も選べます。自分の声のナレーションなら、これまでの有料の声と聞き比べても差はほとんど分かりませんでした。
- 完全に0円でいくなら Irodori-TTS
- 少しの費用を払えるなら Gemini 3.8 Flash TTS(イントネーションが自然・速い・声を一から作れる)
くわしくは聞き比べの記事に書いています。
まとめ
- Gemini 3.8 Flash TTS は、日本語のイントネーションが自然で、声を一から作れて、ショート1本約3円と安い
- 自分の声を複製するなら、演技の指示は控えめに。手本と同意文は1本の録音で
- 子どもの声は作れない。漢字の読みはひらがなで補う
この声を使って、短い映画風の動画も作ってみました。映像は苦戦しましたが、声は安く、自然に仕上がりました。
短いプロンプトだけでAIに恐竜映画を作らせた|5回作り直して13ドル、先に静止画が要る理由
関連記事
この記事の著者・監修
カツ
カツプロ運営者のカツです! AI・Web関連から、日常のことなど、私目線の回答も交えながらお伝えします!
この記事をシェア
カツプロ(ホーム)
カツプロ AI SEO
サイト診断
MoteRaku
デザインギャラリー
画像ツール
カツプロPR