ショート動画の声を0円に|有料の声のクローン・Irodori-TTS・Gemini 3.8を聞き比べた
かつ
2026/09/28
ショート動画のナレーションは、自分の声をAIで複製した「クローン音声」で作っています。これまでは有料のサービスを使っていました。
同じことが無料のAIや、もっと安いAIでできるなら、今のままにしておく理由はありません。そこで、同じ台本を3つのAIで読ませて、聞き比べと数字の両方で比べました。
この記事の内容を、1分ほどのショート動画にしました。動画の声は、無料の Irodori-TTS で作っています。
3行でまとめると
- これまでの有料のクローン音声は、要らなかった。無料の Irodori-TTS と聞き比べても、違いはほとんど分からなかった
- 完全に0円でいくなら Irodori-TTS。自分のPCで動き、ライセンスはMITで商用にも使える
- 少しの費用を払えるなら Gemini 3.8 Flash TTS。これまでの有料より自然なイントネーションで(本人の判定)、ショート1本が約0.02ドル。こちらも商用に使える
比べた3つ
| 費用 | 声の作り方 | |
|---|---|---|
| これまで:MiniMax Speech-02-HD(Replicate 経由) | 使った分だけ払う | 録音を登録して、声のIDを作る |
| 0円でいくなら:Irodori-TTS | 0円(自分のPCで動く) | 手本の録音を毎回渡すだけ |
| 少額を払うなら:Gemini 3.8 Flash TTS | ショート1本 約0.02ドル | 手本と、本人が同意文を読んだ録音を登録する |
これまでの有料のほうは、2026年8月の Replicate の請求で、声の登録が3.00ドル、読み上げが0.20ドルでした(カツプロ調べ)。
Irodori-TTS は、手本の音声を渡すだけで、その声で読んでくれる音声合成です。学習をやり直す必要はありません。
Aratako/Irodori-TTS-v4.1-Small · Hugging FaceWe’re on a journey to advance and democratize artificial intelligence through open source...Gemini 3.8 Flash TTS は、Google が2026年9月23日に出した音声合成です。30秒ほどの録音から、本人の声を複製できます(Google の公式ブログ)。
Gemini 3.8 text-to-speech says helloGemini 3.8 Flash-Lite TTS and Gemini 3.8 Flash TTS are our most expressive audio models ye...
比べ方
以前に公開したショート動画の台本(9カット)を、そのまま使いました。
- MiniMax は、公開した動画で使った音声そのもの
- Irodori-TTS と Gemini は、同じ台本を新しく読ませたもの。手本は、どちらも同じ日にスマートフォンで録った、ふだんの話し声
- 3つとも、読み方をそろえるため、数字や英語はかなに直した同じ文を渡した
聞き比べ
同じ文を読ませた音声です。
文1:日付と英語の名前が入った文
「9月22日、Opus 5.5と、GPT-6のSolとLunaが、同じ日に出ました。売りは、どちらも安さです。」
これまで(MiniMax・有料)
Irodori-TTS(0円)
Gemini 3.8 Flash TTS(少額)
文2:カタカナ語が多い文
「APIで使っている人は注意。effortを指定しないと、highではなく、mediumで動きます。」
これまで(MiniMax・有料)
Irodori-TTS(0円)
Gemini 3.8 Flash TTS(少額)
本人が聞き比べた結論は、MiniMax と Irodori-TTS は「差はあまりない」、Gemini は「こちらの方が自然なイントネーション」でした。
数字で比べた結果
本人の声にどれだけ似ているか
声の主が同じ人かを見分けるためのAIモデル(microsoft/wavlm-base-plus-sv)で、本人の録音との似ている度合いを測りました。1に近いほど同じ人です。比べる基準には、どの手本にも使っていない本人の録音を使いました。
| 声 | 似ている度合い(9カットの平均) |
|---|---|
| 本人の別の録音(目安の上限) | 0.979 |
| Gemini 3.8 Flash TTS | 0.963 |
| これまで(MiniMax) | 0.956 |
| Irodori-TTS | 0.944 |
| 別人の声4種(目安の下限) | 0.599〜0.799 |
出典:カツプロ調べ(2026年9月28日)
3つとも別人よりはっきり本人の側にあり、いちばん高い Gemini といちばん低い Irodori-TTS の差は0.019でした。
読み間違い
9カットずつ文字起こしのAI(faster-whisper)にかけて、台本と比べました(カツプロ調べ)。
| 台本と違って聞き取られた所 | |
|---|---|
| Irodori-TTS | 1か所(「システム開発」→「ジステム開発」) |
| Gemini 3.8 Flash TTS | 2か所(「売りは」→「売り場」、「測り方」→「はかに方」) |
文字起こしのAIの聞き違いも混ざるので、ここは目安です。どちらも、そのカットだけ作り直せば直せます。
長さ
| 9カットの声の合計 | |
|---|---|
| Gemini 3.8 Flash TTS | 70.3秒 |
| これまで(MiniMax) | 75.0秒 |
| Irodori-TTS | 82.5秒 |
出典:カツプロ調べ
MiniMax は速さを1.06倍に指定して作っていました(2カットだけ0.95倍)。Irodori-TTS は1割ほどゆっくり読みます。気になるときは、できた音声の間を詰めて速くすれば、作り直さずに合わせられます。
作る時間と費用
| 1カットを作る時間 | ショート1本(9カット)の費用 | |
|---|---|---|
| Irodori-TTS | 30〜108秒(ノートPC・GeForce RTX 3050 Ti Laptop 4GB) | 0円 |
| Gemini 3.8 Flash TTS | 8.7秒(1本目で測った値) | 約0.020ドル |
出典:カツプロ調べ。Gemini の費用は、返ってきた音声のトークン数(9カットで2,254)に、2026年12月31日までの料金(100万トークンあたり9ドル)を掛けたもの。2027年1月1日からは料金が倍になります(Gemini API の料金ページ)。
商用利用
ショート動画は広告や集客に使うので、商用で使えるかを公式の資料で確かめました(2026年9月28日)。
| Irodori-TTS | Gemini 3.8 Flash TTS | |
|---|---|---|
| 商用利用 | できる(ライセンスは MIT) | できる(作ったものの所有権を Google は主張しない) |
| 声の複製の条件 | 本人の同意なしに他人の声をまねることは禁止 | 本人が同意文を読んだ録音が必須。声が同じ人か Google が照合する |
| 送った台本の扱い | 自分のPCから出ない | 有料枠なら Google の改善に使われない。無料枠では使われる |
| AIで作った印 | なし | すべての音声に電子透かし(SynthID)が入る |
出典:Irodori-TTS のモデルページ(Hugging Face)、Gemini API 追加利用規約、Google の公式ブログ
Gemini API Additional Terms of Service | Google AI for Developers
どちらも、自分の声か、本人の許可をもらった声なら商用で使えます。Gemini は無料枠でも音声を作れますが、公開前の台本を送るなら、課金を有効にした有料枠で使うほうが安心です。また Google の禁止事項では、人をだます目的で、開示せずに実在の人物になりすますことが禁止されています(Google 生成 AI の使用禁止に関するポリシー)。
うまくいった理由は「手本の録音」
じつは以前にも、Irodori-TTS で自分の声を作ったことがあります。そのときは「声が変」と感じて、自分で録音し直しました。
そのときの手本は、発声練習の録音(「あめんぼ赤いな あいうえお」)でした。Irodori-TTS は、手本の声だけでなく読み方までまねます。区切って大きく読む発声練習を渡すと、ナレーションもその調子に寄ってしまいます。
今回は、ふだん話すように読んだ22秒の録音を手本にしました。同じ台本を2つの手本で読ませて文字起こしにかけると、発声練習を手本にしたほうは「かかった」が「かたった」、「ミディアム」が「メディアム」と聞き取られました。ふだんの話し声のほうは、上の1か所のほかは台本どおりでした(カツプロ調べ)。
手本を録るときのコツです。
- 誰かに話しかけるつもりで、ふつうの速さで読む
- 静かな部屋で、口から少し離して録る
- 長さは20秒ほど(今回は22秒)。棒読みの文より、少し気持ちの入る文のほうがよい
Gemini で声を作るときのつまずき
Gemini は、手本と一緒に本人が同意文を読んだ録音を送らないと、声を作れません。ここで何度か断られました(カツプロ調べ)。
| 試したこと | 結果 |
|---|---|
| 手本と同意文を、別々に録った | 「別人」と判定された(同じスマートフォンで8分違いでも) |
| 2つの音量をそろえる加工をした | 「AIで作った声か、透かしが入っている」と判定された |
| 日本語の手本に、英語の同意文を付けた | 「読んだ文が画面の文と違う」と判定された |
| 1本の録音に、手本と日本語の同意文を続けて読んだ | 通った |
日本語の同意文は「私はこの音声の所有者であり、Googleがこの音声を使用して音声合成モデルを作成することを承認します。」です(Gemini API のドキュメント)。手本と同意文は、1本の録音に続けて読むのが確実でした。作った声は1年間使えます。
まとめ
自分の声のナレーションは、これまでの有料のクローン音声をやめて、次のように使い分けます。
- 完全に0円でいくなら Irodori-TTS。聞き比べても有料との差はほとんど分からず、自分のPCで動くので台本も外に出ない
- 少しの費用を払えるなら Gemini 3.8 Flash TTS。これまでの有料より自然なイントネーションで(本人の判定)、作るのも速い。ショート1本で約0.02ドル
- どちらも、手本は発声練習ではなくふだんの話し声で録る
「最初に選んだから」という理由だけで、有料のサービスを使い続けていることはよくあります。一度、ほかのものと並べて聞いてみる価値はあります。
関連記事
この記事の著者・監修
カツ
カツプロ運営者のカツです! AI・Web関連から、日常のことなど、私目線の回答も交えながらお伝えします!
この記事をシェア
カツプロ(ホーム)
カツプロ AI SEO
サイト診断
MoteRaku
デザインギャラリー
画像ツール
カツプロPR