同じ第1話を4回作り直した|音声AIを替えるたびに何が変わったか
かつ
2026/09/02
AIで全40話の連作アニメーションを作っています。 『はじめましての、つづき』『つづきの、はじめまして』——略して「つづはじ」です。
その第1話を、同じ絵・同じセリフのまま、4回作り直しました。 声の道具を替えるたびにです。
この記事では、その4本をそのまま並べます。 順に見ると、何がどう変わったかが分かると思います。
この記事で分かること
- 音声AIを替えると、同じ台本でもここまで変わる
- 「AI感がある」の正体は何だったのか
- 2週間で6つのサービスを試した末に、どこに落ち着いたか
① ElevenLabs(8月22日)
演技はいちばん良かったです。 日本語の疑問形が自然に上がり、音声タグでの指示もよく効きました。
ただ、これは使えなくなりました。 24話まで作ったところで、同じ設定なのに声が別人になったからです。版を固定する手段がありませんでした。
詳しくはこちら → AIの声が一晩で別人になった
② Qwen3-TTS(8月24日)
手元で動くので、版が変わりません。 無料で、オリジナルの声も作れます。前の問題は解決しました。
でも日本語のアクセントが不安定でした。 第1話の「あるあるかあ、体験してみたいな」——この語尾がどうしても上がる。何十回作り直しても直りませんでした。
③ Style-Bert-VITS2(8月27日)
アクセントは解決しました。 3000ステップの学習で、語尾の上がりが消えました。
今度は演技が平坦になりました。 どのセリフも同じ調子で読まれます。物語の起伏が付きません。
★ ここで**「原因は読み方ではなく、参照させていた音のほうにある」**と分かりました。 こもった音を参照に混ぜると、声そのものが濁ります。測ったら、参照音声の帯域が3,036〜4,428Hzしかありませんでした。
④ Irodori-TTS(8月28日・いま)
学習が要りません。 参照する音声を渡すだけで、その声で読みます。
AI感が消えました。 アクセントも自然で、演技も付きます。
演技の付け方も変わりました。指示文で「悲しそうに」と書くのではなく、参照する音声そのものを場面ごとに使い分けます。 芝居の入った音を参照させると、その芝居ごと乗ります。
いまの構成
| 役割 | 使うもの |
|---|---|
| オリジナルの声を作る | Qwen3-TTS |
| 本番のセリフを読ませる | Irodori-TTS |
声を作る道具と、読ませる道具を分けました。
②で作った声を、④に読ませています。どちらも手元で動くので、モデルの重みごと自分で持っています。 提供元の都合で声が変わることはありません。
費用は0円です。
2週間かけて分かったこと
6つ試して、判断の軸が5つに固まりました。上ほど重要です。
| ① 版を固定できるか | 半年後に同じ声が作れるか |
| ② オリジナルの声が作れるか | 他人の声を使わない。権利の説明ができる |
| ③ 日本語の自然さ | 「AIが喋っている感じ」が混ざらないこと |
| ④ 演技 | 場面に合った話し方ができること |
| ⑤ コスト | 40話ぶん・作り直しを含めて現実的か |
★ 最初は④から選んでいました。 ①は、リストに入ってすらいませんでした。
①が最優先だと分かったのは、24話ぶんを作り直したあとです。
これから作る人へ
上の4本を、音を出して順に見てください。 ①から④まで、同じ台本です。
「良い声」の基準は、聴き比べないと分かりません。 私は①を聴いた時点で「これでいい」と思っていました。④を作ってから戻って①を聴くと、はっきり違いが分かります。
1つの道具で決め打ちせず、同じ素材で2〜3個作って並べてください。 半日で済みます。
つづはじについて
全40話、2026年9月1日から毎日1話ずつ公開しています。 作り方・かかった費用(約122,800円)・失敗したことは、特設ページに全部書いています。
この記事をシェア