カツプロ
ログイン
← 投稿一覧
つづはじAI・生成AI 2026年9月2日

同じ第1話を4回作り直した|音声AIを替えるたびに何が変わったか

かつ

かつ

2026/09/02

つづはじ 第1話のケイ|同じ第1話を4回作り直した

AIで全40話の連作アニメーションを作っています。 『はじめましての、つづき』『つづきの、はじめまして』——略して「つづはじ」です。

その第1話を、同じ絵・同じセリフのまま、4回作り直しました。 声の道具を替えるたびにです。

この記事では、その4本をそのまま並べます。 順に見ると、何がどう変わったかが分かると思います。

つづはじ 特設ページ


この記事で分かること

  • 音声AIを替えると、同じ台本でもここまで変わる
  • 「AI感がある」の正体は何だったのか
  • 2週間で6つのサービスを試した末に、どこに落ち着いたか

① ElevenLabs(8月22日)

演技はいちばん良かったです。 日本語の疑問形が自然に上がり、音声タグでの指示もよく効きました。

ただ、これは使えなくなりました。 24話まで作ったところで、同じ設定なのに声が別人になったからです。版を固定する手段がありませんでした。

詳しくはこちら → AIの声が一晩で別人になった


② Qwen3-TTS(8月24日)

手元で動くので、版が変わりません。 無料で、オリジナルの声も作れます。前の問題は解決しました。

でも日本語のアクセントが不安定でした。 第1話の「あるあるかあ、体験してみたいな」——この語尾がどうしても上がる。何十回作り直しても直りませんでした。


③ Style-Bert-VITS2(8月27日)

アクセントは解決しました。 3000ステップの学習で、語尾の上がりが消えました。

今度は演技が平坦になりました。 どのセリフも同じ調子で読まれます。物語の起伏が付きません。

★ ここで**「原因は読み方ではなく、参照させていた音のほうにある」**と分かりました。 こもった音を参照に混ぜると、声そのものが濁ります。測ったら、参照音声の帯域が3,036〜4,428Hzしかありませんでした。


④ Irodori-TTS(8月28日・いま)

学習が要りません。 参照する音声を渡すだけで、その声で読みます。

AI感が消えました。 アクセントも自然で、演技も付きます。

演技の付け方も変わりました。指示文で「悲しそうに」と書くのではなく、参照する音声そのものを場面ごとに使い分けます。 芝居の入った音を参照させると、その芝居ごと乗ります。


いまの構成

役割 使うもの
オリジナルの声を作る Qwen3-TTS
本番のセリフを読ませる Irodori-TTS

声を作る道具と、読ませる道具を分けました。

②で作った声を、④に読ませています。どちらも手元で動くので、モデルの重みごと自分で持っています。 提供元の都合で声が変わることはありません。

費用は0円です。


2週間かけて分かったこと

6つ試して、判断の軸が5つに固まりました。上ほど重要です。

① 版を固定できるか 半年後に同じ声が作れるか
② オリジナルの声が作れるか 他人の声を使わない。権利の説明ができる
③ 日本語の自然さ 「AIが喋っている感じ」が混ざらないこと
④ 演技 場面に合った話し方ができること
⑤ コスト 40話ぶん・作り直しを含めて現実的か

最初は④から選んでいました。 ①は、リストに入ってすらいませんでした。

①が最優先だと分かったのは、24話ぶんを作り直したあとです。


これから作る人へ

上の4本を、音を出して順に見てください。 ①から④まで、同じ台本です。

「良い声」の基準は、聴き比べないと分かりません。 私は①を聴いた時点で「これでいい」と思っていました。④を作ってから戻って①を聴くと、はっきり違いが分かります。

1つの道具で決め打ちせず、同じ素材で2〜3個作って並べてください。 半日で済みます。


つづはじについて

全40話、2026年9月1日から毎日1話ずつ公開しています。 作り方・かかった費用(約122,800円)・失敗したことは、特設ページに全部書いています。

つづはじ 特設ページ

この記事をシェア

note

スポンサーリンク

コメント(0)

まだコメントはありません。

コメントは Tier 1(有料)の機能です。ログインのうえアップグレードしてください。

こちらの記事も読まれています