AI音声クローン用の録音のコツと、読み間違い(促音・数字)の修正方法
高価なスタジオを使わずに自宅で反響を抑えた音声を録音する手順と、音声合成時に発生しやすい漢字や数字の読み間違いを防ぐ実践テクニック。
音声サンプルで本当に大切なこと
ニューラル音声モデルは、マイクが拾った音をそのまま学習します。フローリングのリビングや壁に囲まれた部屋で録音すると、部屋の反響音まであなたの声の一部として覚えてしまいます。パソコンのファンが回っていると、生成したすべてのセリフの裏にうっすらとノイズが残り続けます。
高価な防音室は必要ありません。大切なのは、部屋の響きや背景のノイズが入っていない、乾いた直接音を録ることです。
1. 音が反響しない場所を探す
一般的な部屋の壁や窓ガラスは音を強く跳ね返します。声を出してから数ミリ秒後に跳ね返った音がマイクに入り込み、お風呂場のような反響を生みます。AIには、声帯から直接出た音と壁から反射した音を綺麗に分けることができません。
自宅で手軽にできる対策:
- クローゼットの中。 冬物のコートやセーターが掛かったクローゼットに向かって声を出すと、布地が中高域の音を吸い取ってくれます。安価な吸音パネルを貼るよりも効果的です。
- 枕と毛布。 机の上で録音する場合は、マイクの後ろに厚手のクッションや枕を置き、自分の背中側に厚手の毛布を羽織ることで、後ろの壁からの跳ね返りを防ぎます。
- 家電の音を止める。 録音する数十秒間だけでも、エアコン、扇風機、換気扇を消してください。パソコンのファンが気になる場合は、ケーブルの届く範囲で本体を遠ざけます。
2. マイクの選び方と置き方
定番のダイナミックマイクやUSBコンデンサーマイク、あるいは手元のiPhoneでも、配置さえ適切であれば十分な音質で録音できます。
| 機材 | 特徴 | 気をつける点 | 推奨距離 |
|---|---|---|---|
| ダイナミックマイク(Shure SM58, PodMicなど) | 周囲の雑音を拾いにくい | 感度が低いため入力ゲインを上げる必要がある | 口元から 5〜10 cm |
| コンデンサーマイク(AT2020など) | 高域の息づかいまで細かく拾う | 部屋の響きや屋外の音に敏感 | 口元から 15〜20 cm |
| スマートフォン(iPhoneなど) | 手軽で手元ですぐ録れる | 本体の自動補正で音が痩せやすい | 口元から 15 cm、斜め45度 |
録音時に意識したい3つのポイント
- マイクの正面から息を吹きかけない。 パ行やタ行を発音するときに出る息の塊がマイクの振動板に当たると、ボフッという低音ノイズが出ます。マイクを口の正面から30度から45度ほど横にずらし、口角を狙うようにセットすると息が直接当たりません。
- スマホの「声を分離」をオフにする。 iPhoneで録音する際、コントロールセンターの「マイクモード」が「声を分離」になっていると、機械学習フィルターが声の倍音成分まで削ってしまい、仕上がりが金属的なロボット声になります。必ず「標準」に戻して録音してください。
- 音量は -12 dB から -6 dB を目安にする。 一番声が張った瞬間でも 0 dB に当たらないように注意します。デジタルクリップ(音割れ)を起こした音声は、後からAIを使っても綺麗には修復できません。
3. 録音時間はどれくらい必要か?
長く録音すれば良いというものではありません。姿勢が変わったり声のトーンがぶれたりした5分の音声よりも、安定したトーンでノイズのない20〜30秒の音声のほうが、モデルは特徴を正確に捉えます。
目の前の同僚に普段のトーンで話しかけるような、自然な音量とスピードを意識してください。
録音用のサンプル文章
ビジネス用語や硬いスローガンではなく、日常的な会話や物語の文章を読むのがおすすめです:
今朝の電車は5分ほど遅れていましたが、ホームの人たちは特に気にする様子もありませんでした。駅前のコーヒースタンドでホットのカフェラテを買い、ベンチに腰掛けて読みかけの文庫本を開きました。ドアが開く頃には、ガラスの屋根に静かに雨が当たり始めていました。
文と文の間では自然に息を吸ってください。静かにしようとして息を止めながら話す必要はありません。自然な呼吸の区切りがあるほうが、モデルの息継ぎの再現度が高くなります。
4. 合成音声の読み間違いや不自然さを直すコツ
VoiceCloner で音声をクローンした後、テキストを入力して音声を生成する際、文章の書き方を少し調整するだけで発音の精度が大きく上がります。
数字・日付・助数詞
テキストエンジンは数字の扱いを誤りやすく、年号を数量として読んでしまうことがあります:
- 年号:
2026年でつまずく場合は、にせんにじゅうろくねんと直接ひらがなで書きます。 - 助数詞の促音化:
1本(いっぽん)を「いちほん」、3本(さんぼん)を「さんほん」、1回(いっかい)を「いちかい」と読んでしまうときは、迷わずいっぽんさんぼんいっかいとひらがな化します。 - 日付の訓読み:
4月1日は4月ついたち、20日ははつかと指定すると確実です。 - 記号や範囲:
3-5日は3日から5日、50%は50パーセントまたはごじゅっパーセントと書きます。
同形異音語の対策
前後の文脈で読み分けが難しい漢字は、ひらがなに置き換えるのが一番簡単です:
- 「角を曲がる」で「つの」と読まれるなら、
かどを曲がると書く。 - 「一日」が「ついたち」か「いちにち」か意図と合わない場合は、
ついたちまたはいちにちとひらがなにする。 - 「辛い料理」は
からい料理、「辛い日々」はつらい日々と書き分けます。
英語の略称やブランド名
アルファベットの略語をローマ字読みしようとして発音が崩れることがあります:
APIやTTSで違和感がある場合は、A-P-IやT-T-Sのようにハイフンで区切るか、エーピーアイとカタカナで指定します。- 英語と日本語が連続する場合は、前後に半角スペースを1つ挟むと、音節の切れ目が綺麗に処理されます。
句読点で話すテンポを整える
モデルにとって句読点は呼吸とピッチのリセット合図です:
- 読点(、) を入れると、約0.2秒の間が生まれ、声の高さが自然に整います。早口に感じられるときは、息を吸うポイントに読点を増やしてください。
- 句点(。) は文の終わりを示し、語尾のピッチが自然に下がります。
- 三点リーダー(…) を使うと、少し考え込むような落ち着いた間を演出できます。
5. アップロード前のチェック項目
音声ファイルを送信する前に、ヘッドホンで確認してください:
- 無音部分に冷蔵庫の音や外の車の走行音が入っていないか。
- パ行やタ行でボフッという吹かれノイズが出ていないか。
- 長さは20秒から40秒程度に収まっているか。
- WAVまたは192kbps以上のMP3で書き出されているか。
準備ができたら、VoiceCloner で音声モデルを作成してみてください。特定の単語の調整や長文の生成について気になる点があれば、お問い合わせ ページよりいつでもご連絡ください。