🔊
テキスト音声合成(TTS)
テキストを自然な音声に変換
現代TTSは過去のルールベース/連結合成からディープラーニングベースに進化しました。Tacotron/FastSpeechのようなモデルがテキストをメルスペクトログラムに変換し、ボコーダー(WaveNet、HiFi-GAN)がこれを波形に変換します。最新技術はLLMベースTTS(VALL-E、Bark)で、テキスト→オーディオトークン→波形の過程を経ます。3秒の参照音声だけで声を複製するZero-shot Voice Cloningが可能になり、OpenAIのGPT-4oはテキスト理解+音声生成を1つのモデルで処理します。
キーコンセプト
1
テキスト前処理: 正規化、音素(phoneme)変換、韻律分析
2
テキストエンコーダ: 音素シーケンスを潜在表現に変換
3
デコーダ: 潜在表現 → メルスペクトログラム(時間-周波数表現)を生成
4
ボコーダー(HiFi-GAN、WaveNet): メルスペクトログラム → オーディオ波形変換
5
最新LLMベース: テキスト → オーディオトークン(Neural Codec) → 波形
6
後処理: ノイズ除去、ボリューム正規化
メリット
- ✓ 人間と区別困難な自然な音声
- ✓ Zero-shot音声複製
- ✓ 感情/抑揚/速度の制御が可能
- ✓ 多言語対応
デメリット
- ✗ ディープフェイク/詐欺悪用のリスク
- ✗ 感情表現がまだ不完全な場合
- ✗ 長いテキストで安定性低下
- ✗ 話者の同意なき音声複製の倫理問題
ユースケース
OpenAI TTS / GPT-4o音声モード
ElevenLabs音声クローニング
オーディオブック自動生成
リアルタイムAI音声アシスタント
多言語同時通訳TTS