Google, Gemini 3.8 TTS モデル発表
원제: Gemini 3.8 text-to-speech
왜 중요한가
テキスト音声変換のコントロール粒度が上がることで、コンテンツ制作・エンタメ・教育向けの音声AI活用が大幅に広がる可能性がある。
Googleは2026年9月23日、新テキスト音声変換モデル「Gemini 3.8 Flash TTS」と「Gemini 3.8 Flash-Lite TTS」を公開した。自然言語プロンプトでゼロからカスタムボイスを作成・複製でき、ペース・感情・会話音の制御がライン単位で行える。Google AI Studio、Gemini API、Gemini Enterprise、Gemini Notebook、Google Vidsの5プラットフォームで提供される。
Googleは2026年9月23日、音声生成モデルの新シリーズ「Gemini 3.8 Flash TTS」および「Gemini 3.8 Flash-Lite TTS」を正式発表した。同社は「これまでで最も表現豊かな音声生成モデル」と位置づけている。
最大の特徴は3点ある。第一に、自然言語プロンプトだけでゼロからカスタムキャラクターボイスを作成できること。既存の声を再現するクローニング機能も備える。第二に、台詞をライン単位で細かく演出できる「シーンダイアログ制御」機能で、ペース・感情・笑い声や息継ぎといったリアルな会話音まで指定可能だ。第三に、オーディオブック品質と評される高品質な音声出力を実現している。
提供先はGoogle AI Studio、Gemini API、Gemini Enterprise、Gemini Notebook、Google Vidsの5プラットフォーム。Group Product ManagerのLeland RechisとResearch ScienceディレクターのAlan Cowen(Gemini Audioチーム代表)が共同で発表を担当した。
公開日は2026年9月23日。具体的な価格設定や無料枠の詳細は現時点でブログ記事からは確認できていない。