Google、Gemini 3.8 TTS音声モデルを発表
मूल शीर्षक: Gemini 3.8 text-to-speech
यह क्यों महत्वपूर्ण है
TTSのカスタム性と感情制御が向上することで、コンテンツ制作や音声UIの開発コストが大きく変わり得る。
Googleは2026年9月23日、Gemini 3.8 Flash TTSおよびGemini 3.8 Flash-Lite TTSを発表した。両モデルはGoogle AI Studio、Gemini API、Gemini Enterprise、Gemini Notebook、Google Vidsで利用可能。カスタム音声生成と台詞演出に対応する。
Googleは、テキスト読み上げ(TTS)分野の新モデルとして「Gemini 3.8 Flash TTS」と「Gemini 3.8 Flash-Lite TTS」を公開した。同社は両モデルを「これまでで最も表現力豊かな音声生成モデル」と位置づけている。
主な機能は三つある。一つ目は、自然言語プロンプトだけでゼロからカスタムキャラクターボイスを作成、または既存の声を複製できる点。二つ目は、台詞をライン単位で演出し、ペーシング・感情・会話的なサウンドをきめ細かく制御できる点。三つ目は、高品質なオーディオブック制作など長尺コンテンツへの対応だ。
提供プラットフォームはGoogle AI Studio、Gemini API、Gemini Enterprise、Gemini Notebook、Google Vidsと幅広く、開発者から一般ユーザーまでを対象とした展開となっている。発表はGroup Product ManagerのLeland Rechis氏と、Gemini Audioチームを代表するResearch ScienceディレクターのAlan Cowen氏が連名で行った。Flash-Liteは軽量版として位置づけられており、処理速度やコスト面での差別化が想定される。