Google、Gemini 3.8 TTS発表

原題: Gemini 3.8 text-to-speech

なぜ重要か

音声AIの表現力向上と多プラットフォーム展開により、コンテンツ制作・エンタープライズ向け音声サービス市場でのGoogleの存在感が一段と増す。

Googleは2026年9月23日、音声合成モデル「Gemini 3.8 Flash TTS」および「Gemini 3.8 Flash-Lite TTS」を発表した。自然言語プロンプトによるキャラクターボイスの作成・複製、感情やペーシングの行単位制御が可能で、Google AI Studio、Gemini API、Gemini Enterprise、Gemini Notebook、Google Vidsで利用できる。

Googleは新たな音声合成(TTS)モデル2種を公開した。「Gemini 3.8 Flash TTS」と「Gemini 3.8 Flash-Lite TTS」で、同社はこれらを「これまでで最も表現力豊かな音声生成モデル」と位置づけている。

主な機能は3点。まず、自然言語プロンプトだけでゼロからオリジナルのキャラクターボイスを生成したり、既存の声を複製したりできる。次に、セリフを1行ずつ「ディレクション」することで、ペーシング・感情・会話的なニュアンス(笑いや間など)を細かく制御できる。さらに、高品質なオーディオブック制作など長尺コンテンツへの対応も想定されている。

提供プラットフォームはGoogle AI Studio、Gemini API、Gemini Enterprise、Gemini Notebook、そしてビデオ制作ツールのGoogle Vidsと幅広い。開発者から一般ビジネスユーザーまで、異なる用途に対応する。

ブログポストはGroup Product ManagerのLeland RechisとResearch Science DirectorのAlan Cowen(Gemini Audioチーム代表)の連名で公開された。Gemini 3.8シリーズのフラッグシップモデルが持つ推論能力とは異なり、このTTSモデル群はリアルタイム性と軽量動作を重視したFlash系列に位置付けられており、コスト効率の面でもメリットがある。

出典

blog.google — 元記事を読む →