Googleは2026年9月23日、テキスト読み上げモデル「Gemini 3.8 Flash TTS」と「Gemini 3.8 Flash-Lite TTS」の2つを発表しました。自然言語プロンプトによる音声の新規作成、100以上の言語・方言への対応、2,000以上の本番運用向け音声、30秒の音声サンプルからの音声複製を備えます。発表はGroup Product ManagerのLeland Rechis氏とDirector, Research ScienceのAlan Cowen氏が、Gemini Audio Teamを代表して行いました。
GeminiはGoogle DeepMindが開発するAIモデルのファミリーで、文章・画像・音声・動画を扱うマルチモーダル理解に対応しています。
2モデルの役割分担
Gemini 3.8 Flash TTSは創作的なディレクションとキャラクター設計を担う位置づけで、自然言語プロンプトから音声をゼロから作成し、演技上のキュー、ペース、方言の変化、相づち(backchanneling)を行単位で指示できます。Gemini 3.8 Flash-Lite TTSは大量処理とコスト効率に最適化され、大規模な吹き替え、音声コンテンツ制作、表現力のある音声エージェントを対象に、トーンやペース、表現のニュアンスを細かく制御します。
両モデルは、3.5 Live Translate、3.5 Transcribe、3.8 Live、3.8 Live Extended Thinkingに続くGemini Audioファミリーの追加となります。
仕様と数値
| 項目 | 内容 |
|---|---|
| 既存のオリジナル音声 | 30 |
| 本番運用向け音声ライブラリ | 2,000以上 |
| 対応言語・方言 | 100以上 |
| 音声複製に必要なサンプル | 30秒 |
| 安全機能 | 生成音声への透かし(watermarking) |
音声ライブラリには、メキシコ・スペイン語、ケベック・フランス語、スコットランド英語といった地域変種が含まれます。原文では、メルボルン出身の高エネルギーなDJの声、金属的で平坦なロボットの声、日本語のドラゴンの声といったデモが紹介されています。
試し方と提供場所
利用にあたっては、自然言語プロンプトで役割、アクセント、声の特徴を指定してカスタム音声を作成します。音声は行ごとに指示でき、演技上のキュー、ペース、方言の変化、相づちを制御します。Gemini 3.8 Flash TTSでは、30秒の音声サンプルから一貫した声の特徴を再現する音声複製が使えます。
提供場所はGoogle AI Studio、Gemini API、Gemini Enterprise、Gemini Notebook、Google Vidsです。
背景と意味
Googleは今回のモデルを、固定プリセット型の音声生成から、自然言語による音声設計と細かな演技指示ができる制作環境への転換と位置づけています。対象用途として、高品質なオーディオブック、ポッドキャスト、ゲーム、吹き替え、リアルタイム音声エージェントを挙げ、Flash TTSは創作性とキャラクター設計、Flash-Lite TTSは大量処理とコスト効率を重視する構成としています。
Hacker Newsでは、この発表を扱った投稿が93ポイント・56コメントを集めています。

まだコメントはありません。