Googleは2026年9月24日、Gemini 3.8 LiveにLive Avatar機能を追加し、Gemini Enterpriseで提供すると発表しました。低遅延ストリーミング動画をライブ対話モデルに直結させ、97言語でリップシンクと表情を切り替える視覚ペルソナを提供します。発表はResearch ScientistのShuo-yiin Chang氏と、Gemini Audio Teamを代表するSoftware EngineerのCJ Zheng氏が行いました。
GeminiはGoogle DeepMindが開発するAIモデルのファミリーで、文章・画像・音声・動画を扱うマルチモーダル理解に対応しています。
何が新しいか
Live Avatarは、Geminiのライブ対話機能に近リアルタイムの動画生成を組み合わせ、精密なリップシンク、自然な表情、流動的なターンテイキングを備えた動的な視覚ペルソナとして応答します。音声入力と映像入力を同時に処理し、音声と動画で返す構成です。
もう一つの軸は非同期のツール呼び出しです。対話を継続したままバックグラウンドでツールを実行してデータを取得できるため、ホテルのゲストチェックインのような複数段階のタスクを、会話の流れを止めずに処理できると原文は説明しています。
仕様
| 項目 | 内容 |
|---|---|
| 対応言語数 | 97言語 |
| 入力 | 音声・映像を同時処理 |
| 出力 | 音声と動画 |
| 多言語処理 | ネイティブのspeech-to-speech同期。会話の途中で言語を切り替えてもリップシンクと表情が追従し、動画の忠実度低下やvisual driftを起こさない |
| ツール実行 | 非同期のツール呼び出し(対話継続中にバックグラウンド実行) |
| ウォーターマーク | 音声・動画出力にSynthIDの不可視ウォーターマークを埋め込み |
提供条件と試し方
Gemini 3.8 Live with Live AvatarはGemini Enterpriseで利用できます。多様なプリセットアバターのライブラリが用意され、加えて組織独自のアバターをカスタマイズできます。カスタムでは、高品質な参照画像から、参照元の顔立ち、ブランドスタイル、キャラクターのアイデンティティを保持したまま、フルアニメーションで応答するアバターを生成できます。ただしカスタムアバター作成は現時点でenterprise allowlisting経由のみの提供です。
背景と意味
原文は、企業の顧客サービスやインタラクティブな案内(walkthrough)といった用途を挙げ、企業がバーチャル対応をより双方向に広げられる点を意義として示しています。また、アイデンティティの尊重を目的とした安全策を設け、AI生成コンテンツを透明に保つことを狙いとしています。

まだコメントはありません。