この記事のポイント
- Gemini 3.8 Live with Live Avatarは、音声と映像をほぼリアルタイムで生成する企業向け機能だ。
- 97言語へ対応し、会話を続けながら裏でツールを動かせるとGoogleは説明する。
- 人に似るほど誤認も強まるため、AI表示、本人同意、人への引き継ぎを先に設計したい。
サムネイルはイメージ写真。写真の配布元:Unsplash(利用許諾)。紹介するサービスの画面ではない。

GoogleはGemini Enterprise向けに「Gemini 3.8 Live with Live Avatar」を公開した。相手の映像と音声を理解し、表情と口の動きを合わせたアバターがほぼリアルタイムで応答する。会話中に予約確認などのツール処理を裏で進められる点も特徴だ。
自然さを成功指標にしない
定型の施設案内、製品の操作説明、97言語をまたぐ一次受付には使い道がある。一方、契約変更、医療・金融助言、強い苦情などは、表情が自然でも判断の責任までAIへ渡せない。
画面の最初と会話中にAIであると示し、いつでも人へ切り替えられる導線を置く。正答率だけでなく、誤案内から人へ移るまでの時間も測る。
人物写真から独自アバターを作る機能は企業の許可制である。社員、俳優、顧客など実在人物の顔や声を使う場合は、用途、掲載期間、再利用範囲を文書で同意する。
保存するデータを最小化する
カメラとマイクを使う接客では、映像、音声、会話履歴、予約情報のどれを保存するかを分ける。録画が不要なら保存せず、利用目的と削除期限を画面で説明する。子どもや通行人が映る場所ではカメラ入力を任意にしたい。
Googleは生成した音声・映像へSynthIDを埋め込むと説明する。ただし透かしは利用者への表示や、誤回答を止める人の監督を代替しない。
出典:Google公式「Introducing Gemini 3.8 Live with Live Avatar」。確認:2026年9月26日。

コメント