Аннотация:
Google объявила об официальном запуске функции «Живой аватар» (цифровой человек в режиме реального времени) на корпоративной платформе Gemini Enterprise. Эта технология глубоко интегрирована с новейшей архитектурой больших моделей Google Gemini 3.8 Live. Основываясь на исходной почти нулевой задержке и плавном голосовом разговоре, он впервые представляет возможности генеративной генерации видео практически в реальном времени, позволяя диалоговому искусственному интеллекту иметь динамический визуальный образ, который может «слушать, смотреть и говорить одновременно».

Согласно официальному представлению, Gemini 3.8 Live Live Avatar предназначен для создания более интуитивно понятного и захватывающего виртуального помощника по обслуживанию для корпоративных клиентов. За счет точной синхронизации аудиопотока с базовой моделью генерации видео система может обеспечить высокоточную синхронизацию губ, естественное изменение выражения лица и плавное преобразование межъязыковых диалогов. В настоящее время цифровая человеческая система изначально поддерживает до 97 языков, и при переключении языков в середине разговора не будет никаких искажений видео или смещения лица.
Помимо визуальных преимуществ, платформа также оснащена мощными возможностями асинхронного вызова инструментов. Поддерживая естественный и связный разговор с пользователями, цифровые люди могут в фоновом режиме бесшумно вызывать различные внешние API и интерфейсы корпоративных данных для выполнения сложных многоэтапных задач, таких как регистрация заезда в отеле и заполнение документов по страховке, полностью попрощавшись с феноменом «сбоя» или долгого молчаливого ожидания, который возникал, когда ИИ обрабатывал фоновые задачи в прошлом. В то же время, в сочетании с функцией совместного использования камеры и экрана терминального устройства, цифровой человек может также обеспечивать визуальное понимание и интерактивное управление физическими объектами или программными интерфейсами, отображаемыми пользователем, в режиме реального времени.
Что касается безопасности и соответствия требованиям, чтобы предотвратить риск дипфейков с использованием искусственного интеллекта и кражи личных данных, Google создал несколько линий защиты для Live Avatar. По умолчанию система открывает корпоративным пользователям только библиотеку цифровых изображений людей, предварительно заданную официальной проверкой, в то время как разрешение на настройку эксклюзивных изображений брендов или конкретных лиц находится под строгим механизмом проверки белого списка. Кроме того, все голосовые и динамические видеопотоки в реальном времени, генерируемые системой, сопровождаются невидимыми и не поддающимися изменению цифровыми водяными знаками SynthID, чтобы обеспечить прозрачность и отслеживаемость контента, создаваемого искусственным интеллектом.
В настоящее время функции Gemini 3.8 Live и Live Avatar официально открыты для клиентов по подписке корпоративного уровня через узлы обслуживания центров обработки данных в США и Европе, одновременно обеспечивается поддержка доступа к API для разработчиков. Отраслевые аналитики отмечают, что интеграция технологии генеративного видео непосредственно в базовую речевую модель не только устраняет высокую задержку, вызванную традиционными пакетами рендеринга видео, но также отмечает, что виртуальная служба поддержки клиентов с искусственным интеллектом и интеллектуальные интерактивные терминалы вступают в новую эру «визуального диалога с реальным человеком и в реальном времени».
Комментарии