Аннотация:
Сегодня Google официально объявила о своем последнем прорыве в области встроенного сквозного голосового взаимодействия, выпустив новое поколение больших моделей голосовой связи в реальном времени Gemini 3.8 Live и Gemini 3.8 Live Extended Thinking, адаптированных для сложных задач.

Эти две модели представляют собой большой шаг вперед в развитии собственной системы преобразования звука в аудио от Google. Они не только поднимают задержку и естественность разговора в реальном времени на новую высоту, но и впервые достигают возможностей глубокого многоэтапного рассуждения в голосовых потоках с малой задержкой, полностью меняя парадигму применения голосового ИИ в сложных профессиональных сценариях.

В предыдущей основной архитектуре голосового взаимодействия системам искусственного интеллекта обычно приходилось искать компромисс между «поверхностным диалогом с быстрым ответом» и «долгосрочным глубоким мышлением». Столкновение со сложными проблемами часто требовало от пользователей длительного молчаливого ожидания. Gemini 3.8 Live, выпущенный Google, ориентирован на оптимизацию сверхбыстрого разговора и ежедневного взаимодействия в потоковом режиме. Он может предоставить пользователям чрезвычайно плавную голосовую связь в реальном времени на человеческом уровне с более чувствительными колебаниями интонации, естественными прерываниями и возможностями понимания контекста. Запущенная на его основе Gemini 3.8 Live Extended Thinking кардинально модернизирована для работы с очень сложными бизнес-потоками. Эта модель дает ИИ возможность «думать, как он говорит» (Think as it talks) в фоновом режиме, позволяя системе одновременно выполнять сложную многоэтапную логическую разборку, отладку кода или техническую диагностику в фоновом режиме, сохраняя при этом связный диалог в реальном времени, без необходимости резко прерывать ритм разговора при возникновении сложных проблем.

С точки зрения практического применения новое поколение моделей серии Live существенно расширит границы обслуживания голосовых помощников. Помимо ежедневных естественных разговоров, версии Gemini 3.8 Live и расширенного рассуждения продемонстрировали значительно лучшую производительность, чем предыдущие версии, в сценариях с высокими интеллектуальными требованиями, таких как пошаговое устранение неполадок в реальном времени, сложный математический вывод, одновременное обучение иностранному языку в реальном времени и выполнение многозадачных потоковых инструкций, заняв первое место в нескольких отраслевых тестах мультимодального и речевого рассуждения.
Для разработчиков и корпоративных пользователей компания Google объявила, что с этого момента соответствующие возможности модели будут официально открыты для доступа через Gemini API и Google AI Studio. Разработчики могут напрямую вызывать этот собственный аудиоинтерфейс API с чрезвычайно малой задержкой, чтобы быстро создавать полнодуплексные службы голосового агента нового поколения с возможностями рассуждения высокого порядка в таких формах продуктов, как интеллектуальное оборудование, служба поддержки клиентов, помощь в программировании в реальном времени и офис для совместной работы.
Комментарии