Аннотация:
Google недавно выпустила Gemini 3.5 Transcribe, новейшую модель преобразования речи в текст из серии Gemini, назвав ее самой точной моделью распознавания речи в этой серии. Эта модель открыта для разработчиков, предприятий и обычных пользователей и направлена на улучшение возможностей транслитерации в шумной среде, сложных профессиональных терминах и естественных разговорных выражениях.

Согласно отчетам, Gemini 3.5 Transcribe лучше справляется с фоновым шумом и сложной лексикой в профессиональных областях. В Google заявили, что новая модель улучшила производительность приложения Gemini на платформе macOS и функции Rambler клавиатуры Gboard на платформе Android. Разработчики могут использовать эту модель для создания таких приложений, как голосовые агенты, инструменты субтитров в реальном времени и процессы анализа после звонка.
В Google заявили, что Gemini 3.5 Transcribe разработан для того, чтобы улавливать естественные модели речи пользователей, чтобы более точно понимать семантические намерения, определять пользовательский словарный запас и помогать пользователям выполнять задачи с помощью голоса.
На функциональном уровне новая модель добавляет ряд возможностей оптимизации, включая автоматическое самоисправление, удаление произносимых слов-паразитов, таких как «ум» и «ах», а также автоматическое форматирование выходного текста. В то же время он также может делегировать более сложные задачи, такие как анализ файлов и создание изображений, другим моделям Gemini, чтобы сформировать более полный опыт совместной работы с несколькими моделями.
Что касается точности, Google отметил, что средняя частота ошибок в словах Gemini 3.5 Transcribe составляет 4,0% в сценариях потокового распознавания речи и может быть снижена до 2,6% в сценариях без потоковой передачи. Модель обеспечивает лучшую производительность транскрипции в шумной среде и может более точно идентифицировать ключевую информацию, состоящую из букв и цифр, например номера заказов и почтовые индексы.

Что касается языковой поддержки, Gemini 3.5 Transcribe в настоящее время охватывает 85 языков и поддерживает региональные акценты и различные диалекты. Для предварительно записанного звука он может выполнять распознавание атрибуции речи с отметкой времени для трех говорящих; кроме того, модель может адаптироваться к словарям, определяемым пользователем, для идентификации профессиональных терминов, специальных вариантов написания и названий отраслей.
Gemini 3.5 Transcribe в настоящее время доступен в общедоступной предварительной версии через Gemini API в Google AI Studio и Google Antigravity. Обычные пользователи могут использовать соответствующие функции на платформах Android и macOS. Google также планирует внедрить его в браузере Chrome, где пользователи смогут вводить текст непосредственно голосом в поле ввода на любой веб-странице.
В последнее время Google продолжает ускорять развитие линейки продуктов Gemini. Ранее компания выпустила Gemini 3.7 Flash, чтобы присоединиться к все более жесткой ценовой конкуренции за модели искусственного интеллекта; Gemini в Chrome для Android также был открыт для всех пользователей в США, а Gemini Assistant также вошел в новое поколение беспилотных такси Waymo.
Комментарии