Microsoft запускает модель транскрипции и синтеза речи в реальном времени MAI-Transcribe-2-Streaming, заняв первое место в списке распознавания потоковой передачи

📅 2026-10-02

Аннотация:

Microsoft выпустила три новые модели голосового взаимодействия в реальном времени, а именно модель преобразования речи в текст MAI-Transcribe-2-Streaming и модели преобразования текста в речь MAI-Voice-2.1 и MAI-Voice-2.1-Flash. Microsoft надеется, что разработчики объединят их для создания голосовых помощников и диалоговых агентов, которые смогут обрабатывать сообщения во время прослушивания и мгновенно реагировать естественной речью.

MAI-Transcribe-2-Streaming отличается от предыдущего MAI-Transcribe-2, который может обрабатывать только файлы записи. Он может принимать непрерывные входные аудиопотоки и начинать генерировать постановочный текст еще до того, как говорящий закончит говорить. Он будет продолжать пересматриваться по мере поступления нового контекста и, наконец, предоставит стабильные результаты. В Microsoft заявили, что модель поддерживает 60 языков и может непрерывно и автоматически распознавать языки; Предполагается, что первая партия распознавания появится чуть более чем через 100 миллисекунд после получения звука и подходит для таких сценариев, как голосовые агенты, служба поддержки клиентов, субтитры для конференций и учебных классов, а также голосовой ввод. Внутреннее тестирование Microsoft диктовки и субтитров показывает, что текст появляется примерно в два раза быстрее, чем у ближайшего конкурента. Это сравнение основано на собственных обзорах компании.

В тесте потоковой транскрипции Artificial Analysis модель занимает первое место по точности окончательного и поэтапного текста. Опубликованные результаты испытаний показали, что доля ошибок в окончательно транскрибированном слове составила около 2,5%, а окончательный текст был предоставлен примерно через 0,13 секунды после обнаружения конца речи. В списке на тот момент сравнивалось 38 моделей, тестировалось около 8 часов аудио и охватывалось три типа корпуса: AA-AgentTalk, VoxPopuli и Earnings22, что составляло 50%, 25% и 25% общего веса соответственно. Чем ниже процент ошибок в словах, тем лучше. Этот результат иллюстрирует производительность модели в этом наборе тестов и не означает, что одинаковая точность может быть достигнута на всех языках, в шумной среде и в реальных приложениях.

MAI-Transcribe-2-Streaming в настоящее время продается по цене 0,54 доллара США за час аудио, предложение действительно до конца 2026 года; для сравнения, непотоковая MAI-Transcribe-2 ранее рекламировалась по цене 0,10 доллара в час. Версия в реальном времени больше подходит для непрерывного взаимодействия, а пакетная версия — для записи аудиотранскрипции. Цены на эти два продукта нельзя рассматривать просто как прямое сравнение при одном и том же методе использования.

Новая модель синтеза речи MAI-Voice-2.1 поддерживает 23 языка и 26 региональных вариантов, позволяя одному и тому же синтезированному голосу переключаться между разными языками, сохраняя при этом индивидуальность говорящего и принимая местный акцент соответствующего языка. Его цена составляет 22 доллара США за 1 миллион символов. MAI-Voice-2.1-Flash для малозадержных и крупномасштабных запросов поддерживает один и тот же язык. Microsoft заявляет, что может генерировать 45 секунд звука со сквозной задержкой около 150 миллисекунд. Скорость вывода модели увеличена на 55%, а цена примерно на 60% ниже, чем у сопоставимых моделей. Цена составляет 15 долларов за 1 миллион символов. Последний набор преимуществ по скорости и цене входит в число сравнений, опубликованных Microsoft.

Обе модели голоса поддерживают межъязыковое клонирование голоса в реальном времени, но только с использованием авторизованных и одобренных эталонных голосов. В документации Microsoft эта функция указана как ограниченный доступ, с рекомендуемой длительностью эталонного звука от 5 до 60 секунд и защитой от злоупотреблений. MAI-Voice-2.1 подходит для более длинного контента, повествований и аудиокниг, а Flash больше подходит для сценариев реального времени, таких как голосовые агенты, помощники и обслуживание клиентов.

Все три модели можно использовать через Microsoft Foundry, MAI Playground и Vercel; две модели Voice также подключены к OpenRouter, и их можно вызывать через Azure Voice Live. Ожидается, что поддержка LiveKit будет запущена позже. В документации Microsoft Azure эти модели в настоящее время помечены как общедоступные предварительные версии, что указывает на отсутствие соглашения об уровне обслуживания и их не рекомендуется использовать непосредственно в производственных рабочих нагрузках.

Подробнее:

https://microsoft.ai/news/our-first-streaming-transcription-model/

Связанные теги

Похожие статьи

Глава Microsoft Office и Teams уйдет в отставку: бывший генеральный директор LinkedIn решил уйти после почти 18 лет пребывания в должности 2026-10-02 Microsoft значительно обновляет структуру WinUI, дорабатывает элементы управления таблицами и диаграммами и начинает решать проблемы с использованием памяти. 2026-10-02 Руководитель итальянского частного банка стал жертвой дипфейкового мошенничества: голосовое мошенничество с использованием искусственного интеллекта украло 95 миллионов евро 2026-09-29 Генеральный директор Microsoft Сатья Наделла предлагает принять парадигму взаимодействия и сотрудничества, заключающуюся в «опросе, а не слепом доверии результатам искусственного интеллекта». 2026-09-28 Windows 11 26H2 вот-вот выйдет, Microsoft начинает новый цикл обновлений 2026-09-28 Генеральный директор Microsoft говорит, что недавнее сокращение Xbox «отрадно» и будет искать устойчивую бизнес-модель после массовых увольнений 2026-09-27

Комментарии

0/500
Captcha (click to refresh)
Нет комментариев