Компания Cohere, занимающаяся искусственным интеллектом корпоративного уровня, в четверг выпустила свою первую речевую модель Transcribe. Это модель автоматического распознавания речи (ASR) с открытым исходным кодом, в основном для записи речи в текст, анализа речевого контента и других сценариев. Размер параметров модели составляет примерно 2 миллиарда и позиционируется как «легкое» решение, которое легко запускать на графических процессорах потребительского уровня и подходит для развертывания предприятиями и разработчиками с требованиями к самостоятельному хостингу.

В настоящее время Transcribe поддерживает 14 языков, включая английский, французский, немецкий, итальянский, испанский, португальский, греческий, голландский, польский, китайский, японский, корейский, вьетнамский и арабский. Когер сообщил, что в списке Open ASR Hugging Face Transcribe достиг средней частоты ошибок в словах (WER) 5,42, опередив такие модели, как Zoom Scribe v1, IBM Granite 4.0 1B, ElevenLabs Scribe v2 и Qwen3-ASR-1.7B Speech в этом тесте.
Что касается человеческой оценки, Когер сказал, что когда рецензенты-люди сравнивали результаты транскрипции с точки зрения точности, последовательности и удобства использования, средний процент побед Transcribe составил 61% по сравнению с другими моделями. Однако компания также признала, что производительность модели все же немного хуже, чем у некоторых конкурирующих продуктов на таких языках, как португальский, немецкий и испанский.
Что касается производительности, данные Cohere показывают, что Transcribe может обрабатывать около 525 минут аудио в минуту, что находится на высоком уровне среди аналогичных моделей. Cohere планирует интегрировать эту речевую модель в North, свою платформу оркестрации агентов для предприятий, и сделать ее свободно доступной через API компании. В то же время Transcribe также будет размещен на размещенной платформе вывода Cohere Model Vault, что позволит клиентам обращаться к ней напрямую.
Модели распознавания речи в целом быстро набирают популярность, поскольку спрос на приложения для голосовых заметок и диктовки, такие как Granola и Wispr Flow, продолжает расти. В этом контексте Cohere пытается выйти на рынок с помощью легковесной и многоязычной поддержки с открытым исходным кодом, предоставляя автономную и дружественную голосовую инфраструктуру для предприятий, которые хотят контролировать свои данные и среду развертывания.
Ранее в этом году сообщалось, что Cohere будет генерировать около $240 млн годового регулярного дохода (ARR) в 2025 году, а генеральный директор компании Эйдан Гомес заявил, что стартап может стать публичным «вероятно, скоро».