Аннотация:
Недавно OpenAI объявила, что GPT-Live-1, который в настоящее время используется для голосовой функции ChatGPT, будет официально открыт для разработчиков. Теперь разработчики могут интегрировать эту голосовую модель в свои собственные приложения и бизнес-процессы через API для создания полнодуплексных голосовых помощников, которые могут слушать пользователей в режиме реального времени и отвечать одновременно. Стоимость голосового интерфейса для этой модели составляет 0,05 доллара США за минуту, а за модель, используемую в фоновом режиме для сложных рассуждений, необходимо взимать отдельную плату в соответствии с ценой соответствующей модели.

GPT-Live-1 — это новое поколение модели речи в реальном времени, выпущенное OpenAI в этом году. Его самой большой особенностью является полнодуплексная архитектура. Традиционному голосовому ИИ обычно необходимо последовательно выполнить три этапа распознавания речи, вывода языковой модели и синтеза речи. Только после того, как пользователь закончит говорить, система сможет начать обработку и генерировать ответы. GPT-Live-1, с другой стороны, может генерировать речевой вывод, слушая речь пользователя, поэтому он может более естественно обрабатывать прерывания, паузы, эхо и быстрые разговоры вперед и назад.
Это означает, что пользователям не нужно ждать, пока ИИ полностью закончит говорить, прежде чем продолжить говорить. Если пользователь передумает, добавит информацию или напрямую прервет, GPT-Live-1 может вовремя скорректировать свое поведение в соответствии с продолжающимся разговором. Модель также может сказать, когда продолжать говорить, когда делать паузу, когда продолжать слушать и когда обращаться к инструментам.
В OpenAI заявили, что эта архитектура может значительно сократить задержку голосового взаимодействия и решить проблемы соединения, которые могут возникнуть в реальных разговорах в традиционном конвейере «распознавание речи + большая языковая модель + синтез речи». Поскольку GPT-Live-1 сам обрабатывает как входной, так и выходной звук, разработчикам больше не нужно координировать сложное переключение между несколькими независимыми моделями.
В тесте, опубликованном OpenAI, производительность GPT-Live-1 в полнодуплексном тесте была на 30 процентных пунктов выше, чем у GPT-Realtime-2.1, особенно с точки зрения задержки при выполнении очереди и интерактивного поведения. В сочетании с GPT-6 Astra при средней интенсивности вывода GPT-Live-1 также занял первое место в тесте Tau3. Tau3 в основном используется для оценки способности голосовых агентов выполнять сквозные задачи.
Еще одна важная особенность GPT-Live-1 заключается в том, что он не отвечает за все сложные рассуждения. OpenAI отделяет речевую модель, отвечающую за прослушивание, речь и взаимодействие в реальном времени, от фоновой модели, отвечающей за глубокие рассуждения. Когда пользователи задают вопросы, требующие поиска, сложного анализа или длительных задач, GPT-Live-1 может передать эти задачи фоновой модели, продолжая поддерживать естественное голосовое общение с пользователем.
Поэтому разработчики могут свободно выбирать модели серверной части в зависимости от конкретных потребностей бизнеса. Например, для большого количества простых задач, таких как бронирование и обновление заказов, можно использовать более быстрые и недорогие модели; сложные проблемы клиентов можно решить с помощью более сильных моделей вывода. Эта архитектура позволяет разработчикам найти баланс между оперативностью, возможностями рассуждения и стоимостью использования.
В OpenAI заявили, что такая несвязанная конструкция также позволяет GPT-Live-1 продолжать взаимодействовать с пользователями, выполняя задачи в фоновом режиме, вместо того, чтобы заставлять пользователей сталкиваться с длительным периодом молчаливого ожидания. Модель может продолжать естественный разговор, выполняя более сложную работу в фоновом режиме, а затем возвращать результаты в текущий разговор, когда задача будет завершена.
Практическое применение уже начинает появляться. Ранние примеры, продемонстрированные OpenAI, включают голосовые сервисы, такие как Yelp Host и Hatch, а также платформу для изучения языков Speak. В ходе ранних испытаний было обнаружено, что по сравнению с предыдущими пошаговыми речевыми системами GPT-Live-1 может дать изучающим язык больше времени на размышление, сокращая количество превентивных прерываний системы почти на 80%.
Для предприятий эта возможность особенно подходит для обслуживания клиентов, обслуживания клиентов по телефону, бронирования и других сценариев, требующих постоянного голосового взаимодействия. GPT-Live-1 изначально поддерживает телефонные сценарии, поэтому разработчики могут использовать его для создания полнодуплексных голосовых агентов, которые могут отвечать на телефонные звонки и обрабатывать их, например, для бронирования столиков в ресторанах, поддержки клиентов и других задач, требующих общения в реальном времени.
GPT-Live-1 также обеспечивает встроенное автоматическое распознавание речи, расшифрованный текст и текст ответа модели, а также улучшает понимание буквенно-цифровых комбинаций, поддерживая при этом функции смещения ключевых слов. Хотя это не пошаговая модель в традиционном смысле этого слова, она все же изначально поддерживает обнаружение поворотов. Поэтому, если разработчикам необходимо четко контролировать, когда пользователь заканчивает говорить и когда система начинает отвечать, они все равно могут разрабатывать свои приложения с учетом четких диалогов.
GPT-Live-1 также оптимизирован для сцен с шумным фоном. Модель может лучше различать речь пользователя, фоновый шум и тишину. Он не будет часто прерывать разговоры из-за звуков окружающей среды и не будет постоянно напоминать пользователям, когда они просто кратко думают. Эта возможность особенно важна для телефонных звонков, обслуживания клиентов и использования мобильных голосовых помощников в реальных условиях.
OpenAI также расширила выбор звуков, доступных для GPT-Live-1. По сравнению с относительно ограниченным количеством ранее доступных голосов в реальном времени, новая версия предлагает более разнообразные голоса и охватывает более широкий диапазон акцентов, диалектов и языков. OpenAI заявляет, что продолжит добавлять доступные голоса и языки в ближайшие месяцы.
Что касается развертывания модели, разработчикам не нужно передавать все задачи GPT-Live-1. OpenAI надеется использовать его в качестве внешнего интерфейса, отвечающего за голосовое взаимодействие в реальном времени, взяв на себя более сложную работу с помощью фоновых моделей и инфраструктур агентов. Этот подход также позволяет разработчикам комбинировать разные модели в соответствии с реальными потребностями различных задач.
Например, разработчики могут позволить GPT-Live-1 отвечать за получение голосовых запросов пользователей, поддержание естественного диалога и обработку прерываний, а затем передавать вопросы, требующие сложных рассуждений, фоновой модели; после того, как фоновая модель завершит работу, GPT-Live-1 преобразует результаты в естественные голосовые ответы. Этот механизм также применим к приложениям, которым необходимо вызывать внешние инструменты.
OpenAI также продемонстрировала, как объединить GPT-Live-1 с такими инструментами, как Codex. Разработчики могут позволить речевой модели получать задачи, предложенные пользователем, затем передавать соответствующий контекст в фоновые инструменты, такие как Codex, для обработки, а затем возвращать результаты обработки в GPT-Live-1, который продолжит общаться с пользователем посредством голоса.
Что касается цены, GPT-Live-1 теперь официально доступен через API OpenAI, а плата за голосовой интерфейс составляет 0,05 доллара США за минуту. Важно отметить, что это только стоимость уровня голосовой связи в реальном времени. Если разработчик оснащает GPT-Live-1 фоновой моделью вывода, стоимость вызова фоновой модели необходимо рассчитывать отдельно на основе цены соответствующей модели.
Это означает, что для бизнес-приложений, требующих большого количества голосовых вызовов, фактическая стоимость составляет не просто 0,05 доллара США за минуту, а складывается из времени голосового соединения и потребления фоновой модели. Однако разработчики могут контролировать общую стоимость в зависимости от сложности задачи, выбирая различные модели серверной части.
Открытие GPT-Live-1 также означает, что OpenAI продолжает расширять базовую технологию голосового режима ChatGPT от потребительских продуктов до экосистемы разработчиков. Раньше GPT-Live-1 в основном существовал как возможность голосового взаимодействия ChatGPT. Теперь разработчики могут напрямую использовать подобные технологии для создания собственных голосовых приложений и агентов.
С технической точки зрения OpenAI надеется, что GPT-Live-1 не только решит проблему «предоставления ИИ возможности говорить», но и позволит ИИ действительно участвовать в непрерывных, прерываемых естественных разговорах в реальном времени. Разделяя прослушивание, речь, взаимодействие в реальном времени и глубокие рассуждения, OpenAI пытается добиться более низкой задержки голоса, более естественного разговора и одновременно более мощных возможностей обработки фоновых задач.
Поскольку голосовые агенты постепенно переходят от простых голосовых вопросов и ответов к сложным задачам, таким как обслуживание клиентов по телефону, бронирование, языковое обучение, бизнес-обработка и способность автономно вызывать инструменты для выполнения задач, важность речевых моделей в реальном времени также возрастает. Открытый API GPT-Live-1 означает, что разработчики теперь могут напрямую встраивать технологию голосовой связи текущего поколения в реальном времени, используемую ChatGPT, в свои собственные продукты, а цена голосового уровня в 0,05 доллара США за минуту также позволяет этой возможности официально выйти на стадию коммерческого применения.
Комментарии