Microsoft объявила сегодня, что она еще больше расширила свою собственную модель искусственного интеллекта, официально запустила модель высокоточного создания и редактирования изображений MAI-Image-2.5-Pro и запустила публичную бета-версию модели преобразования текста в речь с малой задержкой MAI-Voice-2-Flash.

MAI-Image-2.5-Pro, являющаяся на сегодняшний день наиболее точной моделью создания изображений от Microsoft, предназначена для сценариев приложений, требующих более точной генерации изображений, вторичного редактирования, основного визуального дизайна плаката и более точного рендеринга текста. С точки зрения ценовой стратегии, модель продается по цене 5 долларов США за миллион токенов текстового ввода, 8 долларов США за миллион токенов ввода изображений и 106 долларов США за миллион токенов вывода изображений. В настоящее время разработчики и пользователи могут бесплатно испытать эту модель на платформе MAI Playground.
В то же время Microsoft выпустила MAI-Voice-2-Flash, который фокусируется на сценариях голосовых приложений с высокой степенью параллелизма и низкой задержкой, таких как роботы обслуживания клиентов. Официальные данные показывают, что при сохранении естественной интонации и высоком качестве звука скорость работы MAI-Voice-2-Flash увеличена в два раза, а ее стоимость снижена на 32%. Его цена составляет 15 долларов США за миллион символов.
Microsoft сообщила, что многие из ее основных направлений деятельности были полностью интегрированы в модели серии MAI собственной разработки. Например, Bing Image Creator полностью перешел на работу с MAI-Image-2.5, а к этой модели также была подключена функция создания графиков PowerPoint. По сравнению с ранее принятым сторонним решением стоимость графического процессора была снижена до 84% после перехода на модель собственной разработки. В OneDrive применение MAI-Image-2.5 увеличивает скорость сохранения изображений при редактировании на 26 % и снижает задержку P95 примерно на 25 %. Кроме того, MAI-Voice-2-Flash впервые был использован в контакт-центре Dynamics 365, что позволило сэкономить до 89 % затрат на графический процессор, и доступен как часть Azure Voice Live для разработчиков, позволяющих создавать агенты голосового взаимодействия. Многоязычная модель транскрипции MAI-Transcribe-1.5 также успешно предоставила Dragon Copilot услуги диктовки на 58 языках.