Microsoft продолжает развивать собственую линейку ИИ-моделей. Компания представила MAI-Image-2.5-Pro для генерации изображений и MAI-Voice-2-Flash для синтеза речи. Обе новинки уже доступны в Azure AI Foundry, а протестировать их можно через MAI Playground.

По данным Microsoft, MAI-Image-2.5-Pro стала самой качественной графической моделью компании для задач, где важны высокая детализация и точная отрисовка текста. Стоимость использования составляет $5 за миллион входных текстовых токенов, $8 за миллион входных токенов изображений и $106 за миллион выходных токенов.

MAI-Voice-2-Flash ориентирована на скорость. По данным разработчиков, модель работает вдвое быстрее MAI-Voice-2 и стоит на 32% дешевле — $15 за миллион символов.

Одновременно Microsoft рассказала о переходе собственных сервисов на модели MAI. Bing Image Creator уже полностью использует MAI-Image-2.5, а в PowerPoint эта модель позволила сократить вычислительные расходы до 84% по сравнению с GPT-Image-2. В OneDrive доля сохранённых пользователями результатов выросла на 26%, а задержка ответа сократилась примерно на четверть. Кроме того, Voice-2-Flash уже работает в Dynamics 365 Contact Center, где, по данным компании, снижает вычислительные затраты до 89%.

Развитие семейства MAI показывает, что Microsoft всё активнее делает ставку на собственую ИИ-инфраструктуру. Это может ускорить появление более доступных ИИ-сервисов и усилить конкуренцию среди крупнейших разработчиков моделей.