Компания Microsoft расширила свою линейку специализированных моделей семейства MAI, выпустив MAI-Image-2.5-Pro для высококачественной генерации изображений и MAI-Voice-2-Flash для сверхбыстрого синтеза речи на 15 языках.

image

Что произошло

Microsoft официально представила модели MAI-Image-2.5-Pro и MAI-Voice-2-Flash. Первая модель оптимизирована для создания детальной графики с точным рендерингом текста, а вторая ориентирована на низкую задержку при сохранении естественности голоса. Новые решения уже интегрируются в экосистему Microsoft, включая Bing, PowerPoint, OneDrive и Dynamics 365.

Контекст

Переход на собственную архитектуру MAI является частью стратегии вертикальной интеграции. Замена сторонних моделей, таких как GPT-Image-2, на специализированные решения Microsoft позволяет радикально снизить операционные издержки. Например, использование специализированных моделей в PowerPoint уже снизило вычислительные затраты на 84% по сравнению с универсальными решениями.

Почему это важно для индустрии

Для индустрии это означает смещение фокуса с универсальных LLM к специализированным 'edge' и 'fast' моделям, где ключевой метрикой становится соотношение стоимости и производительности (cost/performance). Microsoft демонстрирует путь к независимости от сторонних провайдеров вроде OpenAI, создавая собственный оптимизированный стек AI-инфраструктуры.

Почему это важно для пользователей

Разработчики, использующие Azure AI Foundry и MAI Playground, получают доступ к инструментам, которые значительно дешевле и быстрее предыдущих аналогов. Модель MAI-Voice-2-Flash на 32% дешевле и вдвое быстрее своего предшественника, что открывает возможности для создания масштабных real-time приложений с голосовым интерфейсом.

Источники

Автор

Look at AI, редакция