Microsoft представила нові мовні моделі MAI для ШІ-агентів

Компанія Microsoft анонсувала три нові мовні моделі MAI: MAI-Transcribe-2-Streaming, MAI–Voice-2.1 та MAI–Voice-2.1-Flash. Ці оновлення спрямовані на покращення розпізнавання мовлення в реальному часі та генерацію голосу з низькою затримкою.

MAI-Transcribe-2-Streaming

Основною новинкою стала модель MAI-Transcribe-2-Streaming, яка забезпечує оновлення стенограми під час мовлення. Перші результати транскрипції з'являються через 100 мс після отримання аудіосигналу, що дозволяє створювати голосових агентів з миттєвою реакцією. Модель підтримує 60 мов і автоматично визначає мову спікера без попереднього налаштування. За даними Artificial Analysis, вона займає перше місце за точністю транскрипції. Пільгова вартість використання становить $0,54 за годину аудіо до кінця 2026 року.

MAI–Voice-2.1

Оновлена модель MAI–Voice-2.1 призначена для створення багатомовних голосових застосунків. Вона охоплює 23 мови та здатна перемикатися між ними, зберігаючи унікальність голосу спікера. Для клонування голосу потрібен лише кілька секунд аудіозапису. Ціна генерації становить $22 за 1 мільйон символів.

MAI–Voice-2.1-Flash

Модель MAI–Voice-2.1-Flash орієнтована на швидкість та економію. Вона генерує 45 секунд аудіо з затримкою близько 150 мс, забезпечуючи на 55% швидший інференс за $15 за 1 мільйон символів. Модель також підтримує клонування голосу.

Доступність

Усі три моделі доступні через Microsoft Foundry, MAI Playground та Vercel. MAI–Voice-2.1 та MAI–Voice-2.1-Flash інтегровані в OpenRouter, а також доступні через Azure Voice Live.


Джерело: dev.ua (https://dev.ua/news/microsoft-vypustyla-novi-holosovi-modeli-dlia-shi-ahentiv-1790936392)