Microsoft представила нові мовні моделі MAI для ШІ-агентів
Компанія Microsoft анонсувала три нові мовні моделі MAI: MAI-Transcribe-2-Streaming, MAI–Voice-2.1 та MAI–Voice-2.1-Flash. Ці оновлення спрямовані на покращення розпізнавання мовлення в реальному часі та генерацію голосу з низькою затримкою.
MAI-Transcribe-2-Streaming
Основною новинкою стала модель MAI-Transcribe-2-Streaming, яка забезпечує оновлення стенограми під час мовлення. Перші результати транскрипції з'являються через 100 мс після отримання аудіосигналу, що дозволяє створювати голосових агентів з миттєвою реакцією. Модель підтримує 60 мов і автоматично визначає мову спікера без попереднього налаштування. За даними Artificial Analysis, вона займає перше місце за точністю транскрипції. Пільгова вартість використання становить $0,54 за годину аудіо до кінця 2026 року.
MAI–Voice-2.1
Оновлена модель MAI–Voice-2.1 призначена для створення багатомовних голосових застосунків. Вона охоплює 23 мови та здатна перемикатися між ними, зберігаючи унікальність голосу спікера. Для клонування голосу потрібен лише кілька секунд аудіозапису. Ціна генерації становить $22 за 1 мільйон символів.
MAI–Voice-2.1-Flash
Модель MAI–Voice-2.1-Flash орієнтована на швидкість та економію. Вона генерує 45 секунд аудіо з затримкою близько 150 мс, забезпечуючи на 55% швидший інференс за $15 за 1 мільйон символів. Модель також підтримує клонування голосу.
Доступність
Усі три моделі доступні через Microsoft Foundry, MAI Playground та Vercel. MAI–Voice-2.1 та MAI–Voice-2.1-Flash інтегровані в OpenRouter, а також доступні через Azure Voice Live.
Джерело: dev.ua (https://dev.ua/news/microsoft-vypustyla-novi-holosovi-modeli-dlia-shi-ahentiv-1790936392)