Звук обычно приходится собирать по частям: отдельно записывать голос, искать музыку и добавлять эффекты. Команда MiLM Plus из Xiaomi решила объединить эти задачи в MiDashengLM-Gen, которая по тексту создаёт целую аудиосцену.
Внутри работают аудиотокенизатор MiDashengLM-0.6B на архитектуре DashengTokenizer, Qwen3-1.7B и Flow matching на базе DiT. Для обучения использовали 77 тысяч часов ACAVCaps и TTS-корпуса Emilia, LibriTTS, LJSpeech, AISHELL-3 и WenetSpeech4TTS.

Но есть слабое место. Русский занимает 4,66% речевых данных ACAVCaps, английский — 54%, китайский — 24,5%, а в TTS-наборах русского нет. Поэтому доля ошибок для русского достигает 13,19% против 2,42% для английского.
Управление идёт через теги: отдельно задаются сцена, текст речи, голос, эффекты, музыка и окружение. Ненужные поля получают <|unknown|>. Авторы считают, что это не даёт смешивать голос с фоновым шумом.
В тестах особенно заметна работа с речью: на английском Seed-TTS доля ошибок снизилась с 12,15% до 2,79%. На CV3-Eval модель получила 0,98 для радости, 0,96 для грусти и 0,92 для злости.
Но универсальность пока не означает лидерство. В AudioCaps система уступила TangoFlux: FAD составил 5,01 против 2,26. На выходе — WAV 16 кГц до 20 секунд; более длинные варианты не проверяли.
Авторы планируют добавить клонирование голоса, улучшить низкоресурсные языки и управление временем. Модель выпущена по Apache 2.0 License. Для рынка это может упростить создание сложного звука.
