Tencent Hunyuan и Шанхайский университет выпустили AuK — открытую модель на 1,5 млрд параметров для генерации и редактирования речи. Русского языка она пока не знает: разработчики заявили поддержку китайского и английского, хотя допускают некоторый перенос способностей между языками.
Главная особенность AuK — одна модель берётся сразу за пять классов задач. Она может синтезировать речь и клонировать голос, менять отдельные слова в записи или строки песни, управлять темпом, громкостью и высотой тона.

Есть и более тонкая настройка. По текстовой команде модель способна менять эмоции, тембр и акцент, добавлять вздохи и смех или превращать голос в шёпот. Кроме того, AuK умеет убирать шум, выделять отдельного спикера и отделять вокал от музыки.
На вход подаётся инструкция, а при необходимости — исходное аудио. Мультимодальная Qwen2.5-Omni превращает их в условие для генерации, после чего система формирует новый звук.
По данным Tencent, AuK показывает лучшие результаты в тестах Seed-TTS-Eval, InstructTTSEval, MMAE-Speech и SpeechEditBench. А вот в восстановлении сигнала модель лишь конкурентоспособна и уступает специализированным системам в DNS Challenge, CHiME-4 и Libri2Mix.
Для ускорения разработчики выпустили AuK-Flash. Дистиллированной версии хватает четырёх шагов вместо 32, поэтому она работает в 4,5 раза быстрее. Для неё отдельно потребуется Qwen2.5-Omni-3B в роли энкодера.
Код и примеры разработчики разместили в репозитории, а попробовать модель можно через демо на Hugging Face и ModelScope. Если такой подход приживётся, разработчикам будет проще решать разные задачи со звуком без набора отдельных моделей.
