Tencent представила нейросеть AuK для генерации и редактирования речи
Компания Tencent выпустила модель AuK для генерации и редактирования речи через единый интерфейс. Нейросеть позволяет превращать текст в голос и изменять готовые аудиозаписи по текстовым инструкциям.
Базовая архитектура решения включает модель на 1,5 млрд параметров. Для понимания инструкций отдельно используется Qwen2.5-Omni-3B, поэтому 1,5 млрд — это не весь размер модели. Инструмент клонирует голос по референсу, меняет слова без перезаписи всей фразы, убирает акцент и шум, настраивает тембр, эмоцию, скорость и высоту, а также отделяет спикера или вокал от микса.
Обучение проводили на 1,95 млн часов эффективного обучающего аудио. Вместе с базовой версией разработчики выложили AuK-Flash, которая делает 4 шага вместо 32 и работает в 4,5 раза быстрее. Код, веса и ноды для ComfyUI уже доступны на GitHub и Hugging Face, где также размещена демо-версия.

Добавить комментарий