最低32GB内存。预留足够硬盘空间,建议36GB以上。
macOS 15及以上版本,仅支持M系列芯片。
Windows 10/11:显卡NVIDIA,12GB以上显存。
注意:NVIDIA显卡,请安装较新版本的驱动。AuK 是腾讯推出的开源语音生成与编辑基础模型。简单来说,它不仅可以根据文字生成语音,还可以像编辑文字一样,通过自然语言指令直接修改已有的语音。
例如,你可以给它一段参考声音,让它用相似的声音读出新的文字;也可以要求它修改一句话中的某个词、改变说话速度或音调、调整情绪,甚至去除噪声、分离不同说话人的声音。AuK 的一个重要特点是:这些不同的语音任务都可以通过统一的自然语言指令完成,而不需要为每一种功能使用完全不同的模型。
1. AI 语音生成
AuK 支持零样本语音合成(Zero-shot TTS)。用户提供一段参考声音后,可以让模型用相近的声音说出新的内容,而不需要针对这个声音进行专门训练。
同时,它还支持通过文字描述直接生成指定类型的声音,例如描述说话人的声音特点,而不提供参考音频。
2. 直接编辑已有语音
AuK 不只是“文字转语音”,还可以修改已有录音。
例如可以:
这意味着语音文件可以像文字文档一样进行一定程度的“局部编辑”。
3. 修改说话方式和声音表现
AuK 可以在保持语音内容的同时改变表达方式,例如:
因此,它处理的不只是“说什么”,还包括“怎么说”。
4. 音频增强与声音分离
对于录音质量较差的音频,AuK 可以进行降噪、去混响和语音恢复。
它还支持从多人对话或混合音频中提取目标声音,例如只保留某个说话人的声音、从音乐中提取人声,或者分离不同说话人的语音。
AuK 更像一个“AI 音频编辑器的底层引擎”,而不仅仅是传统的 TTS 工具。
它可以用于:
尤其值得注意的是,AuK 把语音生成、语音编辑、声音增强和声音分离放进了同一个统一模型和指令体系中。
AuK 由腾讯(Tencent)的 Hunyuan(混元)团队开发并开源,项目代码和模型权重均公开发布。
项目采用 MIT License 开源,开发者可以基于公开的代码和模型进行研究、修改和应用。
AuK 是一个 1.5B 参数规模的语音基础模型(foundation model),使用数百万小时的多样化音频数据进行训练。
从代码结构来看,它采用了较为现代的生成式 AI 架构:模型使用文本编码器 + 音频 VAE + Transformer/Flow Matching 编辑生成模块构成核心生成链路;代码中可以看到对 Qwen2.5-Omni 文本/多模态组件、BigVGAN Flow VAE 以及 Flux2Edit/CFMEdit 等模块的使用。
项目提供两个主要版本: