Skip to content
AuK

AuK

通过自然语言统一完成语音生成、语音编辑、声音增强和声音分离

使用魔当PC客户端下载

应用特点

开源文本转语音TTS

系统要求

最低32GB内存。预留足够硬盘空间,建议36GB以上。
macOS 15及以上版本,仅支持M系列芯片。
Windows 10/11:显卡NVIDIA,12GB以上显存。
注意:NVIDIA显卡,请安装较新版本的驱动。

应用介绍

AuK 是腾讯推出的开源语音生成与编辑基础模型。简单来说,它不仅可以根据文字生成语音,还可以像编辑文字一样,通过自然语言指令直接修改已有的语音。

例如,你可以给它一段参考声音,让它用相似的声音读出新的文字;也可以要求它修改一句话中的某个词、改变说话速度或音调、调整情绪,甚至去除噪声、分离不同说话人的声音。AuK 的一个重要特点是:这些不同的语音任务都可以通过统一的自然语言指令完成,而不需要为每一种功能使用完全不同的模型。

主要功能

1. AI 语音生成

AuK 支持零样本语音合成(Zero-shot TTS)。用户提供一段参考声音后,可以让模型用相近的声音说出新的内容,而不需要针对这个声音进行专门训练。

同时,它还支持通过文字描述直接生成指定类型的声音,例如描述说话人的声音特点,而不提供参考音频。

2. 直接编辑已有语音

AuK 不只是“文字转语音”,还可以修改已有录音。

例如可以:

  • 替换、插入或删除语音中的文字;
  • 修改歌曲中的歌词,同时尽量保持原来的旋律和声音;
  • 调高或调低音调;
  • 调快或调慢说话速度;
  • 调整音量。

这意味着语音文件可以像文字文档一样进行一定程度的“局部编辑”。

3. 修改说话方式和声音表现

AuK 可以在保持语音内容的同时改变表达方式,例如:

  • 改变情绪;
  • 修改音色;
  • 消除地域口音;
  • 普通说话与耳语之间转换;
  • 添加或删除呼吸、笑声、咳嗽等非语言声音。

因此,它处理的不只是“说什么”,还包括“怎么说”。

4. 音频增强与声音分离

对于录音质量较差的音频,AuK 可以进行降噪、去混响和语音恢复。

它还支持从多人对话或混合音频中提取目标声音,例如只保留某个说话人的声音、从音乐中提取人声,或者分离不同说话人的语音。

适合哪些场景?

AuK 更像一个“AI 音频编辑器的底层引擎”,而不仅仅是传统的 TTS 工具。

它可以用于:

  • 内容创作:制作旁白、有声内容、短视频和播客;
  • 影视与游戏:生成或修改角色对白、调整角色情绪和音色;
  • 音乐制作:编辑歌词、提取人声;
  • 语音后期制作:修改台词、调整语速和音调,而无需重新录制;
  • 音频修复:处理噪声、混响和较差的录音;
  • 语音 AI 应用:作为语音生成和语音编辑能力集成到其他 AI 产品中。

尤其值得注意的是,AuK 把语音生成、语音编辑、声音增强和声音分离放进了同一个统一模型和指令体系中。

谁开发的?

AuK 由腾讯(Tencent)的 Hunyuan(混元)团队开发并开源,项目代码和模型权重均公开发布。

项目采用 MIT License 开源,开发者可以基于公开的代码和模型进行研究、修改和应用。

底层使用什么技术?

AuK 是一个 1.5B 参数规模的语音基础模型(foundation model),使用数百万小时的多样化音频数据进行训练。

从代码结构来看,它采用了较为现代的生成式 AI 架构:模型使用文本编码器 + 音频 VAE + Transformer/Flow Matching 编辑生成模块构成核心生成链路;代码中可以看到对 Qwen2.5-Omni 文本/多模态组件、BigVGAN Flow VAE 以及 Flux2Edit/CFMEdit 等模块的使用。

项目提供两个主要版本:

  • AuK:基础版本,重点是高质量语音生成;
  • AuK-Flash:经过蒸馏的快速版本,只需要 4 步推理,更强调生成速度。