Skip to content
IndexTTS 2.5

IndexTTS 2.5

支持多语言秒级声音复刻、精细化情感调节、语速控制与精确拼音/音标发音纠错

应用特点

开源文本转语音TTS

系统要求

最低16GB内存。预留足够硬盘空间,建议24GB以上。
macOS 15及以上版本,仅支持M系列芯片。
Windows10/11,可用CPU,推荐用NVIDIA GPU (8GB以上显存)注意:NVIDIA显卡,请安装较新版本的驱动。

应用介绍

IndexTTS 是一款工业级、高度可控且高效的零样本语音合成(Text-To-Speech / TTS)系统。对于普通用户和内容创作者来说,它就像一个“AI 声音克隆与配音大师”:

IndexTTS 2.5 相比于 2.0 的升级亮点

  1. 多语言拓展:在原有中英双语基础上,新增了日语、西班牙语、阿拉伯语支持(现支持中、英、日、西、阿 5 种语言),并提升了跨语言音色迁移能力。
  2. 推理速度与吞吐显著提升:2.5 版本优化了模型结构与推理流程,全面支持 BF16 精度与 vLLM 部署框架,生成速度更快,推理延迟更低。
  3. 新增语速调节(duration_factor:支持在 0.5x–2.0x 范围内灵活控制合成语音的整体时长与语速。
  4. 多语言发音控制升级:从 2.0 时代的中文拼音控制扩展到中文拼音、英文 CMU 音标、日语假名的全方位精确发音控制。

核心功能

  • 零样本声音克隆(1秒极速复刻):只需提供一段简短的参考音频(几秒钟),系统就能精准克隆出目标说话人的音色。
  • 丰富的情感表现与独立控制:支持精细化情感调节。你可以让合成的语音表达欢快、悲伤、愤怒等情绪,甚至可以把“张三的说话声音(音色)”与“李四的表达情感”结合起来(音色与情感解耦),或者直接输入一段文字描述(如“用焦急且低沉的声音说”)来控制语音情绪。
  • 语速与停顿精准掌控:支持对合成语音进行 0.5 倍到 2.0 倍的语速调节,并能精准控制句中停顿与节奏,非常适合对音视频对齐有严苛要求的场景。
  • 发音精准纠错:支持通过拼音(中文)、CMU 音标(英文)和假名(日文)直接指定发音,彻底解决多音字错读、生僻字发音不准的问题。

研发团队与应用场景

  • 开发团队:由 哔哩哔哩(Bilibili)IndexTeam / 语音团队 自研并开源。
  • 适用场景
  • 长视频/短视频配音:自媒体创作、影视对白、动漫与游戏角色配音。
  • 有声书与播客:批量生成富有情感色彩的角色朗读。
  • 虚拟人与 AI 助手:为交互式虚拟主播、智能客服提供实时且自然的人声。
  • 跨语言出海配音:将某种语言的音色无缝切换至其他语言进行跨语言朗读。

底层核心技术

IndexTTS 架构采用了自回归(Autoregressive)大模型路线:

  • 模型架构:基于约 8 亿参数(0.8B)的 GPT 式自回归 BackBone 结构,结合 Flow-Matching 语音解码器与 BigVGAN 高保真声码器。
  • 声学特征解耦:引入自研的特征分离与融合策略,将音色(Timbre)与情感(Emotion)特征互相解耦,并结合文本软指令(基于 Qwen 等大模型微调)实现自然语言引导的情感控制。
  • 音标与建模:采用字符-拼音/音标混合建模机制,结合 MaskGCT 语义编解码器、w2v-bert-2.0 及 CAMPPlus 说话人提取模型,确保高自然度与低字错率(WER)。
  • 推理加速:支持 BF16/FP16 半精度推理、DeepSpeed 加速以及 vLLM 生产级部署支持。