Skip to content
MOSS-TTS 1.5

MOSS-TTS 1.5

支持 31 种语言的高表现力开源语音生成模型,主打超稳定声音克隆与秒级精准停顿控制

应用特点

开源文本转语音TTS

系统要求

建议16GB以上内存。硬盘空间23GB以上。
macOS 15及以上版本,仅支持M系列芯片。
Windows10/11 64位,NVIDIA显卡,16GB以上显存。
注意:NVIDIA显卡,请安装较新版本的驱动。

应用介绍

注意:默认仅下载 Local Transformer v1.5 模型。若想使用 MOSS TTS v1.5 模型,选择 MOSS TTS v1.5 运行即可,将自动额外下载约 22GB 的模型文件。

1. 产品定位与开发团队 MOSS-TTS-v1.5 是由 MOSI.AIOpenMOSS 团队 联合开发的一款开源语音与声音生成大模型。作为该系列的最新迭代版本,它专为高保真度、高表现力以及复杂的真实应用场景而设计,旨在提供更自然、更可控的智能语音合成体验。

2. 核心功能与特点(普通用户视角) 对于大众用户和创作者而言,MOSS-TTS-v1.5 带来了以下极具实用性的功能:

  • 零样本声音克隆(Zero-Shot Voice Cloning): 只需要提供一段极短的参考音频,模型就能精准复制说话人的声音特征(包括音色、语调等),实现逼真的声音模仿。
  • 精准的停顿控制(Explicit Pause Control): 用户可以直接在文本中插入类似 [pause 3.2s] 的标记,让 AI 在说话时进行精确到秒的停顿,使得朗读节奏像真人一样自然。
  • 超强的多语言与混合创造(Multilingual & Code-Switching): 支持包括中文、英文、粤语等在内的 31 种语言。即便是中英双语混合的句子,它也能无缝切换,不会出现生硬的机器感。
  • 长文本生成与稳定性: 无论是读小说还是长篇文章,它能保证声音在长时间生成中不失真、不变换音色,且能精准跟随标点符号的语气起伏。

3. 应用场景 该模型可广泛应用于以下场景:

  • 自媒体与有声内容创作: 自动为小说、AI 播客、影视旁白进行高表现力的配音。
  • 游戏与动漫配音: 快速设计和定制独特的虚拟角色语音。
  • 智能助理与客服: 赋予智能硬件或客服系统极具人情味、自然流畅的对话能力。

4. 底层技术原理 在技术架构上,MOSS-TTS-v1.5 基于 Causal Transformer(因果变换器) 架构。它内置了先进的 MOSS-Audio-Tokenizer(音频标记器),能够将复杂的音频信号压缩为高效的语义-声学统一表征。模型采用了自回归(Autoregressive)生成机制与多尺度残差矢量量化(RVQ)技术,从而在底层保证了高音质的音频解码与极强的长上下文建模能力。