2026 年 8 月 12 日——据多家媒体报道,B站(Bilibili)Index 项目组正式开源 IndexTTS-2.5 零样本多语言情感文本转语音(TTS)模型。相比前代 IndexTTS-2,IndexTTS-2.5 将实时因子(RTF)提升 2.28 倍,支持中文、英文、日语、西班牙语和阿拉伯语五种语言的零样本语音克隆与情感迁移,并新增细粒度情感、语速与发音控制能力。

IndexTTS-2.5 的技术报告于 2026 年 1 月 7 日发布在 arXiv(编号 2601.03888),报告发布时模型权重尚未公开。本次开源在 GitHub 仓库 index-tts/index-tts 公布推理代码,模型权重发布于 Hugging Face 与 ModelScope 的 IndexTeam 组织下。

1. 开源发布

据媒体报道,IndexTTS-2.5 模型权重与推理代码于 2026 年 8 月 11 日正式开源。项目主页为 index-tts.github.io,代码仓库为 github.com/index-tts/index-tts,模型权重可在 Hugging Face(IndexTeam/IndexTTS-2.5)与 ModelScope(IndexTeam/IndexTTS-2.5)下载。据官方说明,模型不验证说话人身份或授权状态,用户需自行承担伦理使用责任;未经同意的身份冒充、欺诈与误导性内容生成被列为禁止用途。

2. 核心能力

五语种零样本情感迁移。IndexTTS-2.5 支持中文、英文、日语、西班牙语和阿拉伯语。据技术报告,跨语言情感迁移采用边界感知对齐、Token 级拼接与指令引导生成三种策略,可在缺少目标语言情感训练数据的情况下完成情感迁移。

细粒度控制

  • 情感控制:支持情感向量(0 至 1 权重)、参考音频与基于文本的情感检测三种方式,可实现音色与情感的独立控制。
  • 语速调节:通过 duration_factor 参数支持 0.5 至 2.0 倍语速调整。
  • 发音控制:支持中文拼音、英文 CMU 音素与日语假名三种发音标注方式。

3. 技术改进

据 IndexTTS-2.5 技术报告(arXiv:2601.03888),模型通过四项改进提升多语言覆盖、推理速度与合成质量:

  • 语义编解码器压缩:语义帧率从 50 Hz 降至 25 Hz,序列长度减半,降低训练与推理计算量。
  • 架构升级:S2M(语义到梅尔谱)模块骨干网络由 U-DiT 替换为 Zipformer,减少参数量并加快梅尔谱生成。
  • GRPO 后训练:在 T2S(文本到语义)模块应用组相对策略优化(GRPO),提升发音准确性与自然度。
  • 实测指标:保持与 IndexTTS-2 相当的词错误率(WER)与说话人相似度,实时因子(RTF)提升 2.28 倍。

4. 数据与规格

项目 数据
发布方 B站(Bilibili)Index 项目组
模型类型 零样本多语言情感 TTS
支持语言 中文、英文、日语、西班牙语、阿拉伯语
推理速度 RTF 较 IndexTTS-2 提升 2.28 倍
语义帧率 50 Hz 降至 25 Hz
S2M 骨干网络 Zipformer(替换 U-DiT)
语速调节 duration_factor 0.5 至 2.0 倍
发音控制 中文拼音、英文 CMU 音素、日语假名
情感控制 情感向量、参考音频、文本情感检测
后训练优化 GRPO 强化学习
技术报告 arXiv:2601.03888(2026 年 1 月 7 日发布)
硬件门槛 8GB 显存可运行(社区实测)

注:模型授权条款以官方仓库 LICENSE 说明为准。据媒体报道,代码采用 Apache 2.0 协议;此前 IndexTTS-2 模型权重曾采用非商业用途授权,IndexTTS-2.5 权重的具体授权情况需以官方说明为准。

5. 部署与生态

据社区反馈,IndexTTS-2.5 可在 8GB 显存显卡上完成本地推理,并支持通过 vLLM 进行生产环境部署。公开讨论中提及的应用场景包括有声书制作、跨语言配音、游戏 NPC 配音与对话式 AI 语音反馈。截至 2026 年 8 月 12 日,官方 GitHub 仓库已公开推理代码,Hugging Face 与 ModelScope 已上架模型权重。