2026 年 8 月 12 日——据多家媒体报道,B站(Bilibili)Index 项目组正式开源 IndexTTS-2.5 零样本多语言情感文本转语音(TTS)模型。相比前代 IndexTTS-2,IndexTTS-2.5 将实时因子(RTF)提升 2.28 倍,支持中文、英文、日语、西班牙语和阿拉伯语五种语言的零样本语音克隆与情感迁移,并新增细粒度情感、语速与发音控制能力。
IndexTTS-2.5 的技术报告于 2026 年 1 月 7 日发布在 arXiv(编号 2601.03888),报告发布时模型权重尚未公开。本次开源在 GitHub 仓库 index-tts/index-tts 公布推理代码,模型权重发布于 Hugging Face 与 ModelScope 的 IndexTeam 组织下。
1. 开源发布
据媒体报道,IndexTTS-2.5 模型权重与推理代码于 2026 年 8 月 11 日正式开源。项目主页为 index-tts.github.io,代码仓库为 github.com/index-tts/index-tts,模型权重可在 Hugging Face(IndexTeam/IndexTTS-2.5)与 ModelScope(IndexTeam/IndexTTS-2.5)下载。据官方说明,模型不验证说话人身份或授权状态,用户需自行承担伦理使用责任;未经同意的身份冒充、欺诈与误导性内容生成被列为禁止用途。
2. 核心能力
五语种零样本情感迁移。IndexTTS-2.5 支持中文、英文、日语、西班牙语和阿拉伯语。据技术报告,跨语言情感迁移采用边界感知对齐、Token 级拼接与指令引导生成三种策略,可在缺少目标语言情感训练数据的情况下完成情感迁移。
细粒度控制:
- 情感控制:支持情感向量(0 至 1 权重)、参考音频与基于文本的情感检测三种方式,可实现音色与情感的独立控制。
- 语速调节:通过
duration_factor参数支持 0.5 至 2.0 倍语速调整。 - 发音控制:支持中文拼音、英文 CMU 音素与日语假名三种发音标注方式。
3. 技术改进
据 IndexTTS-2.5 技术报告(arXiv:2601.03888),模型通过四项改进提升多语言覆盖、推理速度与合成质量:
- 语义编解码器压缩:语义帧率从 50 Hz 降至 25 Hz,序列长度减半,降低训练与推理计算量。
- 架构升级:S2M(语义到梅尔谱)模块骨干网络由 U-DiT 替换为 Zipformer,减少参数量并加快梅尔谱生成。
- GRPO 后训练:在 T2S(文本到语义)模块应用组相对策略优化(GRPO),提升发音准确性与自然度。
- 实测指标:保持与 IndexTTS-2 相当的词错误率(WER)与说话人相似度,实时因子(RTF)提升 2.28 倍。
4. 数据与规格
| 项目 | 数据 |
|---|---|
| 发布方 | B站(Bilibili)Index 项目组 |
| 模型类型 | 零样本多语言情感 TTS |
| 支持语言 | 中文、英文、日语、西班牙语、阿拉伯语 |
| 推理速度 | RTF 较 IndexTTS-2 提升 2.28 倍 |
| 语义帧率 | 50 Hz 降至 25 Hz |
| S2M 骨干网络 | Zipformer(替换 U-DiT) |
| 语速调节 | duration_factor 0.5 至 2.0 倍 |
| 发音控制 | 中文拼音、英文 CMU 音素、日语假名 |
| 情感控制 | 情感向量、参考音频、文本情感检测 |
| 后训练优化 | GRPO 强化学习 |
| 技术报告 | arXiv:2601.03888(2026 年 1 月 7 日发布) |
| 硬件门槛 | 8GB 显存可运行(社区实测) |
注:模型授权条款以官方仓库 LICENSE 说明为准。据媒体报道,代码采用 Apache 2.0 协议;此前 IndexTTS-2 模型权重曾采用非商业用途授权,IndexTTS-2.5 权重的具体授权情况需以官方说明为准。
5. 部署与生态
据社区反馈,IndexTTS-2.5 可在 8GB 显存显卡上完成本地推理,并支持通过 vLLM 进行生产环境部署。公开讨论中提及的应用场景包括有声书制作、跨语言配音、游戏 NPC 配音与对话式 AI 语音反馈。截至 2026 年 8 月 12 日,官方 GitHub 仓库已公开推理代码,Hugging Face 与 ModelScope 已上架模型权重。
举手提问