当前位置:首页 » AI资讯 » AI快讯

SwanTale:面向指令与零样本任务的统一多说话人语音与音频生成

2026-08-04 13

SwanTale 提出统一的多说话人语音与音频生成模型,同时支持零样本与指令任务。研究配套推出 SwanData-Caption 数据方案,通过清洗、合成覆盖与多级标注解决数据稀缺问题,并引入 SwanVAE、Unified MoE、GRPO 后训练等技术。实验显示,SwanTale 在多项零样本与指令指标上领先,并在两项任务的表达力评分中均取得最佳成绩。

来源:HuggingFace Daily Papers(社区热门论文)

相关推荐

扫码关注

qrcode

联系我们

回顶部