SANA-Video 2.0 是一个混合视频扩散 Transformer,提供 5B 和 14B 两种规模,可在单 GPU 上生成最高 720p 视频。其 Hybrid Linear-Softmax Attention 以 3:1 比例混合线性与 softmax 注意力,配合 Block Attention Residuals 将深层有效秩提升约 12%。
查看原文:https://arxiv.org/abs/2607.21553
来源:HuggingFace Daily Papers(社区热门论文)
未经允许不得转载:AI之家 » SANA-Video 2.0:混合线性注意力与注意力残差实现高效视频生成




评论 ( 0 )