
TurboT2VA:分数正则化一致性蒸馏加速 19B 视频音频联合生成,四步采样 20.1×、H20 上全栈 54.67×
联合文生视频+音频模型推理开销巨大。TurboT2VA 针对 19B 联合视频音频模型提出蒸馏+推理框架:逐模态归一化解决模态不均衡优化,渐进式课程(离散一致性预热→连续一致性精炼→联合一致性-分布匹配)先建立稳定多样轨迹再做分布级精炼。LTX-2 上四步蒸馏将 512×768 生成延迟 50.52s→2.51s(20.1×),画质/音质/多样性/音画同步保持;架构感知推理栈(guard W8A8+融合算子、padded-text 压缩、模态感知稀疏注意力)在 1024×1792 高分辨率下单张 H20 318.74s→5.83s(54.67×)。
Xiaoda Yang, Yuxiang Liu, Kaiwen Zheng2026年8月25日
arXivTurboT2VAText-to-Video-Audio2026年8月25日