本文介绍CalibAtt,一种无需训练的加速文本到视频生成方法。它通过离线校准识别注意力中的稀疏和重复模式,在推理时跳过不重要的token连接,实现硬件高效计算。实验表明,在Wan 2.1等模型上,CalibAtt可提升端到端速度达1.58倍,同时保持视频质量和文本对齐。
该论文提出了一种无需训练且高效的模型生成和增强方案(MGE),生成模型仅需1%的时间,具有竞争力的泛化能力和对抗防御能力。
本文介绍了一种名为DiffSegmenter的无需训练的新方法,利用生成式文本到图像条件扩散模型作为高效的开放词汇语义分割器的潜力。该方法通过将输入图像和候选类别输入到预训练条件潜在扩散模型,产生交叉注意力图直接用作分割分数,然后由自注意力图进一步细化和完成分割。实验证明,DiffSegmenter在开放词汇语义分割方面取得了令人印象深刻的结果。
完成下面两步后,将自动完成登录并继续当前操作。