克服基于变换器的下一帧预测中的语义稀释

📝

内容提要

本研究解决了基于变换器的下一帧预测模型面临的语义稀释问题,提出了一种语义集中多头自注意力(SCMHSA)架构。通过优化损失函数,使得训练目标与模型输出更为一致,从而提升了对时空信息的捕捉能力,实验结果显示该方法在性能上优于原有的变换器预测模型。

➡️

继续阅读