DeepSeek-V4.1在主干外有两处改动。视觉端:自研DeepSeek-ViT从零训练,采用2D-RoPE、RMSNorm、SwiGLU,经3×3 pixel-unshuffle将token数除以9,再投影到5120维;1302×1302图像占994个位置,文本与图像token各用一套MoE负载均衡偏置。优化器端:head-wise Muon按注意力头分别正交化query权重;Sinkhorn-balanced update以行列交替归一化替代Adam二阶动量,仅存一份动量即可训练196B参数的Engram表。
本文探讨了大规模Sinkhorn耦合在训练流模型中的优势。流模型通过时间依赖的速度场将数据从一种模态转换为另一种模态。研究表明,增加样本对数量和优化耦合锐度能显著提升流模型在合成和图像生成任务中的表现,尤其是在低熵正则化条件下。
本研究解决了现代神经网络在训练和测试数据分布不一致的情况下的泛化能力差的问题。提出的SIDDA方法通过Sinkhorn散度进行领域适应,能够以较少的超参数调整和计算成本实现有效的领域对齐。研究表明,SIDDA显著提高了未标记目标数据的分类准确性和模型校准能力,具有广泛的应用潜力。
本文提出了一系列新算法解决最优输运问题,包括APDAMD、Semi-Relaxed Sinkhorn和Sinkhorn-Newton-Sparse,展示了它们在效率和收敛性上的优势。同时,研究探讨了不平衡输运和部分最优输运问题的应用,提供了理论保证和实用算法,推动了相关领域的发展。
本文研究了熵正则化下的最优输运问题,提出了一种基于Sinkhorn算法的解法,并证明了其收敛性和复杂度优势。通过动态正则化和二阶加速技术,改进了算法的收敛速度,适用于复杂场景中的输运计划。
本文提出了一种基于CLIP的零样本分割方法,通过优化文本提示和图像嵌入,显著提升医学图像分割性能。研究验证了多视角提示学习和自适应提示优化框架的有效性,实验结果显示该方法在多个数据集上具有优越表现和良好的泛化能力。
本文研究了满足等式和不等式约束条件下的熵正则化的最优输运问题,并提出了一种基于 Sinkhorn 算法的对应解法。通过理论保证,我们首先得出在解决问题时通过熵正则化所带来的近似误差随着参数增加而指数级减小。此外,通过描述具有李雅普诺夫函数的优化过程,我们证明了 Sinkhorn...
该文综述了知识蒸馏与最优传输结合的研究,包括R2KD、WCoRD、RKD等方法,利用Sinkhorn距离和Wasserstein距离实现师生知识转移,应用于跨语言摘要、度量学习、神经机器翻译及生成模型等任务,在CIFAR-100、ImageNet等数据集上超越现有方法。
本研究发现图神经网络中节点的注意力机制对分类性能有微弱或有害影响,但在某些条件下可以提高分类性能达到60%以上。为了实现这些条件,需要在初始化或监督训练注意力方面下功夫,并提出了一种弱监督训练注意力的方法,效果与有监督学习基本一致。
本文研究了非平衡度量之间的部分最优输运问题及其在人工智能任务中的应用。提出了一种新的算法来解决这一问题,并提供了几种近似方法。展示了该算法在实际应用中的实用性。
该论文研究了Schr"odinger桥问题和熵惩罚的最优输运之间的等价性,并提出了一种新的方法来探究二者的对偶性。该方法在正则化参数趋于零时一致,并适用于多个数据边缘的情况。研究还证明了Sinkhorn算法的新的收敛性质。
本研究使用双编码器和跨注意力的视觉文本变压器方法进行基于语言的搜索,提高了检索准确性和可扩展性。在Flickr30K图像数据集和VATEX视频数据集上进行了验证。
完成下面两步后,将自动完成登录并继续当前操作。