本文探讨了大语言模型在推理阶段的退化现象,如死循环和乱码等问题。退化源于自回归Transformer的注意力机制和数值精度,导致输出失控。文章分析了退化的数学根源、表现形式及其机制,并提出了多层防御策略,包括架构设计、数值工程和解码策略,以提高模型在生产环境中的稳定性。
本研究探讨了在贝叶斯优化中使用期望改进(EI)时,由于数值精度敏感性导致的性能提升问题。作者推导了对数变换目标的高斯过程的闭式形式,验证了其在提高预测准确性方面的有效性,增强了EI在实际问题中的应用可行性。
本文介绍了利用合成的原子级数据进行神经网络原子间势函数的预训练任务,以提高计算实践中的数值精度和稳定性。作者通过一系列与碳相关的等变图神经网络势函数进行可行性验证,并进行了初步实验来测试该方法的局限性。
本文研究了基于深度学习的方法是否能够精确解决无噪声的反问题,并提供了证据。通过迭代的端到端网络方案和数据驱动的校准步骤,研究了计算机断层扫描问题,展示了该方案能够使 CT 重建达到数值精度,表现优越。
本文介绍了利用合成的原子级数据作为神经网络原子间势函数的预训练任务,可以提高计算实践中的数值精度和稳定性。作者通过一系列与碳相关的等变图神经网络势函数进行可行性验证,并进行了初步实验来测试该方法的局限性。
完成下面两步后,将自动完成登录并继续当前操作。