本文详细解析了Transformer模型的训练配方,包括超参数选择、warmup的重要性、学习率公式设计、dropout和label smoothing的应用。通过对比2017年与现代大模型的训练方法,指出核心训练策略基本保持不变,这些细节对于复现原论文的BLEU分数至关重要。
本文介绍了7个优化XGBoost库的Python技巧,以提升预测模型的准确性,包括调整学习率和树的数量、限制树深度、通过子采样减少过拟合、添加正则化、使用早停法、进行超参数搜索和处理类别不平衡。这些方法能显著提高模型性能。
本文介绍了三种高级超参数搜索方法:随机搜索、贝叶斯优化和逐步淘汰。这些方法能快速找到最佳模型配置,提升模型性能,其中贝叶斯优化效果最佳,验证准确率达到96%-97%。
本文探讨了Muon优化器在大规模LLM训练中的应用,重点分析了如何将Adam的Update RMS调整至0.2。实验结果显示,Adam的Update RMS在训练过程中保持在0.2至0.3之间,并探讨了其理论基础。模拟结果表明,Update RMS与超参数β1呈正相关,并与信噪比相关。最后,提出了一种通用的估计方法以理解Update RMS的行为。
Redis介绍了检索优化器及其在评估驱动开发中的重要性。通过贝叶斯优化,用户可以有效选择超参数,减少实验次数,优化过程关注于最大化目标函数,如召回率和延迟。检索优化器利用Redis的嵌入缓存功能,提高了测试速度。
本文分享了对大型语言模型(LLM)微调的经验,强调损失/奖励变化与测试数据性能的一致性,调整学习率和正则化惩罚,进行科学对照实验以验证想法,并在训练不顺利时才调整超参数。此外,建议在输出最终答案前处理LLM的输出过程。
斯坦福大学CS336课程探讨了大语言模型的扩展法则,重点介绍了MUP方法在模型训练中的应用。MUP通过调整超参数,确保模型扩展时学习率稳定,简化了超参数调优。课程还分析了Cerebrus GPT、MiniCPM和DeepSeek等模型的扩展策略,强调批量大小和学习率的重要性,并通过实验验证这些理论。
本研究提出了一种新方法,解决大型语言模型的幻觉和过时知识问题,分析超参数对检索增强生成(RAG)系统的影响,发现最佳超参数组合能提高响应速度并保持高检索准确性,为临床决策支持等应用提供重要参考。
本文讨论了机器学习的关键概念,包括权重、偏差、超参数、前向传播、反向传播、激活函数以及L1和L2正则化与梯度。
本研究提出了DualOptimizer,通过自适应学习率和解耦动量因子,解决了现有机器遗忘方法在超参数上的敏感性问题。实验证明,该方法显著提高了机器遗忘的有效性和稳定性,适用性广泛。
斯坦福CS336课程讲解了语言模型架构与超参数,强调实践经验的重要性。课程回顾了变换器的基本结构,探讨了不同架构变体及超参数选择对模型性能的影响。现代模型普遍采用预归一化和RMS归一化,且大多数模型不再使用偏置项。同时,课程讨论了位置嵌入的演变,强调相对位置嵌入的有效性。
硅基流动发布了大模型API评测指南,指出当前评测中的误区,强调API与应用效果的区别,以及超参数设置对测试结果的影响。评测者需关注随机性,建议采用双盲测试以确保客观性。同时,硅基流动正在改进服务,提供更稳定的API版本。
何恺明与Yann LeCun合作提出了一种新型Transformer架构Dynamic Tanh(DyT),可替代传统归一化层。DyT通过可学习参数实现输入的非线性压缩,实验结果显示其在多项任务中表现优于或等同于传统方法,且无需调整超参数,具有提升训练和推理速度的潜力。
本研究提出了一种通用的超参数缩放法则,解决了大型语言模型的超参数优化问题。研究发现,最佳学习率与模型参数和数据规模呈幂律关系,而批次大小主要与数据规模相关。这为模型性能优化提供了有效工具。
本研究提出了一种针对NAdamW的超参数设置方法,旨在资源有限的情况下有效优化神经网络。实验结果表明,该方法在AlgoPerf基准上优于传统方法,解决了深度学习中的超参数调优问题。
月之暗面开源了改进版Muon优化器,计算效率提升2倍,优于AdamW。新模型Moonlight在相同预算下表现更佳,支持大规模训练,无需调整超参数。
本文提出了一种新方法,解决了在缺乏目标模型超参数知识时的成员推断攻击(MIA)局限性。通过匹配目标模型与影子模型的输出分布来选择影子模型的超参数,实现了几乎无差异的攻击性能。此外,研究表明,差分隐私转移学习中未考虑的隐私风险对MIA脆弱性影响不大。
学习率是机器学习中的超参数,决定模型学习速度。合适的学习率对模型性能至关重要,过高可能导致过拟合,过低则可能影响性能。学习率主要分为固定学习率和自适应学习率,选择方法包括网格搜索、随机搜索和学习率调度器。
本文提出了一种自动化模型合并框架,克服了手动设计超参数合并策略的局限性。该框架利用多保真近似方法,支持单目标和多目标优化,能够在有限计算成本下自动发现有效的合并方案。
本研究提出了一种自适应法则基础转化(ALT)方法,旨在解决传统时间序列分类在处理复杂数据时的挑战。ALT通过可变长度时间窗口有效捕获特征模式,保持少量超参数,从而实现先进的分类性能。
完成下面两步后,将自动完成登录并继续当前操作。