DeepSeek-V4采用Muon优化器,通过谱范数最速下降实现逐矩阵正交化,用Newton-Schulz迭代逼近SVD,混合系数提升小奇异值并精确稳定大值。RMS匹配对齐AdamW,部分参数仍用AdamW。Q/KV归一化替代QK-Clip防logit爆炸,Anticipatory Routing打断MoE路由正反馈,MTP预测多token,训练配方含32T token等细节。
本文通过基准测试,量化了Qdrant优化器配置对搜索延迟的影响。连续索引虽在加载后需恢复期,但稳态延迟可降180倍;启用prevent_unoptimized能大幅降低排空期延迟,但新点暂不可见。单段配置稳态最快但恢复慢,限制段大小则相反。串行化优化线程可平滑延迟但延长排空。提高删除阈值可避免真空干扰。建议根据负载权衡配置。
本文介绍OLAP查询规划器与优化器的实现,涵盖三个阶段:绑定器解析名称和类型、优化器通过谓词下推、常量折叠和投影下推提升效率、物理规划器将逻辑算子映射为可执行算子。以DuckDB为例,展示逻辑计划树构建及优化过程,最终减少数据处理量,提高查询性能。
本文讨论了优化器在 SQL 查询中的重要性,特别是 Apache Calcite 和 Trino 的关系。Calcite 提供逻辑计划和优化规则,而 Trino 则采用自研规划器,借鉴 Calcite 的代数思想。文章还介绍了物理计划的执行约定、优化规则及其在 Trino 中的实现,强调了优化阶段的流水线和调试手段。
在蒙特利尔的开发者培训计划中,参与者深入学习了PostgreSQL的优化器、IPC和共享内存等内容。Robert Haas的课程受到高度评价,学员们积极参与讨论和实践,计划未来继续研究优化器源代码和相关补丁,以提升对PostgreSQL的理解和应用。
本文讨论了MySQL 8.0.36中优化器与处理器的关系,重点介绍了索引条件下推(ICP)和多范围读取(MRR)机制。ICP通过在二级索引上过滤条件来减少回表次数,而MRR则通过批量收集主键来优化IO性能。文章分析了优化器如何利用统计信息选择索引,并使用EXPLAIN分析执行计划。同时,强调了MySQL与PostgreSQL在处理机制上的差异。
Postgres 19引入了pg_plan_advice和pg_stash_advice模块,提供查询建议功能,帮助优化器选择更好的执行计划。此功能允许DBA在特定情况下调整查询计划,提升Postgres的灵活性和性能。
DeepSeek-V4系列模型推出了1.6T和284B参数的两个版本,采用混合注意力架构和流形约束超连接,提升了长上下文处理效率。通过Muon优化器和多项基础设施优化,模型在训练和推理阶段展现出更高的稳定性和效率。预训练后,DeepSeek-V4在多个基准测试中超越前代,设立了新的性能标准。
DeepSeek-V4技术报告强调通过改进注意力机制和优化器,提高超长上下文处理效率,能够高效处理1M上下文,降低计算和缓存成本。模型在中文写作和白领任务中表现良好,但在复杂任务上仍需提升。整体目标是解决长上下文的成本问题,提供完整的技术方案。
本文探讨了在Transformer模型中将点积结果除以√d_k的原因。这一操作旨在避免softmax函数饱和,确保梯度有效传播。通过数学推导,证明了点积的方差为d_k,缩放后方差归一化为1,从而保持训练的稳定性。文章还讨论了不同维度下的训练效果及现代优化器如何与√d_k的设计结合,以提升模型性能。
文章讨论了优化器的选择与学习率的调整,指出不同任务对优化器的需求。SGD在某些视觉任务上优于Adam,学习率过小可能导致训练缓慢和局部极小值问题。此外,梯度消失与爆炸仍是深度学习中的挑战,需要理解其在现代架构中的表现。
本文介绍了机器学习中自动微分的实现方法,通过将复杂函数拆解为基本运算构建计算图,以精确高效地计算导数。文章还展示了反向传播、梯度更新及优化器的实现,并提供了一个类似PyTorch的开源框架。
在MySQL中,可以通过开启优化器跟踪来分析索引使用情况,从而了解优化器如何处理查询以及未使用预期索引的原因。
PostgreSQL 18引入了多列B树索引的跳过扫描功能,显著增强了优化器。在低基数情况下,跳过扫描能显著提升查询速度,而在高基数情况下,全索引扫描仍然更优。
最近笔者刷到论文《Why Adam Works Better with β1=β2: The Missing Gradient Scale Invariance Principle》,顾名思义,...
文章讨论了客户在批处理后首次执行查询时速度缓慢的问题。分析显示,查询计划在两次执行中不同,主要由于连接策略变化:首次使用合并连接,第二次使用嵌套循环连接。尽管表未清理或分析,优化器行为仍不同,导致执行时间差异。最后,作者提供了重现此现象的脚本。
谷歌新论文《嵌套学习:深度学习架构的幻象》指出,大型语言模型存在“数字失忆症”,无法有效记忆新知识。研究强调优化器不仅是训练工具,更是记忆系统,提出“嵌套学习”新范式,强调模型深度与更新频率的平衡。新架构HOPE模仿人脑记忆机制,展现了解决持续学习问题的潜力,可能改变AI设计逻辑。
自去年提出的Muon优化器已在多个训练框架中应用,表现优异。本文介绍了从Adam切换到Muon的技术细节,包括不同版本的参数设置和注意事项。Muon专注于矩阵参数优化,用户需了解输入输出维度的定义以确保正确使用。
Kimi发布了K2,一个拥有320亿参数的大型语言模型,采用新优化器MuonClip,解决了训练不稳定性。K2在推理和编程基准测试中表现优异,支持动态资源利用,具备高效推理能力,并在商业使用上有特定要求。
本文详细介绍了MySQL中SQL语句的执行过程,包括客户端发送请求、连接器验证权限、分析器解析语句、优化器生成执行计划以及执行器从存储引擎获取数据并返回结果的各个步骤。
完成下面两步后,将自动完成登录并继续当前操作。