➡️
继续阅读
-
让炼丹更科学一些(九):经典自适应梯度算法
本系列前面八篇文章,都是在围绕SGD及其学习率讨论。而从本文开始,我们将正式进入自适应梯度算法的世界。可以说,现在所有的自适应梯度算法,都有一个共同的源头...
-
在 Medium 发文章:用 AI 做高质量的英文内容营销
本文介绍如何利用AI在Medium平台发布英文深度文章以进行内容营销。内容包括连接Medium账号、授权AI撰写文章、生成配图并发布,以及查看阅读数据。文...
-
Kimi K3 模型结构(2):序列维度(下),chunkwise 并行与下界衰减
本文介绍Kimi K3模型序列维度的chunkwise并行算法:将序列分块,块间递推状态、块内用矩阵乘并行计算。K3将每步log-decay加−5下界,使...
-
谎言秩序:俄罗斯的公共生活的荒诞性
俄罗斯这个民族的公共生活是由谎言所维系的,其民族集体心理已经陷入深度扭曲长达几个世纪。帝国时代,沙皇君权神授,体贴爱民;假如哪里出了问题,那一定是贵族和官...
-
Kimi K3 模型结构(1):序列维度(上),从线性注意力到 KDA
本文介绍Kimi K3模型中KDA(Kimi Delta Attention)的递推形式,从线性注意力、DeltaNet到Gated DeltaNet演进...
-
Kimi K3 模型结构(4):深度维度,Attention Residuals
本文解析Kimi K3模型中的Attention Residuals(注意力残差)结构。该机制将残差连接视为深度方向上的RNN,通过可学习伪query对e...