➡️
继续阅读
-
Presentation: From S3 to GPU in One Copy: Rethinking Data Loading for ML Training
Onur Satici explains how Vortex, an open-source columnar file format under th...
-
dsh-speech测评:DeepSeek Harness语音插件让打字变成历史
dsh-speech是DeepSeek Harness的语音插件,支持实时语音输入和AI回答的语音摘要,由AllModels.io提供技术。它区别于其他插...
-
Kimi K3 模型结构(1):序列维度(上),从线性注意力到 KDA
本文介绍Kimi K3模型中KDA(Kimi Delta Attention)的递推形式,从线性注意力、DeltaNet到Gated DeltaNet演进...
-
Kimi K3 模型结构(4):深度维度,Attention Residuals
本文解析Kimi K3模型中的Attention Residuals(注意力残差)结构。该机制将残差连接视为深度方向上的RNN,通过可学习伪query对e...
-
Kimi K3 模型结构(0):一张图看懂 Kimi K3
Kimi K3是2.78T参数、104.2B激活的93层MoE模型,支持1M上下文及图像视频输入。其结构创新分三方面:序列用KDA与Gated MLA混合...
-
入蜀记 day467 小小的真理
文章记录了作者在成都的日常生活与思考,包括买菜、阅读、观看农业节目等。作者反思实践的重要性,感叹农业的脆弱与科技应对天灾的局限,并讨论文化个体化趋势、地震...