➡️
继续阅读
-
Kimi K3 模型结构(1):序列维度(上),从线性注意力到 KDA
本文介绍Kimi K3模型中KDA(Kimi Delta Attention)的递推形式,从线性注意力、DeltaNet到Gated DeltaNet演进...
-
趋境科技与摩尔线程达成战略合作,高品质 AI Token 国产异构方案性价比超越国际先进算力
趋境科技与摩尔线程达成战略合作,基于国产PD异构技术与MTT S5000智算卡,共建高品质AI Token工厂。方案已投产,性价比超越国际算力,实现超50...
-
Kimi K3 模型结构(6):输入端与零件,MoonViT-V2、MTP、Per-Head Muon
Kimi K3模型采用从零训练的MoonViT-V2视觉编码器,27层、patch14结构,支持高分辨率图像token化;MTP层预训练后微调为EAGLE...
-
EP224:MCP与RAG及AI代理的对比
本文介绍MCP、RAG与AI Agent的区别:MCP是连接AI与外部工具的标准协议;RAG通过检索外部数据提供最新答案;AI Agent能自主决策执行任...
-
Kimi K3 模型结构(5):宽度维度,Stable LatentMoE
Kimi K3模型采用Stable LatentMoE作为FFN,基于NVIDIA LatentMoE改进,将输入压缩至半宽latent空间,增加RMSN...
-
Claude Fable 5.1 对比 Fable 5:在实际工作中,我无法区分它们。
Anthropic发布Claude Fable 5.1,宣称在编码和知识工作上有重大进步,基准测试得分翻倍。但作者用四个真实任务测试新旧模型,发现两者准确...