➡️
继续阅读
-
大语言模型的基石:Transformer 入坑笔记(四) - 线性注意力(Linear Attention) 的基础
本文探讨Transformer注意力机制的计算复杂度问题,指出标准注意力在长上下文下时间和空间开销呈平方增长。文章概述了高效注意力、FlashAttent...
-
DeepSeek采购160000颗华为AI芯片:专攻推理不碰训练
DeepSeek计划采购16万颗华为昇腾950DT芯片,用于内蒙古乌兰察布数据中心的推理任务,而非训练,订单约25.6亿美元。此举旨在降低成本、规避美国管...
-
Kimi K3 模型结构(8):训练并行,一步训练里谁在等谁
本文介绍Kimi K3模型预训练的并行系统设计,聚焦MoE层expert并行。核心是MoonEP方案:每个rank预留E/R个冗余expert槽位,确保任...
-
【Rust日报】2026-09-07 Gecko 模拟器大更新可玩 Galaxy
Gecko模拟器用Rust实现GameCube/Wii游戏,性能大幅提升,新增存档功能,多款游戏可玩。另有ESP32用Rust实现SWD编程器、Empow...
-
GitHub 热门项目周刊 · 第 27 期 · 2026 年第 37 周
该周刊精选了GitHub上7天内最热门的10个开源项目,涵盖AI、开发工具等领域。重点包括:m3e-canvas将Material 3设计转为AI提示词;...
-
支持亚太地区16个绿色AI项目
谷歌在亚太地区启动“AI for the Planet”加速器项目,选出16家初创、非营利及研究机构,利用前沿AI模型应对环境挑战。项目涵盖生物多样性监测...