➡️
继续阅读
-
大语言模型的基石:Transformer 入坑笔记(四) - 线性注意力(Linear Attention) 的基础
本文探讨Transformer注意力机制的计算复杂度问题,指出标准注意力在长上下文下时间和空间开销呈平方增长。文章概述了高效注意力、FlashAttent...
-
DeepSeek-V4 模型结构(1):序列维度(上),从 MLA 到压缩 KV
本文介绍DeepSeek-V4的注意力机制,从MHA到CSA/HCA的演进,重点分析压缩KV缓存的方法。V4将每4或128个token压缩为一条512维K...
-
GitHub 热门项目周刊 · 第 27 期 · 2026 年第 37 周
原文:GitHub 热门项目周刊 · 第 27 期 · 2026 年第 37 周版权归 浅时光博客 所有。
-
分析哲学史没有通史:揭秘与大陆哲学通史的根本分野
英美哲学圈为什么集体抵制自家通史! 你学任何学科都有经典通史可读,唯独这个领域,教授直接劝你别碰! 分析哲学史推荐书单几乎空白,从逻辑实证主义到日常语言哲...
-
大脑充血 Vol.97
宣布 周刊改月刊 已经有两周了,我怎么还在周更……? 这篇是九月的正刊,正刊在每月的第一个周一发布。上周发布的是一篇 小报 ,小报可能会随机出...
-
GS Caltex’s Saehong Hur: Leading from the top; moving forward—together
For Saehong Hur, continued communication and an integrated mindset are vital ...