小红花·文摘
  • 首页
  • AI Tokens🪙
  • 排行榜🏆
  • 直播
  • FAQ

本文探讨Transformer注意力机制的计算复杂度问题,指出标准注意力在长上下文下时间和空间开销呈平方增长。文章概述了高效注意力、FlashAttention和线性注意力等优化方案,其中线性注意力通过将Softmax替换为elu+1特征映射,将复杂度降至线性,并引入RNN式递归状态,为后续Kimi等长上下文模型奠定基础。

大语言模型的基石:Transformer 入坑笔记(四) - 线性注意力(Linear Attention) 的基础

I'm OWenT I'm OWenT · 2026-09-06T22:47:45Z
Kimi K3 模型结构(1):序列维度(上),从线性注意力到 KDA

本文介绍Kimi K3模型中KDA(Kimi Delta Attention)的递推形式,从线性注意力、DeltaNet到Gated DeltaNet演进而来。KDA通过逐通道衰减和擦除写入机制更新状态,每头128×128矩阵,不依赖上下文长度。它采用逐头RMSNorm和满秩sigmoid输出门,在合成任务中表现优于基线,并天然具备位置编码能力。

Kimi K3 模型结构(1):序列维度(上),从线性注意力到 KDA

Java不加糖's Blog Java不加糖's Blog · 2026-09-05T13:20:00Z

文章探讨了产品设计中通过积分、签到、重置次数等机制制造用户焦虑的现象。作者回顾了V2EX铜币、游戏日常任务及ChatGPT重置额度的经历,指出这些设计消耗注意力,传递焦虑而非真正价值。最终呼吁人们避免为无意义之事浪费精力,将有限注意力用于有价值之处。

别为重置额度焦虑:一些没有意义的事情

Dallas Lu Dallas Lu · 2026-09-02T10:04:00Z
避免陷入执念:要尝试用注意力、而不是用意志力!

本文通过作家梅根·奥吉布林戒酒十一年后复饮并尝试皈依天主教的经历,探讨意志力与注意力的区别。引用西蒙娜·薇依和默多克的观点,指出意志力无法真正改变缺点,而注意力是一种消极努力,通过清空自我并持续注视善,才能使欲望自然对齐,实现真正的自由。

避免陷入执念:要尝试用注意力、而不是用意志力!

极道 极道 · 2026-09-01T04:07:00Z
注意力能消肿吗!《自然》子刊90%人验证的消炎开关

以色列巴伊兰大学研究发现,主动关注身体发炎部位可使炎症缩小1.5倍,而分散注意力反而加重炎症。90%参与者在分散注意时炎症更大。机制涉及两条通路:感觉信号和大脑自上而下的迷走神经抗炎通路。研究提示“转移注意力”虽缓解主观疼痛,但可能阻碍生理恢复,正念冥想或可激活抗炎机制。

注意力能消肿吗!《自然》子刊90%人验证的消炎开关

极道 极道 · 2026-08-18T02:28:00Z
KDA机制解密:Kimi K3押注能“在线训练”的注意力架构

Kimi K3模型采用KDA机制,通过0.22GB的在线学习状态矩阵在对话中实时更新记忆,实现跨会话持续学习。它删除位置编码,用衰减体现顺序,支持泛化联想。未来可通过状态保存、分层记忆和外挂数据库,让AI记住用户,但容量扩大面临延迟和工程挑战。

KDA机制解密:Kimi K3押注能“在线训练”的注意力架构

极道 极道 · 2026-08-09T05:22:00Z

本文回顾GPT系列发展:GPT-1确立Decoder-only预训练,GPT-2展现zero-shot潜力,GPT-3引入上下文学习,InstructGPT通过RLHF实现指令对齐,ChatGPT以对话形态普及,GPT-4迈向多模态。Decoder-only因训练简单、接口通用、扩展清晰而胜出,但存在推理延迟、长上下文成本、幻觉和对齐代价。

【Transformer 与注意力机制】38|GPT 系列:从续写到助手,每一代到底改变了什么

土法炼钢兴趣小组的博客 土法炼钢兴趣小组的博客 · 2026-08-08T00:00:00Z

注意力构成经验,生活细节只有被注意才被体验。注意力有成本,分配反映真实价值排序,易被产业劫持。它塑造感知,形成路径依赖,过度聚焦会放大问题。注意力有质地,方向与方式同等重要。分配不足会削弱与自我、环境、关系的连接。注意力可训练,自主拉回游移是意志力本质,修行在于缩短知道与做到的距离。

注意力

Limboy Limboy · 2026-08-08T00:00:00Z

本文探讨大模型训练中算力分配的核心问题:模型参数与训练数据应如何配比。Kaplan 研究建议偏重模型规模,而 Chinchilla 研究通过三种方法证明两者应等比例增长,并指出前者因学习率调度设计缺陷导致结论偏差。文章还讨论了推理成本、数据受限等现实约束对最优配比的影响,以及相关复现争议。

【Transformer 与注意力机制】34|Scaling Laws:Kaplan 与 Chinchilla 之争,以及算力预算怎么分配

土法炼钢兴趣小组的博客 土法炼钢兴趣小组的博客 · 2026-08-08T00:00:00Z

本文深入剖析BERT架构的机制与证据:MLM的80/10/10掩码策略在微调与特征提取场景影响不同;NSP被RoBERTa质疑的证据链复杂,其必要性取决于输入打包方式;BERT作为马尔可夫随机场可用吉布斯采样生成文本,但代价高昂;后续如ModernBERT等仍在升级Encoder-only路线,因其在分类、检索等任务上仍有成本优势。

【Transformer 与注意力机制】37|BERT:MLM、NSP 与 Encoder-only 路线的代价

土法炼钢兴趣小组的博客 土法炼钢兴趣小组的博客 · 2026-08-08T00:00:00Z

大模型训练不稳定是常见问题,表现为loss尖峰、发散或NaN。关键预警信号是梯度范数异常,而非loss本身。常用修复手段各有针对:warmup解决Adam早期方差,Pre-LN保持恒等映射,BF16扩大数值范围,梯度裁剪仅作保险丝。loss spike根因包括数值、优化和数据问题。小模型稳定超参放大后失效,因学习率安全窗口随规模收窄,可用μP等方法解决。

【Transformer 与注意力机制】36|训练稳定性:损失尖峰、混合精度与梯度爆炸

土法炼钢兴趣小组的博客 土法炼钢兴趣小组的博客 · 2026-08-08T00:00:00Z

Transformer是过去十年最成功的深度学习架构,但其核心限制在于标准attention的O(n²)计算复杂度已被证明是理论下界,无法通过工程优化突破。此外,KV Cache线性增长、自回归串行性、长上下文不等于长期记忆、位置外推失效及数据供给上限等问题,共同构成架构瓶颈。新架构需在质量、成本、稳定性、生态四条战线同时超越Transformer,才能实现替代。

【Transformer 与注意力机制】55|Transformer 的根本局限:为什么 O(n²) 是终极瓶颈

土法炼钢兴趣小组的博客 土法炼钢兴趣小组的博客 · 2026-08-08T00:00:00Z

本文介绍状态空间模型(SSM)如何通过固定大小状态压缩历史,解决Transformer长序列瓶颈。S4用HiPPO矩阵实现长程记忆,Mamba引入选择性机制按内容更新状态,并用并行扫描保持训练效率。推理时SSM显存O(1)优于KV Cache,但在精确检索任务上受容量限制。SSD揭示SSM与注意力对偶,混合架构如Jamba平衡两者优势。

【Transformer 与注意力机制】56|状态空间模型:Mamba、S4 的线性复杂度路径

土法炼钢兴趣小组的博客 土法炼钢兴趣小组的博客 · 2026-08-08T00:00:00Z

Transformer 将进化为混合架构,结合注意力机制、长程状态和外部记忆等模块,以更高效地处理信息并支持多模态输入。硬件发展将影响架构设计,评估方式将变得复杂,强调系统协作和可控性。理解 Transformer 的成功在于其抽象层次和应对未来挑战的能力。

【Transformer 与注意力机制】58|后 Transformer 时代:架构会消失还是会进化

土法炼钢兴趣小组的博客 土法炼钢兴趣小组的博客 · 2026-08-08T00:00:00Z

KV Cache 是自回归推理中缓存历史 token 的 Key 和 Value,避免重复计算前缀。它利用历史 K/V 不变性,将重复计算转为显存占用,成为长上下文推理的核心瓶颈。推理分 prefill 和 decode 两阶段,KV Cache 内存随层数、序列长度和 batch 线性增长。GQA、PagedAttention 和量化等技术用于优化 cache 管理,平衡性能与资源。

【Transformer 与注意力机制】49|KV Cache:推理为什么是 O(n) 不是 O(n²)

土法炼钢兴趣小组的博客 土法炼钢兴趣小组的博客 · 2026-08-08T00:00:00Z

本文探讨了大语言模型在推理阶段的退化现象,如死循环和乱码等问题。退化源于自回归Transformer的注意力机制和数值精度,导致输出失控。文章分析了退化的数学根源、表现形式及其机制,并提出了多层防御策略,包括架构设计、数值工程和解码策略,以提高模型在生产环境中的稳定性。

【Transformer 与注意力机制】59|推理退化:乱码、死循环与无意义文本为何不是同一种 bug

土法炼钢兴趣小组的博客 土法炼钢兴趣小组的博客 · 2026-08-08T00:00:00Z

本文综述了线性注意力、RWKV和RetNet三种将Transformer复杂度从O(n²)降至O(n)的路径。它们用固定状态替代完整注意力,但存在表达力短板:关联检索任务需更大维度或数据依赖门控。理论复杂度不等于实际吞吐,需I/O感知kernel优化。这些模型各有取舍,混合架构或更接近实用。

【Transformer 与注意力机制】57|RWKV / RetNet / 线性注意力:各种降低复杂度的探索

土法炼钢兴趣小组的博客 土法炼钢兴趣小组的博客 · 2026-08-08T00:00:00Z

FlashAttention是一种IO感知的精确注意力算法,通过分块和在线softmax避免物化完整注意力矩阵,减少HBM读写,提升效率并降低显存占用,虽FLOPs仍为O(n²),但优化了硬件执行路径,使长序列训练更可行。

【Transformer 与注意力机制】42|FlashAttention:注意力计算的硬件级重写

土法炼钢兴趣小组的博客 土法炼钢兴趣小组的博客 · 2026-08-08T00:00:00Z

本文介绍RLHF及其变体DPO、GRPO,旨在解决SFT无法表达相对偏好的问题。SFT仅最大化单一参考答案似然,无法区分多个合理回答的优劣。RLHF通过奖励模型和KL约束优化策略,但存在奖励过优化、对齐税等风险。DPO省去显式奖励模型和在线采样,GRPO在可验证奖励场景下省去critic。三者各有适用场景,对齐税是工程问题也是结构性风险。

【Transformer 与注意力机制】33|RLHF:从 PPO 到 DPO,再到 GRPO

土法炼钢兴趣小组的博客 土法炼钢兴趣小组的博客 · 2026-08-08T00:00:00Z

本文分析BERT、GPT、T5三种架构的根本差异在于注意力掩码决定的“可见性图”,此图训练后不可变。Decoder-only虽在通用生成上占优,但并非表示能力更强,而是统一了训练与推理管线。推理系统如KV Cache等默认单流因果结构,Encoder-Decoder需额外处理。在分类、检索等任务上,Encoder模型仍更高效,生成式方案并非万能。

【Transformer 与注意力机制】40|三大路线之争:为什么大模型几乎都是 Decoder-only

土法炼钢兴趣小组的博客 土法炼钢兴趣小组的博客 · 2026-08-06T00:00:00Z
  • <<
  • <
  • 1 (current)
  • 2
  • 3
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
友情链接: MOGE.AI 九胧科技 1tok 菜鸟教程 Remio.AI DeekSeek连连 53AI 神龙海外代理IP IPIPGO全球代理IP 东波哥的博客 匡优考试在线考试系统 开源服务指南 蓝莺IM Solo 独立开发者社区 AI酷站导航 极客Fun 我爱水煮鱼 周报生成器 He3.app 简单简历 白鲸出海 T沙龙 职友集 TechParty 蟒周刊 Best AI Music Generator 模力方舟 Gitee AI

小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码