小红花·文摘
  • 首页
  • AI Tokens🪙
  • 排行榜🏆
  • 直播
  • FAQ
GPT-6带火循环Transformer,阿里早已布局

阿里团队针对循环Transformer的计算冗余问题,提出两篇论文:MeSH通过动态记忆缓冲和路由器解决循环空转,提升零样本准确率;SpiralFormer通过多分辨率序列压缩,实现从全局到局部的计算,降低计算量并提升性能。两篇论文分别被ICLR和EMNLP接收,为高效大模型提供新思路。

GPT-6带火循环Transformer,阿里早已布局

量子位 量子位 · 2026-09-05T15:07:08Z
开创现代AI的论文:Transformer背后的故事

2017年论文《Attention Is All You Need》提出Transformer架构,取代RNN,解决上下文丢失和训练慢的问题,实现并行处理,奠定现代生成式AI基础,并催生OpenAI等公司。

开创现代AI的论文:Transformer背后的故事

freeCodeCamp.org freeCodeCamp.org · 2026-08-27T13:46:14Z
Transformer架构:8年前Google发了篇标题很狂的论文,今天所有AI都跑在它上面 - 编程一生

该论文提出Transformer架构,以“圆桌会议”式注意力机制取代RNN的排队传话,实现并行处理,成为现代AI基础。它通过Q/K/V机制理解词义,多头注意力和位置编码增强效果。实战中,上下文计算量平方增长,重要信息应放开头或结尾,提示词缓存可降成本,RAG能补充模型知识。

Transformer架构:8年前Google发了篇标题很狂的论文,今天所有AI都跑在它上面 - 编程一生

编程一生 编程一生 · 2026-08-27T05:23:00Z
中国模型Engram/N-Gram记忆体引爆AI新竞赛

DeepSeek与阿里通义推出Engram/N-Gram记忆模块,为Transformer增加“记忆硬盘”,将固定知识查找从计算中分离,提升推理效率。实验显示性能提升,但社区测试发现其擅长短语补全而非事实回忆,且DeepSeek V4未采用Engram。该技术尚处探索阶段,可能改变AI竞赛格局。

中国模型Engram/N-Gram记忆体引爆AI新竞赛

极道 极道 · 2026-08-26T23:30:00Z
面向中学生的AI通识

本文面向初中生介绍人工智能基础知识,从哲学起源讲起,经图灵与计算机科学奠基,至1956年达特茅斯会议确立AI概念。重点阐述连接学派发展:万能近似定理、神经网络历经寒冬与复兴,最终Transformer架构实现并行训练,催生GPT等大模型,并迈向能调用工具的智能体生态。

面向中学生的AI通识

挖坑不填兽 挖坑不填兽 · 2026-08-19T16:00:00Z
终于!世界模型进入“有声时代”:24FPS画面+48kHz立体声实时生成

HelixWorld 1.0是Noiz AI联合多机构发布的实时可交互音视频世界模型,支持24 FPS画面与48kHz双声道音频同步生成。它通过原生Transformer架构统一生成声画,并采用因果化、KV Cache等技术实现实时响应。团队计划数周内完全开源模型权重和代码,旨在推动世界模型生态发展。

终于!世界模型进入“有声时代”:24FPS画面+48kHz立体声实时生成

量子位 量子位 · 2026-08-17T07:39:56Z
128K长上下文+智能体强化训练!LFM2.5-2.6B解锁端侧大模型高效部署;DETR用Transformer斩断NMS与Anchor,重塑目标检测

LFM2.5-2.6B是面向端侧部署的轻量级AI推理模型,支持128K长上下文和智能体工具调用,性能可与大4倍参数模型竞争。在Apple M5 Max上推理速度达220 tok/s,AMD Ryzen CPU上113 tok/s,内存占用低于2.5GB,平衡了轻量化与高性能。HyperAI官网已上线该模型,并提供相关数据集、教程和百科词条更新。

128K长上下文+智能体强化训练!LFM2.5-2.6B解锁端侧大模型高效部署;DETR用Transformer斩断NMS与Anchor,重塑目标检测

HyperAI超神经 HyperAI超神经 · 2026-08-15T08:16:23Z

本文深入剖析BERT架构的机制与证据:MLM的80/10/10掩码策略在微调与特征提取场景影响不同;NSP被RoBERTa质疑的证据链复杂,其必要性取决于输入打包方式;BERT作为马尔可夫随机场可用吉布斯采样生成文本,但代价高昂;后续如ModernBERT等仍在升级Encoder-only路线,因其在分类、检索等任务上仍有成本优势。

【Transformer 与注意力机制】37|BERT:MLM、NSP 与 Encoder-only 路线的代价

土法炼钢兴趣小组的博客 土法炼钢兴趣小组的博客 · 2026-08-08T00:00:00Z

本文探讨了大语言模型在推理阶段的退化现象,如死循环和乱码等问题。退化源于自回归Transformer的注意力机制和数值精度,导致输出失控。文章分析了退化的数学根源、表现形式及其机制,并提出了多层防御策略,包括架构设计、数值工程和解码策略,以提高模型在生产环境中的稳定性。

【Transformer 与注意力机制】59|推理退化:乱码、死循环与无意义文本为何不是同一种 bug

土法炼钢兴趣小组的博客 土法炼钢兴趣小组的博客 · 2026-08-08T00:00:00Z

大模型训练不稳定是常见问题,表现为loss尖峰、发散或NaN。关键预警信号是梯度范数异常,而非loss本身。常用修复手段各有针对:warmup解决Adam早期方差,Pre-LN保持恒等映射,BF16扩大数值范围,梯度裁剪仅作保险丝。loss spike根因包括数值、优化和数据问题。小模型稳定超参放大后失效,因学习率安全窗口随规模收窄,可用μP等方法解决。

【Transformer 与注意力机制】36|训练稳定性:损失尖峰、混合精度与梯度爆炸

土法炼钢兴趣小组的博客 土法炼钢兴趣小组的博客 · 2026-08-08T00:00:00Z

Transformer是过去十年最成功的深度学习架构,但其核心限制在于标准attention的O(n²)计算复杂度已被证明是理论下界,无法通过工程优化突破。此外,KV Cache线性增长、自回归串行性、长上下文不等于长期记忆、位置外推失效及数据供给上限等问题,共同构成架构瓶颈。新架构需在质量、成本、稳定性、生态四条战线同时超越Transformer,才能实现替代。

【Transformer 与注意力机制】55|Transformer 的根本局限:为什么 O(n²) 是终极瓶颈

土法炼钢兴趣小组的博客 土法炼钢兴趣小组的博客 · 2026-08-08T00:00:00Z

本文回顾GPT系列发展:GPT-1确立Decoder-only预训练,GPT-2展现zero-shot潜力,GPT-3引入上下文学习,InstructGPT通过RLHF实现指令对齐,ChatGPT以对话形态普及,GPT-4迈向多模态。Decoder-only因训练简单、接口通用、扩展清晰而胜出,但存在推理延迟、长上下文成本、幻觉和对齐代价。

【Transformer 与注意力机制】38|GPT 系列:从续写到助手,每一代到底改变了什么

土法炼钢兴趣小组的博客 土法炼钢兴趣小组的博客 · 2026-08-08T00:00:00Z

Transformer 将进化为混合架构,结合注意力机制、长程状态和外部记忆等模块,以更高效地处理信息并支持多模态输入。硬件发展将影响架构设计,评估方式将变得复杂,强调系统协作和可控性。理解 Transformer 的成功在于其抽象层次和应对未来挑战的能力。

【Transformer 与注意力机制】58|后 Transformer 时代:架构会消失还是会进化

土法炼钢兴趣小组的博客 土法炼钢兴趣小组的博客 · 2026-08-08T00:00:00Z

FlashAttention是一种IO感知的精确注意力算法,通过分块和在线softmax避免物化完整注意力矩阵,减少HBM读写,提升效率并降低显存占用,虽FLOPs仍为O(n²),但优化了硬件执行路径,使长序列训练更可行。

【Transformer 与注意力机制】42|FlashAttention:注意力计算的硬件级重写

土法炼钢兴趣小组的博客 土法炼钢兴趣小组的博客 · 2026-08-08T00:00:00Z

本文介绍状态空间模型(SSM)如何通过固定大小状态压缩历史,解决Transformer长序列瓶颈。S4用HiPPO矩阵实现长程记忆,Mamba引入选择性机制按内容更新状态,并用并行扫描保持训练效率。推理时SSM显存O(1)优于KV Cache,但在精确检索任务上受容量限制。SSD揭示SSM与注意力对偶,混合架构如Jamba平衡两者优势。

【Transformer 与注意力机制】56|状态空间模型:Mamba、S4 的线性复杂度路径

土法炼钢兴趣小组的博客 土法炼钢兴趣小组的博客 · 2026-08-08T00:00:00Z

KV Cache 是自回归推理中缓存历史 token 的 Key 和 Value,避免重复计算前缀。它利用历史 K/V 不变性,将重复计算转为显存占用,成为长上下文推理的核心瓶颈。推理分 prefill 和 decode 两阶段,KV Cache 内存随层数、序列长度和 batch 线性增长。GQA、PagedAttention 和量化等技术用于优化 cache 管理,平衡性能与资源。

【Transformer 与注意力机制】49|KV Cache:推理为什么是 O(n) 不是 O(n²)

土法炼钢兴趣小组的博客 土法炼钢兴趣小组的博客 · 2026-08-08T00:00:00Z

本文介绍RLHF及其变体DPO、GRPO,旨在解决SFT无法表达相对偏好的问题。SFT仅最大化单一参考答案似然,无法区分多个合理回答的优劣。RLHF通过奖励模型和KL约束优化策略,但存在奖励过优化、对齐税等风险。DPO省去显式奖励模型和在线采样,GRPO在可验证奖励场景下省去critic。三者各有适用场景,对齐税是工程问题也是结构性风险。

【Transformer 与注意力机制】33|RLHF:从 PPO 到 DPO,再到 GRPO

土法炼钢兴趣小组的博客 土法炼钢兴趣小组的博客 · 2026-08-08T00:00:00Z

本文综述了线性注意力、RWKV和RetNet三种将Transformer复杂度从O(n²)降至O(n)的路径。它们用固定状态替代完整注意力,但存在表达力短板:关联检索任务需更大维度或数据依赖门控。理论复杂度不等于实际吞吐,需I/O感知kernel优化。这些模型各有取舍,混合架构或更接近实用。

【Transformer 与注意力机制】57|RWKV / RetNet / 线性注意力:各种降低复杂度的探索

土法炼钢兴趣小组的博客 土法炼钢兴趣小组的博客 · 2026-08-08T00:00:00Z

本文探讨大模型训练中算力分配的核心问题:模型参数与训练数据应如何配比。Kaplan 研究建议偏重模型规模,而 Chinchilla 研究通过三种方法证明两者应等比例增长,并指出前者因学习率调度设计缺陷导致结论偏差。文章还讨论了推理成本、数据受限等现实约束对最优配比的影响,以及相关复现争议。

【Transformer 与注意力机制】34|Scaling Laws:Kaplan 与 Chinchilla 之争,以及算力预算怎么分配

土法炼钢兴趣小组的博客 土法炼钢兴趣小组的博客 · 2026-08-08T00:00:00Z

该文探讨大模型“涌现能力”是否真实存在。Wei等人认为能力随规模突现,但Schaeffer等人指出这可能是评测指标非线性或分辨率不足造成的假象。后续研究如PassUntil发现部分任务仍有非线性,而CoT和ICL的机制证据表明,许多现象更可能是接口激发而非新能力产生。结论是需谨慎看待涌现叙事,区分真实规模效应与评测伪影。

【Transformer 与注意力机制】54|涌现能力:规模效应、评测假象与可预测性之争

土法炼钢兴趣小组的博客 土法炼钢兴趣小组的博客 · 2026-08-06T00:00:00Z
  • <<
  • <
  • 1 (current)
  • 2
  • 3
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
友情链接: MOGE.AI 九胧科技 1tok 菜鸟教程 Remio.AI DeekSeek连连 53AI 神龙海外代理IP IPIPGO全球代理IP 东波哥的博客 匡优考试在线考试系统 开源服务指南 蓝莺IM Solo 独立开发者社区 AI酷站导航 极客Fun 我爱水煮鱼 周报生成器 He3.app 简单简历 白鲸出海 T沙龙 职友集 TechParty 蟒周刊 Best AI Music Generator 模力方舟 Gitee AI

小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码