小红花·文摘
  • 首页
  • AI Tokens🪙
  • 排行榜🏆
  • 直播
  • FAQ

在文章《LogSumExp和Softmax的泰勒展开》中,我们介绍了LogSumExp和Softmax的近似展开,并由此得到了一种线性化Softmax Attention的简单方案。但在那篇文章...

将Softmax Attention线性化为Gated DeltaNet

科学空间|Scientific Spaces 科学空间|Scientific Spaces · 2026-07-21T13:21:00Z

最近看到论文《The Key to Going Linear: Analysis-Driven Transformer Linearization》里边直接对Softmax做近似展开来线性化At...

LogSumExp和Softmax的泰勒展开

科学空间|Scientific Spaces 科学空间|Scientific Spaces · 2026-07-13T03:04:00Z

本文讨论了softmax和LayerNorm等内存绑定算子的优化方法。softmax通过减去最大值来避免数值溢出,在线softmax则通过增量维护最大值和总和来减少遍数。LayerNorm采用Welford算法进行单遍均值和方差计算。逐元素融合技术将多个操作合并为一个kernel,显著减少访存次数,提高性能。整体优化策略强调数值稳定性和减少访存。

【GPU 算子工程】Softmax、LayerNorm 与逐元素融合

土法炼钢兴趣小组的博客 土法炼钢兴趣小组的博客 · 2026-06-28T00:00:00Z

FlashAttention通过分块在线softmax优化Transformer的注意力机制,显著降低显存和计算速度瓶颈。它采用流式计算,避免物化整个分数矩阵,减少内存访问,提高效率。实测表明,FlashAttention在长序列处理上具有显著优势,并在反向传播时通过重算降低显存需求。

【GPU 算子工程】FlashAttention:在线 softmax 与 IO-aware 注意力

土法炼钢兴趣小组的博客 土法炼钢兴趣小组的博客 · 2026-06-28T00:00:00Z

本文探讨了softmax函数在深度学习中的重要性及其数学原理。softmax用于分类模型的输出层和注意力机制,将任意实数向量转换为合法的概率分布,具有平移不变性和可微性。通过指数变换,softmax确保相对分数的差异决定概率比例。文章还讨论了softmax的数值稳定性、温度调节及其与交叉熵的结合,强调了其在模型训练和推理中的应用。

【Transformer 与注意力机制】07 Softmax 与概率分布:从分数到选择的桥

土法炼钢兴趣小组的博客 土法炼钢兴趣小组的博客 · 2026-04-15T00:00:00Z

本文探讨了在Transformer模型中将点积结果除以√d_k的原因。这一操作旨在避免softmax函数饱和,确保梯度有效传播。通过数学推导,证明了点积的方差为d_k,缩放后方差归一化为1,从而保持训练的稳定性。文章还讨论了不同维度下的训练效果及现代优化器如何与√d_k的设计结合,以提升模型性能。

15|Scaled Dot-Product:那个根号 d_k 是怎么来的

土法炼钢兴趣小组的博客 土法炼钢兴趣小组的博客 · 2026-04-15T00:00:00Z

本文探讨了注意力机制的原理,强调其源于认知心理学与神经科学。注意力是处理信息的方式,涉及动态分配权重。人类的注意力是“软”的,允许同时关注多个信息。机器翻译中的对齐问题促使了软对齐的出现,注意力机制通过加权平均实现信息提取。softmax是实现可微选择的关键,注意力机制广泛应用于多个领域,而非仅限于Transformer。

【Transformer 与注意力机制】11|「注意力」的直觉

土法炼钢兴趣小组的博客 土法炼钢兴趣小组的博客 · 2026-04-15T00:00:00Z

本文深入探讨了Transformer模型中的查询(Q)、键(K)、值(V)机制。Q、K、V的分离设计使模型能够独立优化索引和内容,从而提升表达能力。通过softmax函数,模型实现了基于相似度的加权检索,促进信息的有效融合。文章还分析了Q/K/V的几何意义及其在自注意力中的应用,强调了缩放因子√d_k的重要性,以避免softmax饱和。

【Transformer 与注意力机制】13|Q/K/V 三件套:把 Bahdanau 抽象成一个公式

土法炼钢兴趣小组的博客 土法炼钢兴趣小组的博客 · 2026-04-15T00:00:00Z

本文详细解析了Softmax损失的数学推导,重点在于线性分类器的梯度计算。通过前向传播和反向传播,推导出损失对logits、权重和偏置的梯度,并利用链式法则简化矩阵运算,帮助理解分类网络如何从错误中学习。

揭开Softmax损失的神秘面纱:线性分类器的逐步推导

Louis Aeilot's Blog Louis Aeilot's Blog · 2026-03-28T23:45:09Z
CS231n 讲义 II:线性分类器

KNN算法存在缺陷,需要更强大的方法。新方法使用评分函数将图像像素映射为类别分数,并通过损失函数量化预测分数与真实标签的差异。我们采用多类支持向量机(SVM)损失,结合正则化,优化模型以提高泛化能力。Softmax分类器将分数视为未归一化的对数概率,并使用交叉熵损失进行优化。

CS231n 讲义 II:线性分类器

Louis Aeilot's Blog Louis Aeilot's Blog · 2026-02-11T00:45:09Z
大型语言模型如何选择词汇:Logits、Softmax与采样的实用指南

本文探讨了大型语言模型(LLMs)在相同提示下生成多样化和创造性输出的机制,分析了采样策略及温度、top-k、top-p等参数对输出一致性和创造性的影响。通过实例,读者将掌握如何调整LLM的输出特性。

大型语言模型如何选择词汇:Logits、Softmax与采样的实用指南

MachineLearningMastery.com MachineLearningMastery.com · 2025-12-13T19:25:32Z
如果今天这篇注意力机制的帖子看不懂的话,就...可以重读大一了

Softmax通过两步将分数转化为概率分布:首先取指数以确保分数为正,然后进行归一化以得到权重。转置操作QKᵀ确保查询和键的相似度计算顺利进行。

如果今天这篇注意力机制的帖子看不懂的话,就...可以重读大一了

dotNET跨平台 dotNET跨平台 · 2025-10-28T04:44:08Z

在线安全softmax是一种高效且数值稳定的算法,用于计算softmax函数。它通过同时计算输入流的最大值和归一化器,减少内存读取,提高性能,适用于多种下游算法。

在线安全Softmax

Lei Mao's Log Book Lei Mao's Log Book · 2025-06-23T07:00:00Z

本研究提出了FLASH-D,一种改进的变换器注意力机制,通过将Softmax计算与矩阵运算结合,显著提高了计算效率,降低了硬件面积和功耗,具有实际应用潜力。

FLASH-D: FlashAttention with Implicit Softmax Division

BriefGPT - AI 论文速递 BriefGPT - AI 论文速递 · 2025-05-20T00:00:00Z

本研究提出RADLADS协议,快速将softmax注意力变换器转换为线性注意力解码器,解决传统模型效率不足的问题。该方法使用350-700M个token,保持推理质量,实现显著的成本效益,并在标准基准测试中表现优异。

RADLADS:针对大规模线性注意力解码器的快速注意力蒸馏

BriefGPT - AI 论文速递 BriefGPT - AI 论文速递 · 2025-05-05T00:00:00Z
理解神经网络中的Softmax和交叉熵

神经网络通过Softmax函数将预测分数转换为概率,交叉熵损失用于评估预测与真实标签的差距。这两者是深度学习分类模型的基础,帮助模型进行学习和调整。

理解神经网络中的Softmax和交叉熵

DEV Community DEV Community · 2025-04-25T16:56:17Z

本研究探讨了自注意力模型在序列映射中的普适逼近性,证明了两层自注意力和一层自注意力后接softmax函数能够逼近任意连续函数。

Softmax Attention's Universal Approximation Property

BriefGPT - AI 论文速递 BriefGPT - AI 论文速递 · 2025-04-22T00:00:00Z

本研究针对传统Transformer模型在长上下文语言建模中性能不足的问题,提出了一种新颖的“遗忘注意力”机制,通过数据依赖的方式对未归一化的注意力得分进行下调,从而构建“遗忘变压器”(FoX)。研究发现,FoX在长上下文任务上优于传统Transformer,并在不需要位置信息的情况下,兼容FlashAttention算法,显著提升了模型在短上下文下游任务的表现。

遗忘变压器:带遗忘门的Softmax注意力

BriefGPT - AI 论文速递 BriefGPT - AI 论文速递 · 2025-03-03T00:00:00Z

本研究提出了AdaSplash方法,旨在解决变压器模型中softmax注意力机制在长上下文任务中的计算成本问题,通过结合GPU优化和自适应稀疏性,显著提高了运行时间和内存效率。

AdaSplash: Adaptive Sparse Flash Attention

BriefGPT - AI 论文速递 BriefGPT - AI 论文速递 · 2025-02-17T00:00:00Z

本研究分析了大语言模型中的异常值问题,定义并分类了三种异常值,探讨其与注意力机制的关系。研究发现,异常值由softmax操作引起,作为上下文感知缩放因子,消除异常值可加速收敛并改善模型压缩。

大语言模型中的系统异常值

BriefGPT - AI 论文速递 BriefGPT - AI 论文速递 · 2025-02-10T00:00:00Z
  • <<
  • <
  • 1 (current)
  • 2
  • 3
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码