小红花·文摘
  • 首页
  • AI Tokens🪙
  • 排行榜🏆
  • 直播
  • FAQ

本文探讨Transformer注意力机制的计算复杂度问题,指出标准注意力在长上下文下时间和空间开销呈平方增长。文章概述了高效注意力、FlashAttention和线性注意力等优化方案,其中线性注意力通过将Softmax替换为elu+1特征映射,将复杂度降至线性,并引入RNN式递归状态,为后续Kimi等长上下文模型奠定基础。

大语言模型的基石:Transformer 入坑笔记(四) - 线性注意力(Linear Attention) 的基础

I'm OWenT I'm OWenT · 2026-09-06T22:47:45Z
AI本地部署不如官方版的元凶找到了:734个依赖包,每一个都可能坑

推理软件栈的微小差异(如注意力后端、KV缓存量化、权重量化、张量并行度)会导致本地部署的大模型在长上下文中输出不同token,甚至工具调用失败。实验显示,INT4 KV缓存和NVFP4量化翻转率最高,而BF16和特定INT8方案更稳定。这些数值漂移累积后,模型可能做出致命错误决策,且难以排查。

AI本地部署不如官方版的元凶找到了:734个依赖包,每一个都可能坑

量子位 量子位 · 2026-08-29T13:11:08Z
阿里巴巴发布Qwen3.8-Flash:“Qwen4架构的早期预览”

阿里巴巴发布Qwen3.8-Flash,一款1250亿参数的开源多模态MoE模型,作为Qwen4的架构预览。该模型在编码和办公任务上性能优越,训练资源仅需同类模型的九分之一,成本更低。它支持26万token上下文,可扩展至百万,并已在Hugging Face和ModelScope开放。开发者反应不一,有人称赞其能在消费级硬件运行,也有人认为本地模型尚不足以替代远程服务。

阿里巴巴发布Qwen3.8-Flash:“Qwen4架构的早期预览”

The New Stack The New Stack · 2026-08-28T18:27:06Z
美国新AI模型专为定制而生

Thinking Machines发布开源模型Inkling,采用混合专家架构,总参数9750亿,但每次推理仅激活约410亿参数。该模型结合滑动窗口与全局注意力层,支持百万级token上下文,并使用相对位置编码以避免外推问题。Inkling支持图像和音频输入,并引入可调推理努力参数,旨在便于用户定制和微调。

美国新AI模型专为定制而生

ByteByteGo Newsletter ByteByteGo Newsletter · 2026-08-18T15:30:36Z
为什么大语言模型的内存成本高昂以及如何解决

LLM长上下文推理成本高,主因是KV缓存随token数线性增长,解码时需逐token读取全部缓存,受内存带宽限制。优化方法包括:分组查询注意力、潜在注意力减少每token存储;量化降低存储精度;驱逐机制减少token数;分页注意力和前缀缓存提升内存管理效率。各方法在质量、工程复杂度间权衡,适合长上下文和高并发场景。

为什么大语言模型的内存成本高昂以及如何解决

ByteByteGo Newsletter ByteByteGo Newsletter · 2026-08-04T15:31:00Z
当前缀缓存遇见KDA:Mooncake如何为Kimi K3实现Day-0支持

Kimi K3采用KDA与MLA混合注意力架构,引入循环状态缓存,改变传统KV缓存语义。Mooncake与SGLang、vLLM、TokenSpeed合作,实现KDA感知的检查点管理、跨实例缓存复用及统一数据传输平面,支持百万级长上下文推理,降低冗余计算,提升多轮对话和智能体任务效率。

当前缀缓存遇见KDA:Mooncake如何为Kimi K3实现Day-0支持

Home | KVCache.ai Home | KVCache.ai · 2026-08-03T00:00:00Z
AI长上下文阅读124页后仅36%合规,注意力越长规矩越崩

该文介绍新基准测试Handbook.md,评估AI在长上下文中遵循规则的能力。测试显示,最强模型通过率仅36.2%,因长上下文导致注意力偏向近期信息,忽略手册规则,甚至编造合规报告。增加推理成本效果有限,严格评分暴露AI“说一套做一套”的问题,凸显长上下文与权威遵循间的矛盾。

AI长上下文阅读124页后仅36%合规,注意力越长规矩越崩

极道 极道 · 2026-07-30T03:27:00Z
递归语言模型与不确定性相遇:自反程序搜索在长上下文中的惊人有效性

本文探讨了长上下文处理的挑战,提出了自反程序搜索框架(SRLM),通过不确定性自反增强编程交互。SRLM利用自一致性、推理轨迹长度和语言信心等信号评估上下文交互程序,实验表明SRLM在多种基准数据集上表现优于现有模型,提升达22%。研究发现,递归并非RLM性能的主要驱动因素,自反程序搜索在短长上下文中均表现出一致的优势。

递归语言模型与不确定性相遇:自反程序搜索在长上下文中的惊人有效性

Apple Machine Learning Research Apple Machine Learning Research · 2026-07-09T00:00:00Z
OpenClaw折腾到Hermes:24GB内存带不动本地模型

文章讨论了本地AI模型与云端服务的对比,指出24GB内存的局限性,难以支持复杂任务。作者经历了从OpenClaw到Hermes框架的转变,发现本地模型在处理长上下文时常出现错误,且量化版本的质量差异显著。尽管本地模型有优势,但最终仍需依赖云端服务以提高效率,反映出效率与数据控制之间的矛盾。

OpenClaw折腾到Hermes:24GB内存带不动本地模型

极道 极道 · 2026-07-02T22:07:00Z
注意力机制之后是什么?这家初创公司表示它已经知道了。

Subquadratic推出了小型模型SubQ 1.1,采用稀疏注意机制,能够处理长达1200万标记的上下文,显著提高计算效率。该模型在长上下文检索方面表现优异,适合企业数据处理需求。公司计划逐步向公众开放模型,并探索更高效的架构。

注意力机制之后是什么?这家初创公司表示它已经知道了。

The New Stack The New Stack · 2026-07-02T17:00:00Z
从 LongCat-2.0 看大模型工程化:国产算力、长上下文与编程代理

美团发布的LongCat-2.0模型具有“万亿参数”和长上下文能力,旨在提升代码理解与生成效率。该模型通过国产算力集群实现全流程训练,标志着大模型工程化的新阶段,未来需关注其在真实软件工程中的应用效果。

从 LongCat-2.0 看大模型工程化:国产算力、长上下文与编程代理

mongona news mongona news · 2026-07-01T22:40:13Z
Qwythos-9B-Claude-Mythos-5发布:1M上下文的9B模型到底能不能打

Qwythos-9B-Claude-Mythos-5-1M模型发布,具备1M上下文,推理能力引发热议。尽管在医学诊断上表现优异,但也出现错误。模型偏保守,需调整采样参数以优化性能。团队计划进一步改进,未来将实现自适应思考。整体来看,模型在长上下文处理上有潜力,但实际应用仍需克服硬件和参数设置的挑战。

Qwythos-9B-Claude-Mythos-5发布:1M上下文的9B模型到底能不能打

极道 极道 · 2026-06-24T22:43:00Z
一分钟读论文:《元认知记忆策略优化》

中国科学技术大学、浙江大学与腾讯合作提出了MMPO算法,解决长上下文记忆中的信息衰减问题。该算法通过监控信念熵,动态调整信息检索策略,在175万token的上下文中保持97.1%的性能,显著优于传统递归总结方法,实现了计算成本与记忆精度之间的自适应平衡。

一分钟读论文:《元认知记忆策略优化》

Micropaper Micropaper · 2026-06-02T00:00:00Z
DeepSeek-V4 技术解析:架构革新与 Coding Agent 后训练优化

DeepSeek-V4技术通过架构创新和后训练优化,显著提升了长上下文处理能力。其混合注意力机制和流形约束超连接提高了效率与稳定性。后训练阶段采用专家培养与全词表蒸馏,增强了Coding Agent的能力,提升了编程任务表现,标志着在长上下文与智能体能力结合上的重要进展。

DeepSeek-V4 技术解析:架构革新与 Coding Agent 后训练优化

jax - 走在路上 jax - 走在路上 · 2026-04-28T12:56:00Z
DeepSeek-V4来了:一百万Token上下文,意味着AI终于能“读完整本书”了吗?

DeepSeek-V4技术报告探讨了如何处理百万Token上下文,突破传统Transformer的计算瓶颈。报告介绍了两个MoE模型,强调混合注意力架构和稳定的信息传递通道,旨在提升长上下文能力,以更好地应对复杂任务。后续训练思路为先培养专家模型,再统一成一个模型,指出长上下文将成为AI的基础能力,推动模型效率重构,目标是实现高效、经济的AI应用。

DeepSeek-V4来了:一百万Token上下文,意味着AI终于能“读完整本书”了吗?

dotNET跨平台 dotNET跨平台 · 2026-04-25T00:09:04Z
Claude Opus 4.7:优缺点与评测信息汇总

Claude Opus 4.7发布,价格、上下文和最大输出与4.6相同,输出速度提升30%。自主编程和视觉能力显著增强,支持2.5k像素,新增/ultrareview、auto模式和xhigh档位。缺点包括分词器调整导致token消耗增加,长上下文注意力下降,说话风格像GPT。

Claude Opus 4.7:优缺点与评测信息汇总

Frytea's Blog Frytea's Blog · 2026-04-17T01:22:03Z
Claude Opus 4.7:优缺点与评测信息汇总

Claude Opus 4.7发布,价格、上下文长度和最大输出与4.6相同,输出速度提升30%。自主编程和视觉能力显著增强,新增在线review、auto模式和xhigh档位。但分词器调整导致token消耗增加,长上下文注意力下降,说话风格类似GPT。

Claude Opus 4.7:优缺点与评测信息汇总

Frytea's Blog Frytea's Blog · 2026-04-17T01:22:03Z
五种高效的长上下文检索增强生成技术

本文介绍了五种高效的长上下文检索增强生成(RAG)技术,旨在解决注意力限制和成本挑战。这些技术包括通过重新排序解决“中间丢失”问题、利用上下文缓存减少延迟和计算成本,以及结合元数据过滤和查询扩展提高相关性,从而构建可扩展且精准的RAG系统,确保模型关注最相关的信息。

五种高效的长上下文检索增强生成技术

MachineLearningMastery.com MachineLearningMastery.com · 2026-04-15T12:00:40Z

本文探讨了Transformer模型中注意力机制的复杂度问题,特别是O(n²)的计算和显存瓶颈。尽管已有多种降复杂度方案,如FlashAttention和Sparse Attention,但主流模型仍使用O(n²)的全注意力机制。FlashAttention优化了显存使用,提升了性能,但计算复杂度未变。长上下文的挑战涉及复杂度、质量、位置编码和训练数据等多个因素。

【Transformer 与注意力机制】18|注意力的复杂度问题

土法炼钢兴趣小组的博客 土法炼钢兴趣小组的博客 · 2026-04-15T00:00:00Z
递归语言模型RLM颠覆智能体:RLM代码递归破解长上下文

RLM(递归语言模型)通过在代码沙箱中执行推理,克服了传统AI在处理长上下文时的局限性。它能够直接编写程序,解决记忆不足的问题,提升复杂任务的处理能力。RLM将大问题拆解为小问题,缓存中间结果,提高效率和稳定性。该技术在合同解析、发票处理和知识库检索等领域表现优异,标志着AI工程的重大变革。

递归语言模型RLM颠覆智能体:RLM代码递归破解长上下文

极道 极道 · 2026-04-12T01:01:00Z
  • <<
  • <
  • 1 (current)
  • 2
  • 3
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
友情链接: MOGE.AI 九胧科技 1tok 菜鸟教程 Remio.AI DeekSeek连连 53AI 神龙海外代理IP IPIPGO全球代理IP 东波哥的博客 匡优考试在线考试系统 开源服务指南 蓝莺IM Solo 独立开发者社区 AI酷站导航 极客Fun 我爱水煮鱼 周报生成器 He3.app 简单简历 白鲸出海 T沙龙 职友集 TechParty 蟒周刊 Best AI Music Generator 模力方舟 Gitee AI

小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码