小红花·文摘
  • 首页
  • AI Tokens🪙
  • 排行榜🏆
  • 直播
  • FAQ
大模型能“原地”改参数了!字节Seed&北大新论文:测试时推理无需加层重训练

字节Seed与北大合作提出“原地测试时训练”(In-Place TTT),使大模型在推理时无需重训练即可更新参数,从而提高计算效率和适应能力,尤其在长文本任务中效果显著。

大模型能“原地”改参数了!字节Seed&北大新论文:测试时推理无需加层重训练

量子位 量子位 · 2026-04-10T06:12:47Z

本研究提出SpeCache方法,解决大语言模型在长文本任务中因序列长度增加导致的键值缓存需求线性增长问题。该方法通过扩展CPU内存卸载KV缓存,动态获取重要KV对,减少CPU-GPU通信延迟,有效降低VRAM使用,避免信息遗忘。实验表明,该方法在长序列上实现了10倍的KV缓存压缩,无需重新训练。

SpeCache: Speculative Key-Value Caching for Efficient Generation of Large Language Models

BriefGPT - AI 论文速递 BriefGPT - AI 论文速递 · 2025-03-20T00:00:00Z
概述:"InfiniRetri:通过基于注意力的检索增强大型语言模型的无限长度上下文能力"

本文介绍了InfiniRetri,一种新颖的无训练方法,利用大型语言模型的注意力机制,实现理论上无限长度输入的准确检索。该方法通过分析注意力分布与生成答案的关系,显著提升了长文本任务的表现,尤其在问答中表现优异。在Needle-In-a-Haystack测试中实现了100%准确率,并在LongBench等基准测试中显示出显著改进。

概述:"InfiniRetri:通过基于注意力的检索增强大型语言模型的无限长度上下文能力"

DEV Community DEV Community · 2025-03-06T22:23:12Z
Qwen2.5-1M: 支持100万Token上下文的开源Qwen模型

Qwen2.5-1M模型正式发布,支持1M上下文长度,包含两个新开源模型。推理框架速度提升3-7倍,长文本任务表现优于128K版本,短文本任务性能保持稳定。模型采用稀疏注意力和长度外推技术,优化推理效率,未来将继续提升性能和应用范围。

Qwen2.5-1M: 支持100万Token上下文的开源Qwen模型

Blog on Qwen Blog on Qwen · 2025-01-26T16:00:03Z

Sakana AI推出了一种新型记忆系统——神经注意力记忆模型(NAMMs),旨在优化变换器的信息存储与检索。NAMMs通过进化算法选择保留或丢弃重要信息,显著提高了长文本任务的效率与性能。测试结果显示,NAMMs在多个基准上表现优异,减少了内存使用,并超越了传统记忆策略。

进化型通用变换器记忆

Mia Heidenstedt Mia Heidenstedt · 2024-12-17T10:51:53Z

该研究提出了一种新型Transformer模型,通过注意力层和可学习的记忆令牌显著提升了模型在新任务上的适应性和性能。引入反馈循环和优化内存操作后,模型在处理长文本任务时表现优异,展现了处理无限长序列的潜力。同时,研究探讨了模型大小与性能之间的关系,并提出了基于Hopfield网络的理论框架,揭示了Transformer的记忆过程。

演化通用变压器记忆

BriefGPT - AI 论文速递 BriefGPT - AI 论文速递 · 2024-10-17T00:00:00Z
  • <<
  • <
  • 1 (current)
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码