文章介绍了通过两台协同计算优化AI模型,实现稳定70 TPS和382K上下文,并利用DFlash2优化稠密模型达到单流125-133 TPS、8并发231 TPS,通过YaRN技术将上下文扩展至900K。同时对比了n-gram和MTP方案,最终选择MTP实现60 TPS和2232 TPS Prefill,适合日常写代码,并计划继续优化其他模型。
文章实测Qwen 3.8 27B模型通过YaRN技术扩展上下文长度,发现实际可从265K扩展至768K,而非宣传的1M,原因是1M时KV Cache需84GB显存,超出128GB机器可用内存约3GB。作者计划进一步测试768K上下文在实际编程中的表现。
该文章介绍通过YaRN技术将Qwen 3.8 27B模型的上下文长度从786K提升至900K,接近1M,可支持99%的大型代码项目,避免因上下文不足导致的性能下降。模型占用120GB显存,在懒猫AI算力舱上运行速度快且稳定。
阿里开源Qwen3.8-27B模型,270亿参数,支持262K上下文,性能接近闭源旗舰。社区实测在双RTX 3090上达105 tok/s,通过量化、MTP加速等技术实现。模型Apache 2.0协议,48小时下载86万次。但速度受场景、配置影响大,多卡未必更快,且长上下文需量化KV缓存牺牲质量。
OpenAI的GPT-5.6 Sol模型宣称支持百万token上下文,但实际Codex仅提供约25万token,远低于宣传。用户可通过修改配置文件尝试解锁,但可能导致崩溃。官方因成本限制调低默认值,且Luna模型性价比更高。文章揭露了宣传与实际性能的差距。
DeepSeek V4 Pro正式发布,支持1M上下文和384K最大输出,具备思考模式、JSON输出、工具调用及API兼容。价格与旧版持平,每百万Token缓存命中输入0.025元,未命中输入3元,输出6元,并发限制500。Flash版更便宜且并发高,Pro面向高规格任务,强化Agent和编码场景。
本文介绍RoPE与ALiBi两种相对位置编码:RoPE通过旋转矩阵使点积仅依赖相对位置,但高频通道在长距离会绕圈失真,需通过base scaling、YaRN等方法扩展;ALiBi通过线性距离惩罚实现外推稳定,但压制远距离强相关内容。文章还指出有效上下文常短于宣称长度,并讨论相对位置编码在算法推理任务上的局限。
RoboTTT将机器人基础模型的视觉-运动上下文扩展至8K时间步,通过测试时训练更新快速权重,在不增加推理延迟下提升性能。相比单步基线,任务性能提高87%,能完成五分钟十阶段装配任务,并支持一次性模仿和即时策略改进,表明上下文长度是机器人模型的新扩展维度。
开源项目ollama发布v0.17.0版本,增强了OpenClaw的引导流程,改善了集成,用户可通过简单命令启动OpenClaw,ollama负责安装和设置。此外,公开了服务器的默认上下文长度,并进行了其他改进。
在有限显存下,运行大型语言模型需平衡模型规模、量化精度和上下文长度。显存需求受模型参数、上下文缓存和系统开销影响,增加上下文长度会迅速消耗显存。选择合适的量化格式可提升性能。
智谱推出GLM-4.6,编程能力超越Claude Sonnet 4,成为国内最强模型。其上下文长度提升至200K,推理和搜索能力增强,支持FP8+Int4混合量化,降低推理成本,价格大幅下调,用户享受高性价比服务。
Anthropic将Claude Sonnet 4升级至支持100万标记的上下文长度,提升五倍。此功能已公开测试,适用于Anthropic API和Amazon Bedrock,方便用户处理更大数据集。尽管此升级有助于上下文感知代理,但也增加了计算负担,开发者对此的实际价值看法不一。
DeepSeek V3.1在上下文长度和多格式支持上有所提升,编程、写作和翻译能力显著增强,且价格比Claude低68倍。用户反馈积极,但存在一些API问题。
本研究探讨了语言模型代理在自主体应用中的目标遵循问题,并提出了分析目标漂移的新方法。尽管最佳代理在困难评估中表现良好,但所有模型均显示出目标漂移,且与上下文长度增加的模式匹配敏感性相关。
Amazon Nova Premier 是 AWS re:Invent 推出的强大模型,适用于复杂任务,支持文本、图像和视频处理,具备 100 万个 token 的上下文长度,能高效处理长文档。它可作为教师模型,帮助蒸馏出更小的高效模型,如 Nova Pro 和 Micro,从而提升性能和降低成本。
本研究提出了一种名为llm-jp-modernbert的现代BERT模型,旨在解决大规模语料库和长上下文的预训练问题。该模型在8192个标记的上下文长度上进行训练,尽管在下游任务中未超越现有基线,但在填充掩码评估中表现良好。
大型语言模型(LLM)在处理长序列时存在上下文窗口限制。研究提出了一种高效训练方案,将上下文长度扩展至1M、2M和4M个token,同时保持标准任务性能。UltraLong-8B模型在长上下文基准测试中表现优异,展现出强大的检索能力。未来研究将关注安全对齐机制和高级调优策略。
当前主流的大语言模型(LLM)上下文长度不断增加,已达到64K,部分新模型甚至可达1M。不同模型的token与字数换算比例各异,中文字符约为0.6个token。例如,阿里Qwen系列支持128K token,OpenAI的GPT-4.5支持128K输入和16K输出。
本研究提出了一种新的递归神经网络机制Lattice,旨在降低序列学习中注意力机制的计算复杂性。Lattice通过利用K-V矩阵的低秩结构高效压缩内存,显著减少计算复杂度。实验结果表明,Lattice在不同上下文长度下的表现优于现有方法,尤其在上下文长度增加时,性能提升更为明显。
在人工智能迅速发展的背景下,大型语言模型(LLMs)成为重要工具。组织在处理长文本时面临效率和成本挑战。本文探讨了优化LLM效率的策略,强调上下文长度对性能的影响,并提出应对隐性错误信息的解决方案。通过实施分组查询注意力(GQA)等技术,企业能够降低成本并提升生产力,实现更高效的AI应用。
完成下面两步后,将自动完成登录并继续当前操作。