小红花·文摘
  • 首页
  • AI Tokens🪙
  • 排行榜🏆
  • 直播
  • FAQ

文章介绍了通过两台协同计算优化AI模型,实现稳定70 TPS和382K上下文,并利用DFlash2优化稠密模型达到单流125-133 TPS、8并发231 TPS,通过YaRN技术将上下文扩展至900K。同时对比了n-gram和MTP方案,最终选择MTP实现60 TPS和2232 TPS Prefill,适合日常写代码,并计划继续优化其他模型。

算力舱AI模型适配实录

Andy Stewart Andy Stewart · 2026-08-28T16:00:00Z
Qwen 3.8 27B YaRN 768K 上下文实测

文章实测Qwen 3.8 27B模型通过YaRN技术扩展上下文长度,发现实际可从265K扩展至768K,而非宣传的1M,原因是1M时KV Cache需84GB显存,超出128GB机器可用内存约3GB。作者计划进一步测试768K上下文在实际编程中的表现。

Qwen 3.8 27B YaRN 768K 上下文实测

Andy Stewart Andy Stewart · 2026-08-27T16:00:00Z
Qwen 3.8 27B 实现 900K 代码上下文

该文章介绍通过YaRN技术将Qwen 3.8 27B模型的上下文长度从786K提升至900K,接近1M,可支持99%的大型代码项目,避免因上下文不足导致的性能下降。模型占用120GB显存,在懒猫AI算力舱上运行速度快且稳定。

Qwen 3.8 27B 实现 900K 代码上下文

Andy Stewart Andy Stewart · 2026-08-27T16:00:00Z
两块RTX 3090跑105 tok/s!Qwen3.8-27B本地部署实测

阿里开源Qwen3.8-27B模型,270亿参数,支持262K上下文,性能接近闭源旗舰。社区实测在双RTX 3090上达105 tok/s,通过量化、MTP加速等技术实现。模型Apache 2.0协议,48小时下载86万次。但速度受场景、配置影响大,多卡未必更快,且长上下文需量化KV缓存牺牲质量。

两块RTX 3090跑105 tok/s!Qwen3.8-27B本地部署实测

极道 极道 · 2026-08-17T04:23:00Z
炸裂!Tibo首发GPT-5.6 Sol百万Token上下文解锁指南

OpenAI的GPT-5.6 Sol模型宣称支持百万token上下文,但实际Codex仅提供约25万token,远低于宣传。用户可通过修改配置文件尝试解锁,但可能导致崩溃。官方因成本限制调低默认值,且Luna模型性价比更高。文章揭露了宣传与实际性能的差距。

炸裂!Tibo首发GPT-5.6 Sol百万Token上下文解锁指南

极道 极道 · 2026-08-16T23:48:00Z
DeepSeek V4 Pro 正式版上线,多项指标逼近 Fable 5

DeepSeek V4 Pro正式发布,支持1M上下文和384K最大输出,具备思考模式、JSON输出、工具调用及API兼容。价格与旧版持平,每百万Token缓存命中输入0.025元,未命中输入3元,输出6元,并发限制500。Flash版更便宜且并发高,Pro面向高规格任务,强化Agent和编码场景。

DeepSeek V4 Pro 正式版上线,多项指标逼近 Fable 5

爱范儿 爱范儿 · 2026-08-13T01:04:57Z

本文介绍RoPE与ALiBi两种相对位置编码:RoPE通过旋转矩阵使点积仅依赖相对位置,但高频通道在长距离会绕圈失真,需通过base scaling、YaRN等方法扩展;ALiBi通过线性距离惩罚实现外推稳定,但压制远距离强相关内容。文章还指出有效上下文常短于宣称长度,并讨论相对位置编码在算法推理任务上的局限。

【Transformer 与注意力机制】41|位置编码演进:从 Sinusoidal 到 RoPE、ALiBi 与长度外推的边界

土法炼钢兴趣小组的博客 土法炼钢兴趣小组的博客 · 2026-08-06T00:00:00Z
RoboTTT——面向机器人策略的上下文扩展:将TTT集成至VLA中形成序列模型(记忆信息被压缩至快速权重中,训练和推理时皆可更新),如此将视觉-运动上下文扩展到 8K 个时间步

RoboTTT将机器人基础模型的视觉-运动上下文扩展至8K时间步,通过测试时训练更新快速权重,在不增加推理延迟下提升性能。相比单步基线,任务性能提高87%,能完成五分钟十阶段装配任务,并支持一次性模仿和即时策略改进,表明上下文长度是机器人模型的新扩展维度。

RoboTTT——面向机器人策略的上下文扩展:将TTT集成至VLA中形成序列模型(记忆信息被压缩至快速权重中,训练和推理时皆可更新),如此将视觉-运动上下文扩展到 8K 个时间步

结构之法 算法之道 结构之法 算法之道 · 2026-07-21T15:49:12Z
ollama 0.17 版本发布,改进了 OpenClaw 入门流程

开源项目ollama发布v0.17.0版本,增强了OpenClaw的引导流程,改善了集成,用户可通过简单命令启动OpenClaw,ollama负责安装和设置。此外,公开了服务器的默认上下文长度,并进行了其他改进。

ollama 0.17 版本发布,改进了 OpenClaw 入门流程

实时互动网 实时互动网 · 2026-02-24T02:27:03Z
不同显寸对应的可运行的模型大小 - 蝈蝈俊

在有限显存下,运行大型语言模型需平衡模型规模、量化精度和上下文长度。显存需求受模型参数、上下文缓存和系统开销影响,增加上下文长度会迅速消耗显存。选择合适的量化格式可提升性能。

不同显寸对应的可运行的模型大小 - 蝈蝈俊

蝈蝈俊 蝈蝈俊 · 2025-12-12T08:39:00Z

智谱推出GLM-4.6,编程能力超越Claude Sonnet 4,成为国内最强模型。其上下文长度提升至200K,推理和搜索能力增强,支持FP8+Int4混合量化,降低推理成本,价格大幅下调,用户享受高性价比服务。

真够卷的!DeepSeek更完智谱更:GLM-4.6,代码国内最强

量子位 量子位 · 2025-09-30T09:07:50Z
Claude Sonnet 4扩展至100万标记的上下文窗口

Anthropic将Claude Sonnet 4升级至支持100万标记的上下文长度,提升五倍。此功能已公开测试,适用于Anthropic API和Amazon Bedrock,方便用户处理更大数据集。尽管此升级有助于上下文感知代理,但也增加了计算负担,开发者对此的实际价值看法不一。

Claude Sonnet 4扩展至100万标记的上下文窗口

InfoQ InfoQ · 2025-08-22T13:20:00Z

DeepSeek V3.1在上下文长度和多格式支持上有所提升,编程、写作和翻译能力显著增强,且价格比Claude低68倍。用户反馈积极,但存在一些API问题。

实测DeepSeek V3.1,不止拓展上下文长度

量子位 量子位 · 2025-08-20T08:12:41Z

本研究探讨了语言模型代理在自主体应用中的目标遵循问题,并提出了分析目标漂移的新方法。尽管最佳代理在困难评估中表现良好,但所有模型均显示出目标漂移,且与上下文长度增加的模式匹配敏感性相关。

Technical Report: Evaluating Goal Drift in Language Model Agents

BriefGPT - AI 论文速递 BriefGPT - AI 论文速递 · 2025-05-05T00:00:00Z
Amazon Nova Premier 正式可用!

Amazon Nova Premier 是 AWS re:Invent 推出的强大模型,适用于复杂任务,支持文本、图像和视频处理,具备 100 万个 token 的上下文长度,能高效处理长文档。它可作为教师模型,帮助蒸馏出更小的高效模型,如 Nova Pro 和 Micro,从而提升性能和降低成本。

Amazon Nova Premier 正式可用!

亚马逊AWS官方博客 亚马逊AWS官方博客 · 2025-05-03T13:07:14Z

本研究提出了一种名为llm-jp-modernbert的现代BERT模型,旨在解决大规模语料库和长上下文的预训练问题。该模型在8192个标记的上下文长度上进行训练,尽管在下游任务中未超越现有基线,但在填充掩码评估中表现良好。

llm-jp-modernbert: A Modern BERT Model Trained on a Large-Scale Japanese Corpus with Support for Long Context Lengths

BriefGPT - AI 论文速递 BriefGPT - AI 论文速递 · 2025-04-22T00:00:00Z
NVIDIA AI 发布 UltraLong-8B:超长上下文语言模型,旨在处理大量文本序列

大型语言模型(LLM)在处理长序列时存在上下文窗口限制。研究提出了一种高效训练方案,将上下文长度扩展至1M、2M和4M个token,同时保持标准任务性能。UltraLong-8B模型在长上下文基准测试中表现优异,展现出强大的检索能力。未来研究将关注安全对齐机制和高级调优策略。

NVIDIA AI 发布 UltraLong-8B:超长上下文语言模型,旨在处理大量文本序列

实时互动网 实时互动网 · 2025-04-14T03:00:15Z

当前主流的大语言模型(LLM)上下文长度不断增加,已达到64K,部分新模型甚至可达1M。不同模型的token与字数换算比例各异,中文字符约为0.6个token。例如,阿里Qwen系列支持128K token,OpenAI的GPT-4.5支持128K输入和16K输出。

目前常见LLM的上下文长度 - 蝈蝈俊

蝈蝈俊 蝈蝈俊 · 2025-04-08T11:17:00Z

本研究提出了一种新的递归神经网络机制Lattice,旨在降低序列学习中注意力机制的计算复杂性。Lattice通过利用K-V矩阵的低秩结构高效压缩内存,显著减少计算复杂度。实验结果表明,Lattice在不同上下文长度下的表现优于现有方法,尤其在上下文长度增加时,性能提升更为明显。

Lattice: Learning to Efficiently Compress Memory

BriefGPT - AI 论文速递 BriefGPT - AI 论文速递 · 2025-04-08T00:00:00Z
解锁大型语言模型效率:长文本的成本优化策略

在人工智能迅速发展的背景下,大型语言模型(LLMs)成为重要工具。组织在处理长文本时面临效率和成本挑战。本文探讨了优化LLM效率的策略,强调上下文长度对性能的影响,并提出应对隐性错误信息的解决方案。通过实施分组查询注意力(GQA)等技术,企业能够降低成本并提升生产力,实现更高效的AI应用。

解锁大型语言模型效率:长文本的成本优化策略

DEV Community DEV Community · 2025-03-13T16:07:51Z
  • <<
  • <
  • 1 (current)
  • 2
  • 3
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
友情链接: MOGE.AI 九胧科技 1tok 菜鸟教程 Remio.AI DeekSeek连连 53AI 神龙海外代理IP IPIPGO全球代理IP 东波哥的博客 匡优考试在线考试系统 开源服务指南 蓝莺IM Solo 独立开发者社区 AI酷站导航 极客Fun 我爱水煮鱼 周报生成器 He3.app 简单简历 白鲸出海 T沙龙 职友集 TechParty 蟒周刊 Best AI Music Generator 模力方舟 Gitee AI

小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码