OpenAI公测Agents API,支持运行持续数天的自主智能体,可自动压缩上下文、按需调用工具并支持并行子智能体。同日因GPT-6 Astra需求过大,OpenAI暂停200美元Pro新订阅。内部数据显示,8月中旬研究员人均智能体工作量达人类三倍,中位日推理成本超600美元。该API降低编排成本,但推理消耗更易激增。
OpenAI内部测试GPT-6 Sol,速度是Astra的6倍,或于9月发布。同时,OpenAI披露研究员人均带3个AI实习生,每日推理成本超600美元,实现自动化研究实习生。首席科学家呼吁行业减速,因AI行为难监控,需建立安全标准。
Mostik团队开发了一种“桥”技术,使大模型(如753B的GLM-5.2)能直接向小模型(如4B的Qwen-3.5)传递隐藏状态,无需文本输出,从而将小模型性能提升50%,准确率提高25%,推理成本降至二十分之一。该技术基于模型内部状态包含深层计算信息,团队由菲尔兹奖得主领导,正探索蒸馏和专项化应用。
dsh-subagents是DeepSeek Harness的插件,通过Markdown文件定义子代理角色,支持模型或CLI驱动、热加载和管理界面。它委派任务给廉价模型,降低推理成本达72%,保持主模型上下文清晰,并集成外部CLI工具,提升效率。
“中国词元”概念强调芯片、模型与绿电结合,但作者认为应视为成本表而非口号。AI应用生产需关注推理成本、显存、运维等,芯片迁移复杂,模型维护费人力,绿电影响毛利。建议团队将AI调用视为昂贵基础设施,做好限流、缓存、预算和回滚,务实管理成本。
Z.ai的GLM-5.3-Flash模型(即Ox-alpha)以超低推理成本和高性能引发关注,性能接近Claude Opus 4.8和GPT-5.6 Terra,尤其在AI代理任务中表现优异。该模型支持多模态输入,基于中国AI芯片优化,推理成本远低于竞争对手,凸显中国开源模型在性能与成本上的竞争力。
OpenAI完成10万亿参数预训练模型Bel,作为GPT-6底座,并推出自研芯片Jalapeño,功耗700瓦,性能超越英伟达旗舰。芯片用AI设计,9个月流片,软件栈不依赖CUDA。OpenAI借此降低推理成本,形成AI加速研发闭环,但大规模部署需至2027年,期间仍依赖英伟达,面临算力、资金和时间挑战。
ReAct代理通过“推理-行动”循环调用工具并基于反馈迭代,适用于客服、编程和研究场景,但随步骤增加,上下文重复发送导致成本和延迟呈二次方增长。管理记忆分层(提示、线程、长期)和语义缓存可优化性能,Redis Iris提供实时上下文服务,降低推理成本并提升效率。
本文介绍如何通过“令牌预算感知推理”降低AI推理成本。核心方法包括:在提示中设定推理令牌预算(如TALE技术),使用简洁思维链,以及架构级优化——语义缓存(如Redis LangCache)减少重复查询,复杂度路由将简单问题分配给便宜模型,持久化代理记忆避免重复推理。这些手段可显著节省输出令牌费用,提升响应速度。
该文指出,将简单的RAG应用直接投入生产环境会崩溃。主要问题包括:同步数据摄取导致超时和限流,需采用批量扇出异步队列;多租户隔离应使用无服务器向量数据库,而非复杂路由;推理成本需通过提示缓存和意图验证优化。核心观点是,应将AI视为分布式系统问题,而非黑盒。
Kimi K3开源模型参数巨大,但普通团队部署需关注权重获取、推理成本、长上下文稳定性及运维监控。开源权重价值在于可控,但自建需承担维护责任。建议先在低风险场景试用,评估坏输入表现,谨慎进入生产环境。
开源AI正成为生产主力,推理成本三年降50倍,中国模型流量超美国三倍。但部署成功率低,闭源在集成、长上下文、合规上领先。开源生态经济规模达千亿美元,中国是最大权重来源。未来机会在开源harness、记忆层、权限标准等领域,窗口期有限。
OpenAI宣布通过新技术将推理成本降低一半,可能影响AI服务价格。这项技术包括量化压缩和投机采样,显著减少计算资源需求。尽管节省成本,用户体验仍是关键,可能影响模型精度。未来节省的成本可用于更大规模模型训练或复杂AI应用开发。
云知声推出的新一代大模型U2,采用“智能密度×Token价值”理念,旨在降低Token消耗并提升智能效率。U2在多项评测中表现优异,推理成本显著低于同类模型,验证了智能密度的可行性,标志着AI行业竞争格局的转变。
Llama-70B模型在处理128K token请求时,KV Cache占用429GB显存,成为推理成本的主要因素。通过TurboQuant、PD拆分和LMCache等技术,可以将长上下文推理成本降低4到40倍。这些技术的应用将显著提升效率,改善产品体验,推动LLM的广泛使用。
小米宣布其AI大模型MiMo-V2.5系列永久降价,最高降幅达99%。此举旨在吸引开发者和高频应用,降低推理成本。降价策略依赖于缓存命中率,适合高重复内容场景。小米的工程能力支撑了这一价格战,可能对市场造成冲击,迫使其他厂商调整策略。未来,模型质量和服务稳定性将成为竞争关键。
DeepSeek v4发布了Pro和Flash两个版本,分别拥有1.6T和284B参数,价格低至3.48美元和0.28美元。Pro版适合复杂任务,Flash版则注重低成本高吞吐。DeepSeek的开源程度和性能接近顶级闭源模型,预计新硬件上市后推理成本将进一步降低,推动开源AI的发展。
本文探讨了大语言模型(LLM)推理中的成本、延迟和吞吐量之间的权衡,强调了硬件选择、模型架构和量化等因素对优化的影响。理解成本的多维特性和优化策略对于有效管理基础设施预算至关重要。通过合理的工程决策和基准测试,可以在吞吐量和延迟之间找到最佳平衡,以满足不同工作负载的需求。
本文介绍了如何将Florence-2模型部署到Inferentia2,采用Stage-wise编译、Bucket策略和BF16优化,实现了252ms的延迟和8.18 QPS的吞吐量,推理成本比GPU降低38%。Florence-2具备零样本能力,适用于电商和仓储等场景,显著降低了物品分类的运维成本和复杂度。
KARL模型通过强化学习显著降低了推理成本和延迟,同时提升了质量,适用于Databricks客户,帮助他们创建定制的RL模型,尤其在处理复杂问题时表现优异。
完成下面两步后,将自动完成登录并继续当前操作。