小红花·文摘
  • 首页
  • AI Tokens🪙
  • 排行榜🏆
  • 直播
  • FAQ
OpenAI研究员每天在AI智能体上烧掉7000美元——如今它要打开闸门了

OpenAI公测Agents API,支持运行持续数天的自主智能体,可自动压缩上下文、按需调用工具并支持并行子智能体。同日因GPT-6 Astra需求过大,OpenAI暂停200美元Pro新订阅。内部数据显示,8月中旬研究员人均智能体工作量达人类三倍,中位日推理成本超600美元。该API降低编排成本,但推理消耗更易激增。

OpenAI研究员每天在AI智能体上烧掉7000美元——如今它要打开闸门了

The New Stack The New Stack · 2026-09-11T21:27:42Z
GPT-6不只Astra!Sol内测结果曝光,速度快6倍

OpenAI内部测试GPT-6 Sol,速度是Astra的6倍,或于9月发布。同时,OpenAI披露研究员人均带3个AI实习生,每日推理成本超600美元,实现自动化研究实习生。首席科学家呼吁行业减速,因AI行为难监控,需建立安全标准。

GPT-6不只Astra!Sol内测结果曝光,速度快6倍

量子位 量子位 · 2026-09-07T09:04:06Z
菲尔兹奖得主入局大模型!4B手机Qwen+云端GLM刷爆ARC-AGI 3

Mostik团队开发了一种“桥”技术,使大模型(如753B的GLM-5.2)能直接向小模型(如4B的Qwen-3.5)传递隐藏状态,无需文本输出,从而将小模型性能提升50%,准确率提高25%,推理成本降至二十分之一。该技术基于模型内部状态包含深层计算信息,团队由菲尔兹奖得主领导,正探索蒸馏和专项化应用。

菲尔兹奖得主入局大模型!4B手机Qwen+云端GLM刷爆ARC-AGI 3

量子位 量子位 · 2026-09-07T08:36:30Z
开源插件dsh-subagents:ZCode角色定义搬进DeepSeek Harness

dsh-subagents是DeepSeek Harness的插件,通过Markdown文件定义子代理角色,支持模型或CLI驱动、热加载和管理界面。它委派任务给廉价模型,降低推理成本达72%,保持主模型上下文清晰,并集成外部CLI工具,提升效率。

开源插件dsh-subagents:ZCode角色定义搬进DeepSeek Harness

极道 极道 · 2026-08-30T23:32:00Z
“中国词元”这笔账,最后会落到运维和成本表上

“中国词元”概念强调芯片、模型与绿电结合,但作者认为应视为成本表而非口号。AI应用生产需关注推理成本、显存、运维等,芯片迁移复杂,模型维护费人力,绿电影响毛利。建议团队将AI调用视为昂贵基础设施,做好限流、缓存、预算和回滚,务实管理成本。

“中国词元”这笔账,最后会落到运维和成本表上

mongona news mongona news · 2026-08-29T22:38:49Z
Z.ai的GLM-5.3 Flash:价格低廉、性能出色,搭载中国芯片

Z.ai的GLM-5.3-Flash模型(即Ox-alpha)以超低推理成本和高性能引发关注,性能接近Claude Opus 4.8和GPT-5.6 Terra,尤其在AI代理任务中表现优异。该模型支持多模态输入,基于中国AI芯片优化,推理成本远低于竞争对手,凸显中国开源模型在性能与成本上的竞争力。

Z.ai的GLM-5.3 Flash:价格低廉、性能出色,搭载中国芯片

The New Stack The New Stack · 2026-08-26T16:26:03Z
OpenAI完成GPT-6预训练Bel底座! 自研芯片碾压英伟达

OpenAI完成10万亿参数预训练模型Bel,作为GPT-6底座,并推出自研芯片Jalapeño,功耗700瓦,性能超越英伟达旗舰。芯片用AI设计,9个月流片,软件栈不依赖CUDA。OpenAI借此降低推理成本,形成AI加速研发闭环,但大规模部署需至2027年,期间仍依赖英伟达,面临算力、资金和时间挑战。

OpenAI完成GPT-6预训练Bel底座! 自研芯片碾压英伟达

极道 极道 · 2026-08-25T22:06:00Z
ReAct代理详解:概念与实践应用

ReAct代理通过“推理-行动”循环调用工具并基于反馈迭代,适用于客服、编程和研究场景,但随步骤增加,上下文重复发送导致成本和延迟呈二次方增长。管理记忆分层(提示、线程、长期)和语义缓存可优化性能,Redis Iris提供实时上下文服务,降低推理成本并提升效率。

ReAct代理详解:概念与实践应用

Redis Blog Redis Blog · 2026-08-18T00:00:00Z
令牌预算感知的LLM推理:2026年削减成本

本文介绍如何通过“令牌预算感知推理”降低AI推理成本。核心方法包括:在提示中设定推理令牌预算(如TALE技术),使用简洁思维链,以及架构级优化——语义缓存(如Redis LangCache)减少重复查询,复杂度路由将简单问题分配给便宜模型,持久化代理记忆避免重复推理。这些手段可显著节省输出令牌费用,提升响应速度。

令牌预算感知的LLM推理:2026年削减成本

Redis Blog Redis Blog · 2026-07-28T00:00:00Z
提示缓存能否在不牺牲准确性的情况下降低RAG成本?

该文指出,将简单的RAG应用直接投入生产环境会崩溃。主要问题包括:同步数据摄取导致超时和限流,需采用批量扇出异步队列;多租户隔离应使用无服务器向量数据库,而非复杂路由;推理成本需通过提示缓存和意图验证优化。核心观点是,应将AI视为分布式系统问题,而非黑盒。

提示缓存能否在不牺牲准确性的情况下降低RAG成本?

The New Stack The New Stack · 2026-07-23T13:00:00Z
Kimi K3 开源模型热度背后,普通团队该先看部署和成本

Kimi K3开源模型参数巨大,但普通团队部署需关注权重获取、推理成本、长上下文稳定性及运维监控。开源权重价值在于可控,但自建需承担维护责任。建议先在低风险场景试用,评估坏输入表现,谨慎进入生产环境。

Kimi K3 开源模型热度背后,普通团队该先看部署和成本

mongona news mongona news · 2026-07-17T22:39:01Z
开源AI价格崩了50倍但部署成功率低12%,闭源正在焊死护城河

开源AI正成为生产主力,推理成本三年降50倍,中国模型流量超美国三倍。但部署成功率低,闭源在集成、长上下文、合规上领先。开源生态经济规模达千亿美元,中国是最大权重来源。未来机会在开源harness、记忆层、权限标准等领域,窗口期有限。

开源AI价格崩了50倍但部署成功率低12%,闭源正在焊死护城河

极道 极道 · 2026-07-17T21:40:00Z
OpenAI要降价?推理成本减半新招揭秘

OpenAI宣布通过新技术将推理成本降低一半,可能影响AI服务价格。这项技术包括量化压缩和投机采样,显著减少计算资源需求。尽管节省成本,用户体验仍是关键,可能影响模型精度。未来节省的成本可用于更大规模模型训练或复杂AI应用开发。

OpenAI要降价?推理成本减半新招揭秘

极道 极道 · 2026-06-30T22:53:00Z
国产通用大模型第一梯队,来新人了?!

云知声推出的新一代大模型U2,采用“智能密度×Token价值”理念,旨在降低Token消耗并提升智能效率。U2在多项评测中表现优异,推理成本显著低于同类模型,验证了智能密度的可行性,标志着AI行业竞争格局的转变。

国产通用大模型第一梯队,来新人了?!

量子位 量子位 · 2026-06-09T02:55:08Z
跑大模型,最贵的不是 GPU,是这个东西

Llama-70B模型在处理128K token请求时,KV Cache占用429GB显存,成为推理成本的主要因素。通过TurboQuant、PD拆分和LMCache等技术,可以将长上下文推理成本降低4到40倍。这些技术的应用将显著提升效率,改善产品体验,推动LLM的广泛使用。

跑大模型,最贵的不是 GPU,是这个东西

迷途小书童 迷途小书童 · 2026-06-01T13:45:20Z
小米:请叫我 Token 价格屠夫

小米宣布其AI大模型MiMo-V2.5系列永久降价,最高降幅达99%。此举旨在吸引开发者和高频应用,降低推理成本。降价策略依赖于缓存命中率,适合高重复内容场景。小米的工程能力支撑了这一价格战,可能对市场造成冲击,迫使其他厂商调整策略。未来,模型质量和服务稳定性将成为竞争关键。

小米:请叫我 Token 价格屠夫

爱范儿 爱范儿 · 2026-05-27T09:54:47Z
开源AI性价比之王DeepSeek v4发布:1.6T参数仅售3.48美元!

DeepSeek v4发布了Pro和Flash两个版本,分别拥有1.6T和284B参数,价格低至3.48美元和0.28美元。Pro版适合复杂任务,Flash版则注重低成本高吞吐。DeepSeek的开源程度和性能接近顶级闭源模型,预计新硬件上市后推理成本将进一步降低,推动开源AI的发展。

开源AI性价比之王DeepSeek v4发布:1.6T参数仅售3.48美元!

极道 极道 · 2026-04-24T06:19:00Z
大语言模型推理三难问题:吞吐量、延迟与成本

本文探讨了大语言模型(LLM)推理中的成本、延迟和吞吐量之间的权衡,强调了硬件选择、模型架构和量化等因素对优化的影响。理解成本的多维特性和优化策略对于有效管理基础设施预算至关重要。通过合理的工程决策和基准测试,可以在吞吐量和延迟之间找到最佳平衡,以满足不同工作负载的需求。

大语言模型推理三难问题:吞吐量、延迟与成本

The DigitalOcean Blog The DigitalOcean Blog · 2026-04-22T15:56:14Z
将 Florence-2 部署到 Inferentia2 的实战指南

本文介绍了如何将Florence-2模型部署到Inferentia2,采用Stage-wise编译、Bucket策略和BF16优化,实现了252ms的延迟和8.18 QPS的吞吐量,推理成本比GPU降低38%。Florence-2具备零样本能力,适用于电商和仓储等场景,显著降低了物品分类的运维成本和复杂度。

将 Florence-2 部署到 Inferentia2 的实战指南

亚马逊AWS官方博客 亚马逊AWS官方博客 · 2026-04-03T09:55:46Z
认识KARL:一个更快的企业知识代理,基于定制的强化学习

KARL模型通过强化学习显著降低了推理成本和延迟,同时提升了质量,适用于Databricks客户,帮助他们创建定制的RL模型,尤其在处理复杂问题时表现优异。

认识KARL:一个更快的企业知识代理,基于定制的强化学习

Databricks Databricks · 2026-03-05T14:40:00Z
  • <<
  • <
  • 1 (current)
  • 2
  • 3
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
友情链接: MOGE.AI 九胧科技 1tok 菜鸟教程 Remio.AI DeekSeek连连 53AI 神龙海外代理IP IPIPGO全球代理IP 东波哥的博客 匡优考试在线考试系统 开源服务指南 蓝莺IM Solo 独立开发者社区 AI酷站导航 极客Fun 我爱水煮鱼 周报生成器 He3.app 简单简历 白鲸出海 T沙龙 职友集 TechParty 蟒周刊 Best AI Music Generator 模力方舟 Gitee AI

小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码