Uber公开AI成本优化实践:通过将总花费拆解为六个可独立优化的变量,并采用四层架构管理智能体,实现了周活跃用户增长7倍、请求量增长9.4倍的同时,AI总支出自4月起保持稳定,单次请求成本下降34%,会话成本下降52%。核心方法包括模型选型基准测试、MCP工具CLI化、Code-Mode压缩Token、优化Prompt Cache TTL及构建上下文图谱,强调成本可见性与文化引导,为AI编程降本提供了系统化工程方案。
Codex发布新版本,修复了多个导致用户配额消耗过快的问题,包括上下文压缩、记忆、目标、自动化、子智能体、计算机历史、滚动任务摘要和MCP协议等。修复后用量可提升10%-40%。今天早晨已重置配额作为补偿,明天将再次重置以庆祝用户量里程碑。建议用户尽快升级新版本。
Google Notebook推出新的灵活计算用量限制,每五小时刷新一次,支持全天持续工作。用量计算考虑提示复杂度、聊天长度、来源数量和功能使用。达到限制时,可延迟生成视频概览或幻灯片,完成后自动通知。更新于9月2日起向网页和移动端消费者账户推出。
本文介绍用AWS CUR分析Amazon Kinesis Video Streams用量的三维拆解法:将总用量分解为活跃设备数×推流时长×等效码率,通过Athena查询追踪各维度变化定位费用增长原因。文章详解KVS计费模型、CUR统计陷阱(如月初设备数虚高、BytesHr误导),并通过实战案例展示归因分析,最后给出清理Signaling Channel、优化存储分层等针对性建议。
本文介绍GeekAgent开发第七天,实现轻量TUI界面与用量面板。通过引入pi-tui库,程序接管终端,左侧显示消息流,右侧常驻面板展示模型、会话、上下文占用及本轮/累计tokens。接口回传usage数据,流式期间用字符估算。支持输入编辑、工具确认,退出恢复原终端。代码新增1115行,验证功能正常,为后续权限管理打基础。
Codex因用量消耗过快遭用户抱怨,团队调查发现可能与长会话图片压缩低效、计算机历史功能使用率过高及对话标题生成超预期有关。作为补偿,将于8月24日早晨5点重置所有订阅用户配额,并发布新版本修复问题,下周还将部署新方案提升效率。
AI提升效率,但带来空洞与焦虑。Vibe coding快速实现想法,却削弱思考;LLM即时回应,缺乏深度。焦虑源于能力下滑、竞争加剧及被替代风险。解法在于适应技术,如蒸汽机时代,驾驭而非对抗,同时警惕效率提升不解决竞争,需持续努力。
Frugal Tokens是一款本地运行的AI会话成本分析工具,支持Claude Code、Cursor等助手,提供Token用量、费用拆解、缓存效率及跨模型价格对比。数据本地处理,隐私安全,基于Deno和SQLite,适合开发者优化AI编程开销。
Cloudflare推出新的可计费用量API,供自助服务账户通过单一端点按产品和服务周期查询用量与成本,覆盖Workers、R2等产品,字段与FOCUS规范对齐。该API支持自动化成本监控,并与Vantage合作集成,实现跨云提供商的成本分配、异常检测和FinOps代理查询。未来将提供更细粒度时间窗口、预测功能和企业版支持。
Codex将于2026年7月31日恢复5小时窗口限额,此前因调查Sol模型用量问题临时取消。社区猜测恢复时会再次重置周用量,但未获证实。用户需注意时差,合理规划使用,避免额度耗尽后长时间等待。
本文介绍使用Amazon Athena分析Kiro团队用量报表的实践。针对CSV中动态模型列可能导致数据错位的问题,通过ETL将宽表转为长表,采用Parquet格式和Partition Projection建表,实现稳定查询。方案完全Serverless化,月成本低于1美元,并接入Amazon QuickSight构建看板,便于团队观测用量、治理额度。
OpenAI的新模型GPT-5.6显著提升了科研效率,研究员的角色从操作工转变为指挥员。该模型能够自动诊断故障、优化系统、设计实验和解读数据,显示出AI在科研中的重要性。尽管流程加速,研究的创造性和判断力仍需人类掌握。
Codex 最近修复了用量消耗过快的问题,实际使用配额显著增加。ChatGPT Plus 的每周用量从 145 美元降至 112 美元后,现已暴增至 191 美元。修复后,用户反馈用量消耗明显减少。
Codex 付费订阅用户因系统混乱获得额外重置次数,问题源于 OpenAI 的滥用防护机制,导致部分用户被错误标记,使用额度被大幅缩减。Codex 现允许用户在30天内手动重置,增加灵活性,故障仍在调查中。
OpenAI 承认部分 ChatGPT Plus/Pro 用户因系统故障被错误降级至免费版,导致 Codex 用量下降。问题已解决,但是否重置用户配额尚未确定,影响了依赖 Codex 的开发者。
本文介绍了一种基于AWS无服务器架构的Kiro费用分摊与自动化报告方案。该方案利用AWS CUR 2.0、Athena、Lambda和EventBridge实现费用的自动采集、用户级分摊和CSV报告生成,并通过飞书Webhook推送可视化摘要。该方案无需管理服务器,运营成本低,适合企业团队使用。
Meta 正在限制员工的人工智能使用量,因最近 30 天内消耗高达 60 万亿 Tokens,预计将导致数十亿美元的支出。公司采取 Tokens 最小化策略,设定团队预算上限,并开发工具实时监控 AI 用量。其他科技公司如 Uber 和 Microsoft 也在实施类似措施以控制成本。
本文介绍了如何利用AWS Budgets和Budget Actions监控Amazon Bedrock的使用情况,设置预算告警,并在超预算时自动阻断用户访问。通过IAM用户追踪花费,设置预算阈值,达到时发送告警邮件,并在超预算时附加拒绝策略,以确保成本控制。该方案完全基于AWS原生服务,无需额外组件。
研究表明,传统小样本生物医学研究存在统计效力不足的问题。德国法兰克福大学研发的genESOM生成式AI模型,通过分离结构学习与数据生成,有效恢复小样本中的生物学信号,降低假阳性率。在多发性硬化研究中,该模型表现优异,能减少动物用量30%-50%,为小样本研究提供了新方案。
文章讨论了Linux系统中`df`和`du`命令显示的磁盘使用量不一致的原因,包括已删除但仍被进程占用的文件、文件系统保留块、隐藏挂载点和容器的overlay文件系统。`df`直接读取文件系统的超级块,而`du`遍历目录树,导致统计结果不同。提供了检测脚本和排查方法,帮助用户找出占用空间的文件。
完成下面两步后,将自动完成登录并继续当前操作。