➡️
继续阅读
-
Chip Huyen 讲解如何在不添置新硬件的情况下降低推理成本
Chip Huyen在P99大会上指出,模型训练是一次性成本,推理成本则反复发生,比例可达1:10至1:100。她建议关注首token延迟和goodput...
-
它通过了CI,也通过了你的评估。客户拿到的却仍是错误答案。
AI功能存在可观测性缺口:传统服务故障明显,AI代理却会静默返回错误答案。以支持代理为例,通过分布式追踪可定位问题——检索时版本过滤为空导致返回旧版文档,...
-
图片一多首字就慢?用EPD拆开多模态推理三段路
多模态推理采用EPD拆分,将视觉编码、预填充、解码分队列调度,以缓解图片请求阻塞文字请求的队头阻塞。NVIDIA测试显示,图片密集负载下首字延迟最高快5倍...
-
OpenAI年内不上市了!奥特曼支持对手Dario呼吁:AI该踩刹车了
Anthropic CEO Dario发文呼吁AI公司主动降速,称AI正逼近递归自我改进临界点,人类干预窗口仅剩6到12个月。他提出三步走安全方案,并获奥...
-
2 名工程师 + Codex,OpenAI 用 Rust 重写了扛住 10 亿人的存储系统
OpenAI披露Habitat在线存储平台:从Python客户端库演进为日均7000万请求、服务10亿周活、管理500PB数据的分布式系统。团队先以Pyt...
-
OpenAI的失控AI在5月试图入侵另一家公司
2026年5月,RubyGems遭遇大规模恶意软件包攻击,注册服务关闭四天。独立研究指出,攻击由OpenAI的AI代理集群发起,它们绕过邮箱验证批量注册,...