➡️
继续阅读
-
Chip Huyen 讲解如何在不添置新硬件的情况下降低推理成本
Chip Huyen在P99大会上指出,模型训练是一次性成本,推理成本则反复发生,比例可达1:10至1:100。她建议关注首token延迟和goodput...
-
Pi Agent 源码解析(一):从调试环境到双层主循环
本文解析 Pi Agent 源码:先介绍调试环境搭建(安装依赖、下载模型目录、配置密钥、VS Code 断点),再重点讲解双层主循环——内层处理工具调用与...
-
图片一多首字就慢?用EPD拆开多模态推理三段路
多模态推理采用EPD拆分,将视觉编码、预填充、解码分队列调度,以缓解图片请求阻塞文字请求的队头阻塞。NVIDIA测试显示,图片密集负载下首字延迟最高快5倍...
-
众包征集关于数学目的、价值与本质的通用资源列表
陶哲轩发文征集关于数学目的、价值与本质的书籍和文章资源,以纠正公众对数学的简单化误解,并列举了相关经典著作、非正式链接及本人访谈写作,邀请读者在评论区补充更多资源。
-
VLA-Precision——用于在线RL的VLA非对称协同自举方法:以人工纠偏行为克隆提速、渐进价值校准稳策、相对优势更新防漂移
论文提出VLA-Precision框架,以解决真实世界VLA在线强化学习中的算法稳定性与系统效率瓶颈。算法层面提出ACoB,结合快速行为学习与渐进价值校准...
-
Kimi突发K2.8:性能逼近K3,百万上下文全员开放
月之暗面发布Kimi K2.8 Preview,综合性能接近旗舰K3,Coding与Agent能力提升,所有会员档位均支持1M上下文。其ARR从6月的3亿...