2025 年终总结:当时只道是寻常

2025 年终总结:当时只道是寻常

💡 原文中文,约4200字,阅读约需10分钟。
📝

内容提要

作者回顾2025年:年初被DeepSeek震撼,为vLLM贡献推理支持代码,并探索用torch.distributed替代Ray简化分布式推理。文中讨论AI资本支出与预训练瓶颈,认为Agent未带来基础设施变革。生活方面,记录日本、武汉、加州旅行,推荐游戏《燕云十六声》,并感慨逝去猫咪,提醒珍惜当下。

🔎

延伸解读

vLLM 推理支持演进

作者在年初为 vLLM 贡献了 reasoning 内容支持,设计了一个通用的 reasoning parser,以便未来其他推理模型复用。该 PR 在一周内被合并,且设计沿用至 v1 版本。这反映了开源社区在推理模型支持上的快速迭代,也说明通用化设计对框架演进的重要性。

分布式推理后端之争

作者尝试用 torch.distributed 替代 Ray 作为 vLLM 的分布式推理后端,认为在 Kubernetes 环境下更简洁,并建议将调度完全交给 Kubernetes。同时提到 SGLang 社区有反向需求,希望增加 Ray 支持。这体现了推理框架在后端选择上的分歧,也反映了对简化部署的追求。

AI 资本支出与预训练瓶颈

文章指出美国科技巨头 2025 年 AI 基础设施资本支出达 3000 亿美元,但资本支出是滞后指标,数据中心建设早于预训练,且预训练提升并非线性。作者认为预训练可能触及瓶颈,但资本支出会因建设周期惯性延续。这提醒读者理性看待资本支出对 AI 发展的预示作用。

Agent 基础设施的冷静思考

作者认为 Agent 虽热,但并未带来基础设施变革,其需求(如安全、可观测性)仍停留在应用层,未触及底层。对比历史,业务复杂度提升不一定引发基础设施革命。因此,AI infra 的机会仍集中在计算和存储,而非全新的基础设施。这为关注 Agent 基础设施的读者提供了审慎视角。

Q&A

作者在2025年对DeepSeek有什么印象?

作者在2025年1月被DeepSeek震撼,并部署了小参数版本进行体验。

作者为vLLM贡献了什么代码?

作者为vLLM提交了PR,支持DeepSeek R1的reasoning content,并设计了一个通用的reasoning parser,该PR在一周内被合并。

作者为什么想用torch.distributed替代Ray?

作者认为Ray对于静态的模型推理服务过于复杂,而torch.distributed更简单,尤其在Kubernetes环境下更方便。

作者如何看待AI资本支出与预训练瓶颈的关系?

作者认为资本支出是滞后指标,数据中心建设早于预训练,但预训练提升并非线性,即使预训练停滞,资本支出也可能因惯性延续。

作者认为Agent是否会带来基础设施变革?

作者认为Agent的需求(如安全、可观测性)尚未达到需要基础设施变革的程度,AI应用仍只是计算密集,基础设施机会仍集中在计算和存储。

作者在2025年去了哪些地方旅游?

作者去了日本大阪、中国武汉和美国加州。

作者推荐了什么游戏?为什么?

作者推荐《燕云十六声》,因为其剧情和玩法设计不错,是少数让作者玩得下去的MMO游戏。

作者在文章结尾表达了什么感悟?

作者因去世的猫回忆起“当时只道是寻常”,提醒读者珍惜眼前。

🏷️

标签

➡️

继续阅读