OpenCost与llm-d集成,为Kubernetes上的LLM推理提供成本可见性。通过vLLM指标计算每模型和每token成本,区分分配成本(含闲置GPU)与使用成本(仅活跃推理),帮助平台团队评估自建与SaaS成本、优化GPU利用率。支持按命名空间和团队计费,已发布OpenCost 1.121.0。
DigitalOcean在Kimi K3发布首日即完成部署,选用NVIDIA HGX B300和AMD MI350X GPU,通过llm-d堆栈优化性能。团队解决了动态工具支持、流式响应偏差、温度参数限制等问题,并通过Moonshot的KVV基准验证,确保模型性能达标。K3现已在DigitalOcean推理引擎上线,支持无服务器推理和智能路由。
IBM、Red Hat和Google Cloud在2026年KubeCon欧洲大会上宣布将开源推理框架llm-d捐赠给云原生计算基金会(CNCF)。llm-d旨在通过Kubernetes简化大语言模型的推理,支持多种加速器,提高效率并降低成本。该框架提供可重复的基准测试和兼容性,推动AI推理成为云原生基础设施的重要组成部分。
llm-d项目已被纳入云原生计算基金会(CNCF)沙箱,旨在推动Kubernetes及AI基础设施的发展。该项目由Red Hat、Google、IBM等公司合作创建,目标是实现硬件无关的最先进推理性能。llm-d提供了一个Kubernetes原生的分布式推理框架,解决了传统服务路由和自动扩展的不足,确保高效的AI服务,并致力于建立开放的基准测试标准。
完成下面两步后,将自动完成登录并继续当前操作。