内容提要
本期《Road to KubeCon》聚焦KubeCon北美大会前瞻:Stacklok CEO呼吁构建云原生智能体运行框架以解决本地框架扩展难题;卓驭科技用Koordinator将GPU分配率提升至95%以上;OpenSSF与CNCF合办安全挑战赛;Atlassian分享将事件到指标延迟从40秒降至10秒的实践;ArgoCon北美2026定于11月9日举行,聚焦Argo CD 4.0愿景。
延伸解读
智能体运行框架的云原生转型
Stacklok CEO Craig McLuckie 指出,当前大多数智能体运行框架(harness)过于本地化,仅服务于单个开发者的笔记本电脑,难以扩展至数百个会话,且会话易中断、体验无法跨客户端或设备迁移。他主张构建云原生智能体运行框架,将智能体循环与周边基础设施和服务分离。这一观点借鉴了 Kubernetes 的教训:容器中的单体仍是单体,该教训同样适用于智能体。
Koordinator 提升 GPU 利用率的实践
中国自动驾驶公司卓驭科技使用 CNCF 沙箱项目 Koordinator 调度微服务、AI 和大数据工作负载,解决了默认 Kubernetes 调度器导致的性能低效问题。通过 Koordinator,其 GPU 分配率提升至 95% 以上,整体 GPU 利用率超过 55%。该案例表明默认调度器存在启动失败、GPU 利用率低、GPU 闲置和分布式作业调度等问题,而 Koordinator 在生产环境中表现良好。
Atlassian 事件到指标延迟优化
Atlassian 的自动事件创建系统 AutoHOT 基于 OpenTelemetry、Apache Kafka 和 Apache Flink 构建在 Kubernetes 上,每天处理数十亿事件。其事件到指标延迟从超过 40 秒降至 10 秒以下。但高级工程经理 Deepak Biswas 坦言这并非完美成功,召回率在 8 月降至 64%,团队仍在微调。该案例为构建自动事件检测和响应工作流提供了有用蓝图。
Q&A
Stacklok CEO 为什么认为现有的 AI 智能体运行框架不够用?
因为大多数运行框架过于本地化,只为单个开发者在笔记本电脑上使用而构建,无法很好地扩展到服务数百个会话,会话容易中断,且难以在不同客户端或设备间迁移体验。
什么是云原生智能体运行框架?
根据 Stacklok CEO 的观点,云原生智能体运行框架是一种分布式应用,它将智能体循环与周围的基础设施和服务分离,从而解决本地框架的扩展难题。
Kubernetes 的单体教训如何应用到 AI 智能体上?
Stacklok CEO 指出,Kubernetes 教会行业“容器中的单体仍然是单体”,这一教训同样适用于智能体:仅仅把智能体放在容器里并不能解决其架构上的单体问题,需要采用云原生分布式架构。
卓驭科技如何使用 Koordinator 提升 GPU 利用率?
卓驭科技在基于 Kubernetes 的环境中运行自动驾驶工作负载,但默认调度器限制了分配和利用率。通过使用 Koordinator,他们将 GPU 分配率提升到 95% 以上,整体 GPU 利用率提升到 55% 以上。
Atlassian 如何将事件到指标的延迟从 40 秒降低到 10 秒以下?
Atlassian 的检测平台 AutoHOT 结合了 OpenTelemetry、Apache Kafka 和 Apache Flink,运行在 Kubernetes 上,通过优化这些组件,将事件到指标的延迟从超过 40 秒降低到 10 秒以下。
ArgoCon 北美 2026 的主要议题是什么?
ArgoCon 北美 2026 是一个全天双轨活动,聚焦于改进软件交付、管理数据和机器学习管道以及实施渐进式交付,同时社区正在启动 Argo CD 4.0 的愿景规划。