本文探讨了Volcano模型在执行层的应用,重点分析了Trino与PostgreSQL的对比。核心内容包括通过pull语义驱动子算子、阻断pipeline的算子,以及Trino在Volcano框架下的批量化改造。文章还介绍了算子的接口、Pipeline与Pipeline Breaker的概念,以及PostgreSQL的执行机制,最后讨论了Volcano在OLAP中的局限性与演进。
Volcano是专为高性能计算和AI/ML工作负载设计的Kubernetes云原生批处理调度器。其插件集成到可扩展的Kubernetes网页UI Headlamp中,方便用户查看工作负载状态、队列行为和调度细节,简化资源管理并提高操作效率。未来可能会增加Prometheus集成和更丰富的调度洞察。
Volcano是专为高性能计算和AI/ML工作负载设计的Kubernetes云原生批处理调度器。Headlamp是可扩展的Kubernetes网页UI,支持插件系统。Volcano插件将核心资源整合到Headlamp中,便于用户检查工作负载状态、队列行为和调度细节,提升操作和故障排除的效率。
随着大型语言模型的发展,Kubernetes成为智能系统的重要平台。新功能如Volcano v1.14、Kthena v0.3.0和AgentCube提升了资源调度效率,简化了大模型部署,并支持异构自动扩展,推动AI基础设施进步。
Volcano v1.14发布,提升AI调度能力,支持多调度器架构和Agent Scheduler,满足批量计算与延迟敏感需求。增强网络拓扑感知,支持通用操作系统,集成昇腾vNPU,扩展多集群能力,改善用户体验。
Kthena是Volcano社区推出的子项目,旨在为全球开发者和MLOps工程师提供高效的云原生大语言模型推理调度解决方案。它通过拓扑感知调度和智能路由优化GPU/NPU资源利用,降低延迟,简化Kubernetes上大语言模型的部署。Kthena支持多模型管理和动态扩展,提高AI生命周期的整体效率。
AgentCube是基于Volcano的AI智能体编排层,旨在解决Kubernetes在高并发、低延迟AI工作负载中的不足。它通过预热池机制加速启动,提升调度效率,并引入会话管理和Serverless弹性伸缩,支持多种Agent框架,推动AI基础设施发展。
Volcano推出Kthena,一个专为Kubernetes设计的高性能LLM推理调度系统,旨在提高GPU/NPU资源利用率,简化多模型管理,解决资源利用率低、延迟与吞吐量难以兼顾的问题,推动云原生AI生态发展。
Volcano v1.13版本发布,增强了大模型训练与推理调度能力,支持LWS、Cron任务管理和网络拓扑发现,提升了AI计算框架的兼容性,简化了复杂工作负载管理,旨在提供高效稳定的计算平台。
Kong在2025年API峰会上发布了名为Volcano的开源SDK,旨在简化AI代理的开发。该SDK采用MCP原生方法,支持多种模型,能够自动生成订单。Kong希望通过开源Volcano为开发者提供更好的工具,促进MCP代理的构建。
iFLYTEK在2025年KubeCon + CloudNativeCon中国大会上展示了利用Volcano优化大规模AI模型训练的案例,通过弹性调度和多租户隔离,提高了GPU利用率,降低了基础设施成本,加快了训练速度。
批处理在现代数据处理和机器学习中至关重要。Kubernetes虽然最初用于长时间运行的服务,但现已支持批处理工作负载。本文探讨了Kubernetes上的批调度及其挑战,并比较了三种开源工具:Apache YuniKorn、Volcano.sh和Kueue,以有效管理资源和任务依赖。选择合适的工具可提升Kubernetes的批处理能力。
Volcano v1.11更新聚焦于AI与大数据,推出网络拓扑感知调度和多集群AI作业调度等新特性,显著提升训练与推理性能,优化资源利用率,支持动态资源分配,确保在线业务高可用性,成为云原生批量计算的新标杆。
Volcano推出云原生混部解决方案,通过资源隔离与共享提升资源利用率。在线和离线业务混合部署在同一集群,利用在线业务的波动动态分配资源。支持多种调度策略和Qos模型,保障在线业务优先级。方案已在华为终端云应用,提高了资源利用率和调度效率。未来将增强OS接口扩展性,支持更多操作系统。
Volcano是CNCF首个云原生批量计算项目,支持AI和大数据等高性能计算。最新v1.10.0版本新增队列优先级、细粒度GPU管理、Pod调度准备性和Sidecar容器调度等功能,提升安全性和性能,并兼容Kubernetes v1.30。优化了GPU监控和helm chart安装,提升资源利用效率和用户体验。
本文介绍了如何制作和推送nccl-test镜像,并使用Volcano Job运行nccl-test进行测试。同时还提供了清理环境和解决常见问题的方法。
Apache Spark的Kubernetes Operator简化了在Kubernetes上运行Spark应用程序的过程,使用自定义资源指定、运行和显示应用程序状态。支持使用volcano作为调度器解决Kubernetes调度器问题。
华为云社区发布了Volcano社区v1.9.0版本,增强了队列能力和调度稳定性,新增了弹性队列容量调度、亲和调度、GPU共享支持节点打分调度等特性,修复了问题,提升了稳定性。
Volcano是华为开源的基于Kubernetes的资源调度系统,支持gang scheduling、调度队列和硬件感知等特点。安装方法为添加Helm Repo并安装指定版本。相关CRD列表包括commands.bus.volcano.sh、jobflows.flow.volcano.sh等。Job Plugins可定制Pod运行,包括ssh、env和svc插件。配置Deployment使用Volcano控制资源使用,创建队列和Deployment。配置Job使用Volcano限流并发执行,创建Job并设置policies。
本文介绍了基于volcano实现节点真实负载感知调度的方案,通过volcano调度插件和Prometheus获取节点真实负载情况,提高集群负载均衡。开启负载感知调度需要安装Volcano和CCE云原生监控插件,并进行相关配置。验证结果表明开启负载感知调度后,负载能够调度到真实负载低的节点。
完成下面两步后,将自动完成登录并继续当前操作。