招商银行凭借在Kubernetes上统一AI训练与推理荣获CNCF终端用户案例研究竞赛奖

招商银行凭借在Kubernetes上统一AI训练与推理荣获CNCF终端用户案例研究竞赛奖

💡 原文英文,约1000词,阅读约需4分钟。
📝

内容提要

招商银行通过统一Kubernetes控制平面,整合Kueue、KEDA等工具,管理近万张异构加速卡,将平均利用率从35%提升至60%以上,推理成本降低超60%。其自研Twinkle框架支持五租户共享模型,资源使用减少80%,训练密度增五倍,获CNCF案例竞赛奖。

🔎

延伸解读

金融行业AI基础设施的挑战与应对

文章指出,金融行业AI应用扩展时,训练、推理和多租户微调对硬件需求差异显著:分布式训练需要稳定可预测的容量,而在线推理需快速弹性伸缩。招商银行通过统一Kubernetes控制平面,结合Kueue、KEDA、Prometheus、HAMi和Fluid,实现异构加速卡共享,同时解耦运行时,以应对这些竞争性需求。

利用率与成本的双重提升

招商银行将99%的加速卡资源纳入统一框架后,平均利用率从35%提升至60%以上,每百万token推理成本降低超60%。这表明通过软件创新(如Kueue的队列管理、KEDA的弹性伸缩)可显著优化硬件利用效率,为同类金融机构提供了可借鉴的实践路径。

多租户微调的资源优化策略

自研Twinkle框架支持五个LoRA租户共享一个基础模型实例,将基础模型副本从五个减至一个,使加速器资源使用减少80%,训练密度提升五倍。这一设计有效降低了多租户微调的资源开销,展示了在共享基础设施上实现高效多租户调度的可能性。

未来演进方向

招商银行计划在四个方向持续优化:动态调整多租户训练并发、结合利用率与队列状态进行单位成本管理、扩展KEDA实现可缩至零的Serverless推理,以及基于HAMi支持更多异构加速器。这些规划反映了AI基础设施向更精细、更弹性方向发展的趋势。

Q&A

招商银行在Kubernetes上统一AI训练与推理获得了什么奖项?

招商银行凭借在Kubernetes上统一AI训练与推理的实践,荣获了CNCF终端用户案例研究竞赛奖,该奖项在KubeCon + CloudNativeCon + OpenInfra Summit + PyTorch Conference China 2026上颁发。

招商银行如何实现AI训练与推理的统一管理?

招商银行构建了统一的Kubernetes控制平面,整合了Kueue、KEDA、Prometheus、HAMi和Fluid等工具,使AI训练、微调和在线推理能够共享近万张异构加速卡。

招商银行统一管理后,加速卡利用率和推理成本有何变化?

统一管理后,招商银行将99%的加速计算资源纳入框架,平均利用率从35%提升至60%以上,处理100万token的成本降低了超过60%。

招商银行自研的Twinkle训练框架有什么作用?

Twinkle训练框架支持多租户微调,默认允许五个LoRA租户共享一个基础模型实例,将基础模型副本从五个减少到一个,从而将加速器资源使用减少80%,训练密度提升五倍。

招商银行如何解决训练和推理对硬件需求不同的矛盾?

招商银行采用可组合架构,共享基础设施但解耦运行时:Kueue管理训练准入和队列,KEDA和Prometheus根据实时需求扩展在线推理,HAMi细粒度分配加速器容量,Fluid加速数据访问,从而满足不同工作负载的需求。

招商银行未来在AI基础设施方面有哪些规划?

招商银行计划在四个关键领域继续发展:动态调整多租户训练并发,结合利用率、队列状态和延迟信号进行基于单位成本的能力管理,扩展KEDA以实现可缩至零的无服务器推理,以及扩展HAMi对异构加速器的支持并增加更多训练和推理后端。

🏷️

标签

➡️

继续阅读