旭化成微电子的无磁芯电流传感器CZ39/CZ3K系列被Microchip采用,用于其基于AI/ML的电弧故障检测参考设计。该设计结合Microchip的dsPIC33A DSC,实现高精度、高可靠性检测。传感器具备100纳秒高速响应和低噪声性能,双方工程团队紧密合作开发验证。
本文介绍GitHub高级开发者倡导者Andrea Griffiths的背景与使命。她拥有十余年开发者工具经验,从军队和建筑管理转行软件开发,致力于让先进技术更易用。文章还提及她通过GitHub全球项目推动创新和开源支持,并列举了AI与ML相关主题,如交互式画布、代码审查改进及跨仓库文档自动化。
Volcano是专为高性能计算和AI/ML工作负载设计的Kubernetes云原生批处理调度器。其插件集成到可扩展的Kubernetes网页UI Headlamp中,方便用户查看工作负载状态、队列行为和调度细节,简化资源管理并提高操作效率。未来可能会增加Prometheus集成和更丰富的调度洞察。
Volcano是专为高性能计算和AI/ML工作负载设计的Kubernetes云原生批处理调度器。Headlamp是可扩展的Kubernetes网页UI,支持插件系统。Volcano插件将核心资源整合到Headlamp中,便于用户检查工作负载状态、队列行为和调度细节,提升操作和故障排除的效率。
随着AI、边缘计算和电信工作负载在Kubernetes上的普及,硬件管理需求不断增加。设备管理工作组通过动态资源分配(DRA)优化GPU、TPU等硬件的配置和共享,提供灵活的API以支持复杂的硬件需求。此外,工作组关注设备故障检测和多节点设备建模,以提升Kubernetes对AI/ML等现代工作负载的支持。
代理人工智能为SRE、平台工程师和AI/ML团队提供了机遇,但仅依赖生成模型无法满足生产系统需求。实现可靠的自主决策需依赖实时系统数据和控制层,以确保可扩展性和稳定性。
Kubernetes v1.35版本增强了AI/ML操作的可预测性,推出了工作负载感知调度、稳定的Pod资源调整和更安全的配置输出,旨在简化操作并提高资源利用率。
Kubernetes 1.35 引入了“就地重启所有容器”功能,允许高效重置 Pod 状态,特别适合 AI/ML 工作负载。此功能避免了 Pod 的删除和重建,提升了系统灵活性和鲁棒性。启用 RestartAllContainersOnContainerExits 特性后,开发者可更专注于核心逻辑,简化故障处理。
云原生计算基金会发布Kubernetes 1.35版本“Timbernetes”,重点优化AI/ML工作负载。新增In-Place Pod Resize功能,支持在不重启容器的情况下调整资源。引入Gang Scheduling、PodGroup API和改进的HPA容忍度,简化证书管理。Ingress NGINX控制器将于2026年3月停止维护,建议迁移至Gateway API。
米歇尔·布拉什是一名站点可靠性工程师,专注于分析系统故障并降低风险。尽管科技行业面临挑战,她仍对未来持乐观态度,并鼓励儿子学习计算机科学。她指出,随着AI/ML的发展,工程师的工作将变得更加复杂,需求也将增加,因此需要掌握系统思维、可靠性工程和应对复杂性的能力。
Pranav Nambiar加入DigitalOcean,旨在推动创新并支持建设者。他领导AI/ML和PaaS团队,致力于简化云计算,帮助客户充分利用现代技术。他认为DigitalOcean的基础、影响力和文化使其成为理想之地。
云原生与Kubernetes AI日旨在提升Kubernetes在AI/ML和高性能计算中的应用,面向各级从业者,提供最佳实践和解决方案,促进MLOps与云原生AI项目的合作。今年主题为“代理”,包括10个完整会议和4个快速演讲,参与者可与专家交流,了解最新工具和成功案例。
DigitalOcean推出了支持GPU的Droplet类型和自动缩减节点至零的新Kubernetes功能,优化了AI/ML工作负载,降低了闲置节点的计算费用,并提升了基础设施的灵活性和效率。同时,新数据中心ATL1已投入使用,增强了服务性能。
Kubernetes在处理AI/ML工作负载时面临设备故障管理的挑战,因这些工作负载依赖专用硬件,故障会显著影响性能。目前Kubernetes对设备故障的支持不足,缺乏有效的处理机制。文章探讨了不同故障模式及其解决方案,并强调了社区在改进设备故障管理方面的努力。
Kubeflow社区因简化Kubernetes中的AI/ML体验而快速发展,提供端到端解决方案。在KubeCon + CloudNativeCon上,用户和贡献者分享技术与最佳实践。Kubeflow 1.10发布了新功能,包括模型注册的新UI和超参数优化,社区积极展示其在AI/ML中的应用。
AWS 云基础设施日将于2025年5月22日举行,展示计算、AI/ML、存储和网络领域的最新创新。活动将通过多个平台直播,适合技术决策者和开发人员,提供深入的技术洞察和实践演示。
使用AI/ML技术的组织需系统追踪模型生命周期的碳足迹,并实施最佳实践以降低能耗。主要挑战在于缺乏标准化计算方法和碳足迹测量的复杂性。最佳实践包括选择高效模型、优化复杂性、使用节能硬件和云托管。工具如CodeCarbon和MLCarbon可帮助追踪能耗,云平台如GCP和AWS也提供可持续性支持。
DocSpiral平台通过人机协作解决特定领域图像文档中结构化数据提取的问题。该平台采用螺旋设计,减少人工干预,提高模型训练效率,标注时间减少41%,并在多个训练迭代中保持性能提升,促进图像密集型领域的AI/ML模型开发。
SAP Databricks已在AWS上正式推出,作为SAP Business Data Cloud的全托管服务,简化了AI和分析流程,支持企业在SAP平台内直接处理数据。通过Delta Sharing,SAP数据可安全共享,支持多种AI/ML应用,提升数据利用效率。
AWS用户组多伦多首次聚会回顾了2024年AWS re:Invent大会,分享了云计算、AI/ML和数据库等最新动态。参与者积极提问,讨论热烈,展现了社区精神。未来将继续举办活动,欢迎更多人参与。
完成下面两步后,将自动完成登录并继续当前操作。