kagent项目最初在同一运行时中运行多个代理,但随着代理数量增加,出现了隔离、身份和访问控制等问题。为了解决这些问题,决定为每个代理创建独立的Kubernetes Pod和ServiceAccount。然而,代理的短暂性和动态特性使Pod不再是最佳选择。agent-substrate引入了新的控制层,管理AI代理的生命周期和调度,使代理能够在共享的执行工作者上运行,提高资源利用率。这一架构挑战了传统Kubernetes模型,重新思考了代理的身份、政策和可观察性。
本文介绍了华为云的Agent Harness在云原生托管架构中的应用,旨在通过轻量级虚拟化和自动化管理优化弹性、效率和运维,解决冷启动延迟、状态持久化和安全隔离等问题。该方案提升了资源利用率,支持快速启动和自动恢复,确保高并发下的安全性,构建高效、低成本的智能服务运行环境。
Decoupled DiLoCo是一种新型分布式架构,旨在提高大规模AI模型训练的效率和韧性。通过将训练任务分散到多个计算单元,系统能够在硬件故障时继续学习,避免通信延迟。该方法成功训练了120亿参数的模型,速度比传统方法快20倍,并支持不同代硬件的混合使用,提升计算资源利用率。
Claude Code引入了延迟加载工具机制,以优化API请求效率。工具分为始终加载和延迟加载两类,仅在需要时加载完整架构,节省令牌成本。核心工具ToolSearch支持精确选择和关键词搜索,确保用户在会话中使用必要工具,提高系统灵活性和资源利用率。
商汤在AI原生时代重塑算力集群架构,推出AI算力池和虚拟集群技术,以提升资源利用率和扩缩容效率,推动国产推理基础设施升级,助力AI产业发展。
本文介绍了AWS Network Firewall的多端点功能,简化了网络安全架构设计与运维管理。通过将多个VPC关联到单一防火墙实例,降低了成本和运维复杂度,提高了资源利用率。
Uber工程团队推出了uForwarder,这是一个开源的Apache Kafka推送代理,旨在提升高吞吐量事件流的可扩展性和效率。uForwarder简化了消费者逻辑,集中管理偏移量,隔离工作负载,并提供内置延迟处理,解决了Uber内部Kafka部署的多个挑战,成为主要的Kafka消费者选项,提升了资源利用率和性能一致性。
京东云推出云原生AI推理框架,解决传统推理系统的稳定性、资源利用率和性能瓶颈问题。该框架通过智能流量调度、自动弹性扩缩容和故障自愈机制,提升推理效率和资源利用率,短文吞吐提升超过120%,GPU资源节省约26%。
本文探讨了在复杂的分布式微服务架构中,通过轻量级服务隔离方法保障系统稳定性。提出了三种方案:应用拆分、使用Hystrix进行服务隔离和轻量级进程间服务隔离。最终选择轻量级进程间服务隔离方案,因其易于实施且能快速见效,适合在大促中应用。通过合理的分组和配置管理,提升了系统的高可用性和资源利用率。
本文介绍了一种针对AI计算集群的系统级容器方案,解决了GPU透传和驱动安装复杂性的问题。该方案支持Nvidia GPU透传、自动驱动注入及systemd-nspawn管理,兼容Docker与Rootless Podman,简化了集群部署与运维,提高了资源利用率。
在生产环境中,数据库优化是解决性能瓶颈的关键。优化过程包括识别瓶颈、提升查询速度和资源利用率,重点在于连接池管理、I/O性能、查询执行和架构设计。合理配置连接池和索引能显著提高性能,同时监测资源使用和定期更新统计信息也很重要。
Volcano推出Kthena,一个专为Kubernetes设计的高性能LLM推理调度系统,旨在提高GPU/NPU资源利用率,简化多模型管理,解决资源利用率低、延迟与吞吐量难以兼顾的问题,推动云原生AI生态发展。
KAI调度器是NVIDIA为Kubernetes开发的调度器,专为优化大规模AI工作负载而设计。它能够理解AI任务特性,提高资源利用率和调度质量,支持多GPU和多节点训练,适用于数据中心和云平台。
随着AI模型规模的扩大,AI编译器成为硬件与应用之间的关键枢纽,提升计算性能和资源利用率。12月27日,第8期Meet AI Compiler技术沙龙将在上海举行,专家将分享软件栈设计、算子开发及性能优化等内容,探讨低延迟大模型推理和融合算子开发等技术。欢迎报名参与。
亚马逊云科技的HAMi中间件通过支持多种加速设备(如Neuron芯片),实现了异构算力的统一管理与调度。其核心特性包括双重粒度共享和策略性拓扑调度,显著提升资源利用率并降低运维复杂度。HAMi v2.7.0深度集成Neuron芯片,优化调度策略,确保高效算力调度体验。
在Databricks,我们开发了智能客户端负载均衡系统,优化Kubernetes中的服务间通信,解决了默认负载均衡的性能和可靠性问题。通过实时服务发现,实现了基于应用层的负载均衡,降低了尾延迟,提高了资源利用率,并支持更复杂的负载均衡策略。
Fluid compute是一种高效的无服务器计算方法,结合主动CPU定价,客户可节省高达95%的成本。Vercel通过改进基础设施和安全传输协议,实现流式响应,优化资源利用率,支持Python等多种语言。
Kubernetes v1.33正式将就地Pod调整功能升级为Beta,支持在运行中的Pod中动态调整CPU和内存资源,减少服务中断,提高资源利用率,增强了灵活性和稳定性,适用于状态应用和长时间运行的任务。
本研究提出了KAITIAN,一个新的分布式通信框架,旨在解决嵌入式人工智能系统中异构加速器的互操作性问题。KAITIAN通过统一抽象层和优化的通信库,提高了资源利用率和系统性能,实验表明训练时间缩短42%,同时保持模型准确性,增强了嵌入式AI应用的计算能力。
Kubernetes v1.33引入StorageCapacityScoring功能,通过节点存储容量信息优化Pod调度,支持选择存储容量最多或最少的节点,用户可配置节点优先级以提高资源利用率。
完成下面两步后,将自动完成登录并继续当前操作。