本文详解Kimi K3模型训练中的显存优化策略,通过账本形式分析权重、激活等内存占用,并介绍六项关键技术:均衡PP rank激活、统一激活管理器、MoE反向改写、AttnRes块复用、Pipeline ZeRO-2及P2P Muon,以显存换效率,实现2.8T参数的高效训练。
Proteus系统利用智能体自动生成GPU专用内核,针对不同模型和运行时形状实现极致性能优化。通过严格验证、防作弊检查及知识层管理,Proteus为Qwen 3.5 122B生成的内核比vLLM快1.8至5.2倍。核心挑战在于验证与上下文管理,而非生成本身,确保内核可靠且高效。
AI基础设施不应只关注GPU,而应视为CPU、内存、存储和网络协同工作的整体系统。平台团队需匹配各阶段资源需求,而非孤立优化GPU。通过Kubernetes及DRA等工具统一编排异构资源,并观察CPU到GPU的完整链路,以识别瓶颈。设计应围绕整个系统,而非单一组件,才能将算力转化为有效AI基础设施。
Kubernetes虽成熟,但首次采用仍具挑战,尤其AI工作负载带来GPU、突发流量等新需求。文章指出,启动集群容易,难在管理生产环境中的AI任务,如作业放置、GPU利用率和稳定性。建议团队先试用托管服务,再决定自建平台,以降低风险并适应新运维模式。
英伟达确认DLSS 5将扩展支持RTX 40系列显卡,但暂不支持更旧的RTX 30/20系列。玩家只能使用简单的开关切换,无法像模组那样精细控制画质滑块。公司未确认此前宣布的游戏是否仍会搭载该技术,暗示部分开发商可能因争议而退出。
本文分析了GPU节点上大语言模型冷启动的瓶颈,发现从Pod创建到首次推理响应需8分钟,涉及六个阶段。主要问题包括CUDA内核重复编译(小模型占65%时间)和S3权重下载效率低(大模型占92%)。通过配置优化(如缓存编译、并行拉取)可将启动时间缩短80-93%,冷节点降至约5分钟,显著提升GPU利用率和扩展效率。
英伟达DLSS 5于9月3日随《NBA 2K27》发布,仅支持RTX 50系列显卡。该技术用AI增强游戏画质,但早期演示因改变角色外观遭批评。正式版效果较温和,性能损耗达50-60%,目前仅此一款游戏支持。
Triton是一种基于Python的并行编程语言和编译器,用于高效编写自定义DNN计算内核,并在现代GPU上实现最大吞吐量。文章还介绍了其函数triton.language.floor,用于逐元素向下取整,参数为Block类型的输入值。
本文介绍EKS上GPU工作负载的架构实践,涵盖计算节点、网络邻近性和高性能存储三层。重点包括:EFA多网卡配置(含p6-b300特殊拓扑)、四种定价模式、基于AWS原生拓扑标签的调度、FSx for Lustre与S3 Express One Zone存储选型,以及Terraform模块实现,旨在提升分布式训练性能。
LEANN是一种重算式向量索引,不存储向量,仅存剪枝图,搜索时实时计算向量,将索引从201GB降至6GB,节省97%存储。它通过跨进程通信、图剪枝和两级搜索优化性能,适合个人数据索引,但需GPU支持,延迟在RAG场景下可比,传统索引装得下时无需使用。
Adobe工程师因GPU服务在流量高峰时反应式扩缩容过慢导致故障,开发了预测性Kubernetes控制器。它每60秒用Bi-LSTM模型预测未来10分钟需求,结合突发检测和渐进式扩缩(每分钟20个Pod),提前预热容量。验证显示预测准确率85%,23项检查全通过,能提前11分钟捕获高峰,且无需额外基础设施,与HPA共存。
GPU调度需依次解决三个层次的问题:选择节点、选择卡、确定卡在机器内的位置。本文基于三层框架分析HAMi v2.10的策略链,并澄清常见误解:互斥并非排斥其他互斥Pod,而是要求独占整张卡。结论通过可在笔记本上复现的关键实验得出。
英伟达拟以129亿美元收购AI模型托管平台Hugging Face,估值三年翻近三倍。此举旨在巩固其“卖铲人”地位,通过开源生态拉动GPU需求,并应对闭源实验室自研芯片的挑战。Hugging Face曾拒绝英伟达投资,现选择卖身,凸显英伟达财力雄厚及战略布局。
亚马逊云科技与英伟达扩大合作,计划在全球基础设施中新增200万颗英伟达GPU,深化AI工厂、CPU、网络等领域合作。此举补充自研芯片,提供灵活算力选择,并引入Vera CPU支持Agentic AI工作负载,助力客户加速AI开发。
苹果发布M5 Ultra和M6芯片,M5 Ultra支持最高80核GPU和512GB内存,可本地运行数千亿参数大模型;M6基于2纳米制程,AI性能提升。新款Mac mini和Mac Studio将搭载上市。
本文介绍在Amazon Linux 2023上搭建GPU容器环境的完整流程,包括安装NVIDIA驱动、Docker及NVIDIA Container Toolkit,并涵盖验证方法、最佳实践(如数据目录迁移、资源限制)和常见故障排除,帮助用户快速部署GPU容器用于深度学习等任务。
本文介绍Rust生态多项进展:Rust GPU编译框架接入rustc与LLVM,实现多厂商GPU高性能且安全;Cargo nightly优化target目录体积,serde缩减约29.8%;Fyrox引擎初步支持wgpu后端,可选适配Vulkan等API;diffable 0.5.0新增自动微分,用类型表达微分几何结构。
微软正在为Windows 11开发新内存管理功能,允许用户按需分配内存给GPU或NPU,适用于CPU/GPU/NPU共享内存的统一内存架构设备,如AI PC。该功能目前处于早期开发阶段,测试版已出现相关字符串,旨在优化游戏和本地AI任务的内存使用,未来对AI PC用户尤为重要。
FreeToken通过专家缓存与CPU-GPU协同,在8GB显存上运行35B MoE模型。它将完整专家池存于内存,显存作为LRU缓存,按q*策略动态分配未命中专家至GPU或CPU,Prefill用双缓冲隐藏传输,并优化Agent状态缓存。相比llama.cpp静态卸载,FreeToken更高效,但仅适用于MoE模型。
Triton是一种基于Python的并行编程语言和编译器,用于高效编写自定义DNN计算内核,并在现代GPU上实现最大吞吐量。文章还介绍了其在线教程及函数triton.language.fdiv(x,y),用于计算x和y的逐元素快速除法。
完成下面两步后,将自动完成登录并继续当前操作。