小红花·文摘
  • 首页
  • AI Tokens🪙
  • 排行榜🏆
  • 直播
  • FAQ
Kimi K3 模型结构(9):显存,把 2.8T 塞进 GPU

本文详解Kimi K3模型训练中的显存优化策略,通过账本形式分析权重、激活等内存占用,并介绍六项关键技术:均衡PP rank激活、统一激活管理器、MoE反向改写、AttnRes块复用、Pipeline ZeRO-2及P2P Muon,以显存换效率,实现2.8T参数的高效训练。

Kimi K3 模型结构(9):显存,把 2.8T 塞进 GPU

Java不加糖's Blog Java不加糖's Blog · 2026-09-05T20:30:00Z
通过专用GPU内核生成实现极致效率

Proteus系统利用智能体自动生成GPU专用内核,针对不同模型和运行时形状实现极致性能优化。通过严格验证、防作弊检查及知识层管理,Proteus为Qwen 3.5 122B生成的内核比vLLM快1.8至5.2倍。核心挑战在于验证与上下文管理,而非生成本身,确保内核可靠且高效。

通过专用GPU内核生成实现极致效率

Databricks Databricks · 2026-09-04T20:00:00Z
CPU + GPU:为何AI平台工程是一个异构基础设施问题

AI基础设施不应只关注GPU,而应视为CPU、内存、存储和网络协同工作的整体系统。平台团队需匹配各阶段资源需求,而非孤立优化GPU。通过Kubernetes及DRA等工具统一编排异构资源,并观察CPU到GPU的完整链路,以识别瓶颈。设计应围绕整个系统,而非单一组件,才能将算力转化为有效AI基础设施。

CPU + GPU:为何AI平台工程是一个异构基础设施问题

Cloud Native Computing Foundation Cloud Native Computing Foundation · 2026-09-04T11:00:00Z
Kubernetes虽已成熟,但AI使其再度令人望而生畏

Kubernetes虽成熟,但首次采用仍具挑战,尤其AI工作负载带来GPU、突发流量等新需求。文章指出,启动集群容易,难在管理生产环境中的AI任务,如作业放置、GPU利用率和稳定性。建议团队先试用托管服务,再决定自建平台,以降低风险并适应新运维模式。

Kubernetes虽已成熟,但AI使其再度令人望而生畏

Cloud Native Computing Foundation Cloud Native Computing Foundation · 2026-09-04T11:00:00Z
英伟达将正式为旧款GPU带来DLSS 5——但不会给玩家完全控制权

英伟达确认DLSS 5将扩展支持RTX 40系列显卡,但暂不支持更旧的RTX 30/20系列。玩家只能使用简单的开关切换,无法像模组那样精细控制画质滑块。公司未确认此前宣布的游戏是否仍会搭载该技术,暗示部分开发商可能因争议而退出。

英伟达将正式为旧款GPU带来DLSS 5——但不会给玩家完全控制权

The Verge The Verge · 2026-09-04T01:49:25Z
将GPU推理冷启动从8分钟缩短至不到1分钟

本文分析了GPU节点上大语言模型冷启动的瓶颈,发现从Pod创建到首次推理响应需8分钟,涉及六个阶段。主要问题包括CUDA内核重复编译(小模型占65%时间)和S3权重下载效率低(大模型占92%)。通过配置优化(如缓存编译、并行拉取)可将启动时间缩短80-93%,冷节点降至约5分钟,显著提升GPU利用率和扩展效率。

将GPU推理冷启动从8分钟缩短至不到1分钟

The New Stack The New Stack · 2026-09-03T18:30:00Z
英伟达备受争议的DLSS 5将于9月3日发布,且需要强大的GPU性能

英伟达DLSS 5于9月3日随《NBA 2K27》发布,仅支持RTX 50系列显卡。该技术用AI增强游戏画质,但早期演示因改变角色外观遭批评。正式版效果较温和,性能损耗达50-60%,目前仅此一款游戏支持。

英伟达备受争议的DLSS 5将于9月3日发布,且需要强大的GPU性能

The Verge The Verge · 2026-09-01T13:00:00Z
【Triton 教程】triton_language.floor

Triton是一种基于Python的并行编程语言和编译器,用于高效编写自定义DNN计算内核,并在现代GPU上实现最大吞吐量。文章还介绍了其函数triton.language.floor,用于逐元素向下取整,参数为Block类型的输入值。

【Triton 教程】triton_language.floor

HyperAI超神经 HyperAI超神经 · 2026-08-31T11:03:06Z
EKS 上的 GPU 工作负载:节点、网络与高性能存储的架构实践

本文介绍EKS上GPU工作负载的架构实践,涵盖计算节点、网络邻近性和高性能存储三层。重点包括:EFA多网卡配置(含p6-b300特殊拓扑)、四种定价模式、基于AWS原生拓扑标签的调度、FSx for Lustre与S3 Express One Zone存储选型,以及Terraform模块实现,旨在提升分布式训练性能。

EKS 上的 GPU 工作负载:节点、网络与高性能存储的架构实践

亚马逊AWS官方博客 亚马逊AWS官方博客 · 2026-08-31T07:19:13Z
LEANN 的重算式向量索引

LEANN是一种重算式向量索引,不存储向量,仅存剪枝图,搜索时实时计算向量,将索引从201GB降至6GB,节省97%存储。它通过跨进程通信、图剪枝和两级搜索优化性能,适合个人数据索引,但需GPU支持,延迟在RAG场景下可比,传统索引装得下时无需使用。

LEANN 的重算式向量索引

阁子 阁子 · 2026-08-31T06:20:00Z
在流量高峰前扩容:Kubernetes上GPU工作负载的预测性自动扩缩容

Adobe工程师因GPU服务在流量高峰时反应式扩缩容过慢导致故障,开发了预测性Kubernetes控制器。它每60秒用Bi-LSTM模型预测未来10分钟需求,结合突发检测和渐进式扩缩(每分钟20个Pod),提前预热容量。验证显示预测准确率85%,23项检查全通过,能提前11分钟捕获高峰,且无需额外基础设施,与HPA共存。

在流量高峰前扩容:Kubernetes上GPU工作负载的预测性自动扩缩容

Cloud Native Computing Foundation Cloud Native Computing Foundation · 2026-08-28T11:30:00Z
为什么GPU调度很重要:从调度全景到验证HAMi互斥语义

GPU调度需依次解决三个层次的问题:选择节点、选择卡、确定卡在机器内的位置。本文基于三层框架分析HAMi v2.10的策略链,并澄清常见误解:互斥并非排斥其他互斥Pod,而是要求独占整张卡。结论通过可在笔记本上复现的关键实验得出。

为什么GPU调度很重要:从调度全景到验证HAMi互斥语义

云原生 云原生 · 2026-08-28T07:38:12Z
HuggingFace被曝卖身英伟达:129亿美元!全球最大AI开源平台改姓黄

英伟达拟以129亿美元收购AI模型托管平台Hugging Face,估值三年翻近三倍。此举旨在巩固其“卖铲人”地位,通过开源生态拉动GPU需求,并应对闭源实验室自研芯片的挑战。Hugging Face曾拒绝英伟达投资,现选择卖身,凸显英伟达财力雄厚及战略布局。

HuggingFace被曝卖身英伟达:129亿美元!全球最大AI开源平台改姓黄

量子位 量子位 · 2026-08-28T01:40:22Z

亚马逊云科技与英伟达扩大合作,计划在全球基础设施中新增200万颗英伟达GPU,深化AI工厂、CPU、网络等领域合作。此举补充自研芯片,提供灵活算力选择,并引入Vera CPU支持Agentic AI工作负载,助力客户加速AI开发。

亚马逊云科技将在全球基础设施中新增部署200万颗英伟达GPU

全球TMT-美通国际 全球TMT-美通国际 · 2026-08-27T10:15:16Z
苹果发布基于2纳米制程的M6芯片 同时发布M5 Ultra芯片 最高80颗GPU核心

苹果发布M5 Ultra和M6芯片,M5 Ultra支持最高80核GPU和512GB内存,可本地运行数千亿参数大模型;M6基于2纳米制程,AI性能提升。新款Mac mini和Mac Studio将搭载上市。

苹果发布基于2纳米制程的M6芯片 同时发布M5 Ultra芯片 最高80颗GPU核心

蓝点网 蓝点网 · 2026-08-25T13:43:14Z
在 Amazon Linux 2023 上部署 GPU 容器环境:快速入门指南

本文介绍在Amazon Linux 2023上搭建GPU容器环境的完整流程,包括安装NVIDIA驱动、Docker及NVIDIA Container Toolkit,并涵盖验证方法、最佳实践(如数据目录迁移、资源限制)和常见故障排除,帮助用户快速部署GPU容器用于深度学习等任务。

在 Amazon Linux 2023 上部署 GPU 容器环境:快速入门指南

亚马逊AWS官方博客 亚马逊AWS官方博客 · 2026-08-25T03:50:35Z

本文介绍Rust生态多项进展:Rust GPU编译框架接入rustc与LLVM,实现多厂商GPU高性能且安全;Cargo nightly优化target目录体积,serde缩减约29.8%;Fyrox引擎初步支持wgpu后端,可选适配Vulkan等API;diffable 0.5.0新增自动微分,用类型表达微分几何结构。

【Rust日报】2026-08-19 Rust GPU Offload:可移植、安全且高性能

Rust.cc Rust.cc · 2026-08-24T23:27:12Z
微软正在为Windows 11开发新的内存管理功能 用户可以手动分配不同任务内存量

微软正在为Windows 11开发新内存管理功能,允许用户按需分配内存给GPU或NPU,适用于CPU/GPU/NPU共享内存的统一内存架构设备,如AI PC。该功能目前处于早期开发阶段,测试版已出现相关字符串,旨在优化游戏和本地AI任务的内存使用,未来对AI PC用户尤为重要。

微软正在为Windows 11开发新的内存管理功能 用户可以手动分配不同任务内存量

蓝点网 蓝点网 · 2026-08-24T06:14:32Z
8GB显存如何跑35B:深入理解FreeToken的专家缓存与CPU-GPU协同

FreeToken通过专家缓存与CPU-GPU协同,在8GB显存上运行35B MoE模型。它将完整专家池存于内存,显存作为LRU缓存,按q*策略动态分配未命中专家至GPU或CPU,Prefill用双缓冲隐藏传输,并优化Agent状态缓存。相比llama.cpp静态卸载,FreeToken更高效,但仅适用于MoE模型。

8GB显存如何跑35B:深入理解FreeToken的专家缓存与CPU-GPU协同

Nicksxs's Blog Nicksxs's Blog · 2026-08-23T12:41:00Z
【Triton 教程】triton_language.fdiv

Triton是一种基于Python的并行编程语言和编译器,用于高效编写自定义DNN计算内核,并在现代GPU上实现最大吞吐量。文章还介绍了其在线教程及函数triton.language.fdiv(x,y),用于计算x和y的逐元素快速除法。

【Triton 教程】triton_language.fdiv

HyperAI超神经 HyperAI超神经 · 2026-08-22T09:38:16Z
  • <<
  • <
  • 1 (current)
  • 2
  • 3
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码