小红花·文摘
  • 首页
  • AI Tokens🪙
  • 排行榜🏆
  • 直播
  • FAQ
CPU + GPU:为何AI平台工程是一个异构基础设施问题

AI基础设施不应只关注GPU,而应视为CPU、内存、存储和网络协同工作的整体系统。平台团队需匹配各阶段资源需求,而非孤立优化GPU。通过Kubernetes及DRA等工具统一编排异构资源,并观察CPU到GPU的完整链路,以识别瓶颈。设计应围绕整个系统,而非单一组件,才能将算力转化为有效AI基础设施。

CPU + GPU:为何AI平台工程是一个异构基础设施问题

Cloud Native Computing Foundation Cloud Native Computing Foundation · 2026-09-04T11:00:00Z
苹果群发邮件通知Mac软件开发者:已经没必要再适配英特尔CPU

苹果通知Mac软件开发者,未来无需再适配英特尔CPU,建议新软件仅支持Arm64架构,以简化开发流程。此举源于macOS 27将停止支持Intel Mac,Rosetta 2也将在明年停用。但非强制,开发者仍可发布x64版本照顾存量用户。

苹果群发邮件通知Mac软件开发者:已经没必要再适配英特尔CPU

蓝点网 蓝点网 · 2026-09-02T07:00:13Z
维拉到达:NVIDIA首款为代理打造的CPU在顶尖AI实验室落地

NVIDIA与SAP在SAP Sapphire大会上宣布扩大合作,旨在帮助企业更好地运行专用代理。NVIDIA创始人兼CEO黄仁勋在卡内基梅隆大学的毕业典礼上鼓励毕业生,强调他们正处于AI革命的开端,并表彰了在欧洲、中东和非洲推动AI创新的合作伙伴。

维拉到达:NVIDIA首款为代理打造的CPU在顶尖AI实验室落地

NVIDIA Blog NVIDIA Blog · 2026-08-27T13:00:17Z
火焰图详解:如何读懂 CPU 火焰图,找出烧掉 CPU 的代码

本文介绍如何读懂CPU火焰图:宽度代表采样占比而非时间,y轴为调用深度,顶边(或底边)是CPU实际执行位置,x轴按字母序排列。通过PHP、Go、Erlang三个真实案例展示从火焰图定位瓶颈代码行的方法,并给出各技术栈生成火焰图的工具及四步排查流程。

火焰图详解:如何读懂 CPU 火焰图,找出烧掉 CPU 的代码

OpenResty 官方博客 OpenResty 官方博客 · 2026-08-27T00:00:00Z
KTransformers v0.7.0发布:原生FP8 LoRA、AVX512 CPU与全量微调

KTransformers v0.7.0发布,聚焦微调优化。支持直接加载原生FP8权重进行LoRA训练,将专家权重内存减半;新增AVX512 CPU后端,使AMD/x86平台可参与超大规模MoE微调;提供LoRA与全量微调选择,支持检查点保存恢复及CPU激活复用。附完整Cookbook指南,安装命令为pip install "ktransformers[sft]==0.7.0"。

KTransformers v0.7.0发布:原生FP8 LoRA、AVX512 CPU与全量微调

Home | KVCache.ai Home | KVCache.ai · 2026-08-25T00:00:00Z
8GB显存如何跑35B:深入理解FreeToken的专家缓存与CPU-GPU协同

FreeToken通过专家缓存与CPU-GPU协同,在8GB显存上运行35B MoE模型。它将完整专家池存于内存,显存作为LRU缓存,按q*策略动态分配未命中专家至GPU或CPU,Prefill用双缓冲隐藏传输,并优化Agent状态缓存。相比llama.cpp静态卸载,FreeToken更高效,但仅适用于MoE模型。

8GB显存如何跑35B:深入理解FreeToken的专家缓存与CPU-GPU协同

Nicksxs's Blog Nicksxs's Blog · 2026-08-23T12:41:00Z

Security researcher Christopher Domas developed skitter-creek-bath-salts, an open-source hardware security tool that disrupts CPU privilege boundaries by manipulating memory controller translation...

DRAM Controller Register Manipulation Breaks CPU Memory Isolation

InfoQ InfoQ · 2026-08-23T04:04:00Z
GitHub增加了300万个CPU核心,却仍跟不上你的提交速度。

GitHub因流量激增和基础设施扩展不足,于8月17日发生近八小时宕机,这是当月第二次重大事故。尽管已迁移至Azure并增加大量资源,但扩展速度仍跟不上需求。GitHub正采取措施改进稳定性,同时其故障为竞争对手如Entire和Cursor提供了机会。

GitHub增加了300万个CPU核心,却仍跟不上你的提交速度。

The New Stack The New Stack · 2026-08-20T21:37:37Z

rustprofile 是面向 Linux 的 CPU、off-CPU 与堆分析器,支持 native 进程、Docker 和 Kubernetes。它输出 pprof、Firefox profile 和诊断 JSON,可选 SVG 火焰图及 OTLP。支持按线程采样、窗口切分、导入 perf.data 和符号服务。需 root 运行,Linux 5.4+,构建需 Rust 1.88+。部署需特权权限,限制包括压缩输入 512 MiB 等。

Rustprofile:面向 Linux 的持续 CPU、off-CPU 与采样堆分析器

Rust.cc Rust.cc · 2026-08-20T04:39:00Z
智能体AI存在延迟问题,增加算力无法解决

Akamai报告显示,企业AI部署在峰值负载下半数未达延迟目标,82%的关键用例需在500毫秒内响应。问题源于智能体多跳操作跨网络传输,CPU处理占延迟高达90.6%,增加GPU无效。建议采用分层架构,将CPU任务移至边缘,并明确各跳性能预算,而非单纯采购GPU。

智能体AI存在延迟问题,增加算力无法解决

The New Stack The New Stack · 2026-08-18T16:58:18Z
现已覆盖更多常规应用:Windows 11通过短暂强行提升CPU频率加速软件启动

Windows 11 8月更新后,微软的低延迟配置文件技术已从系统组件扩展至Chrome、EPIC商店等常规应用。该技术通过竞速休眠机制,在软件启动时短暂提升CPU频率,加快加载速度,减少卡顿感。目前该功能正逐步推送,仅部分用户可用,后续将覆盖所有Windows 11 24H2+用户。

现已覆盖更多常规应用:Windows 11通过短暂强行提升CPU频率加速软件启动

蓝点网 蓝点网 · 2026-08-16T06:11:05Z
Off-CPU 分析实战:CPU 使用率低但延迟高的四类根因与定位方法

本文介绍Off-CPU分析,用于定位CPU使用率低但延迟高的问题。Off-CPU时间指线程被阻塞等待的时间,与On-CPU互补。文章归纳四类根因:同步网络I/O、子进程调用、文件/管道I/O阻塞及CPU争用,并给出真实案例,如io.popen阻塞致吞吐量提升150倍。通过双层调用栈分析可追踪到具体代码行,OpenResty XRay工具可自动定位瓶颈。

Off-CPU 分析实战:CPU 使用率低但延迟高的四类根因与定位方法

OpenResty 官方博客 OpenResty 官方博客 · 2026-08-14T00:00:00Z
英特尔CEO暗示重返内存制造市场 甚至还重新考虑将内存与CPU堆叠(不可更换内存)

英特尔CEO陈立武表示,因AI数据中心内存需求巨大,公司正考虑重返存储器市场,并探索内存与CPU堆叠封装技术。英特尔曾以DRAM起家,后因竞争退出。2024年月亮湖处理器曾尝试堆叠内存,但因OEM抵制而放弃。若自产内存封装,或具价格优势。

英特尔CEO暗示重返内存制造市场 甚至还重新考虑将内存与CPU堆叠(不可更换内存)

蓝点网 蓝点网 · 2026-08-13T02:00:22Z

本文介绍SPDK用户态存储栈的环境准备与设备绑定。核心是:通过setup.sh分配hugepage并解绑NVMe设备,推荐使用VFIO+IOMMU路径确保DMA安全;设备独占会移除内核块设备路径,需用reset回退;CPU亲和需预留内核核;容器编排需将绑盘和大页视为节点状态。

【SPDK 用户态存储】环境与绑盘:Hugepage、CPU 亲和与 VFIO/UIO

土法炼钢兴趣小组的博客 土法炼钢兴趣小组的博客 · 2026-08-13T00:00:00Z
为什么在AI代理时代CPU仍然重要

随着AI从聊天机器人转向自主代理,CPU的重要性日益凸显。Arm和Google专家指出,CPU在代理工作负载中扮演“空中交通管制员”角色,负责编排、数据准备和代码执行。Google的Axion芯片提供高性能和成本优化选项,配合gVisor隔离技术确保安全,实现每秒300个沙箱的扩展能力,同时提升能效和性价比。

为什么在AI代理时代CPU仍然重要

The New Stack The New Stack · 2026-08-11T20:44:26Z
在人工智能代理时代,CPU为何仍然重要

文章讨论了CPU在人工智能基础设施中的重要性,特别是在聊天机器人向自主代理转变的过程中。Google的Farhat和Arm的Patel指出,CPU在任务执行、内存管理和API交互中起着关键作用。Google的gVisor项目为代理提供了安全的执行环境,支持高效的云计算,提升了性能和成本效益。

在人工智能代理时代,CPU为何仍然重要

The New Stack The New Stack · 2026-08-11T18:54:02Z
Supermicro推出全新服务器,搭载第六代AMD EPYC 9006系列CPU

Supermicro推出搭载第六代AMD EPYC 9006系列CPU的新服务器,最高256核心,性能提升1.7倍,支持云端、AI等负载。产品包括Hyper、CloudDC等,并推出5U GPU服务器及液冷Helios平台,配备AMD Instinct GPU和Pensando网络技术。

Supermicro推出全新服务器,搭载第六代AMD EPYC 9006系列CPU

全球TMT-美通国际 全球TMT-美通国际 · 2026-07-28T06:01:31Z
英特尔宣布从2028年开始恢复Xeon至强处理器的超线程技术 但消费级CPU可能仍然不支持

英特尔确认2028年起在至强服务器处理器中恢复超线程技术,以提升竞争力。消费级处理器是否支持尚不明确。此前英特尔因能效考虑取消该技术,但专业用户仍看重其价值。

英特尔宣布从2028年开始恢复Xeon至强处理器的超线程技术 但消费级CPU可能仍然不支持

蓝点网 蓝点网 · 2026-07-27T03:00:29Z
NVIDIA利用Vera CPU加速下一代CPU和GPU的设计

NVIDIA将Vera CPU用于自家芯片设计,与Cadence和Synopsys合作优化EDA工作负载。早期测试显示,在逻辑仿真和形式验证等关键任务上性能提升高达1.5倍。Vera结合88个定制核心和高带宽内存,加速验证流程,缩短开发周期。未来将采用Rosa CPU,形成芯片设计与软件优化的持续反馈循环。

NVIDIA利用Vera CPU加速下一代CPU和GPU的设计

NVIDIA Blog NVIDIA Blog · 2026-07-27T00:45:42Z
420 RPS卡死CPU 9%?虚拟线程固定Pinning元凶与JDK 24终极修复

Java 21虚拟线程在同步锁或本地方法栈帧阻塞时可能发生Pinning,导致CPU占用低但吞吐量卡死。JDK 24通过JEP 491修复了synchronized固定问题,但本地栈帧仍存在。检测可用JFR事件或线程转储,修复建议改用ReentrantLock、升级JDK或避免持锁阻塞。

420 RPS卡死CPU 9%?虚拟线程固定Pinning元凶与JDK 24终极修复

极道 极道 · 2026-07-20T02:24:00Z
  • <<
  • <
  • 1 (current)
  • 2
  • 3
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码