AI基础设施不应只关注GPU,而应视为CPU、内存、存储和网络协同工作的整体系统。平台团队需匹配各阶段资源需求,而非孤立优化GPU。通过Kubernetes及DRA等工具统一编排异构资源,并观察CPU到GPU的完整链路,以识别瓶颈。设计应围绕整个系统,而非单一组件,才能将算力转化为有效AI基础设施。
苹果通知Mac软件开发者,未来无需再适配英特尔CPU,建议新软件仅支持Arm64架构,以简化开发流程。此举源于macOS 27将停止支持Intel Mac,Rosetta 2也将在明年停用。但非强制,开发者仍可发布x64版本照顾存量用户。
NVIDIA与SAP在SAP Sapphire大会上宣布扩大合作,旨在帮助企业更好地运行专用代理。NVIDIA创始人兼CEO黄仁勋在卡内基梅隆大学的毕业典礼上鼓励毕业生,强调他们正处于AI革命的开端,并表彰了在欧洲、中东和非洲推动AI创新的合作伙伴。
本文介绍如何读懂CPU火焰图:宽度代表采样占比而非时间,y轴为调用深度,顶边(或底边)是CPU实际执行位置,x轴按字母序排列。通过PHP、Go、Erlang三个真实案例展示从火焰图定位瓶颈代码行的方法,并给出各技术栈生成火焰图的工具及四步排查流程。
KTransformers v0.7.0发布,聚焦微调优化。支持直接加载原生FP8权重进行LoRA训练,将专家权重内存减半;新增AVX512 CPU后端,使AMD/x86平台可参与超大规模MoE微调;提供LoRA与全量微调选择,支持检查点保存恢复及CPU激活复用。附完整Cookbook指南,安装命令为pip install "ktransformers[sft]==0.7.0"。
FreeToken通过专家缓存与CPU-GPU协同,在8GB显存上运行35B MoE模型。它将完整专家池存于内存,显存作为LRU缓存,按q*策略动态分配未命中专家至GPU或CPU,Prefill用双缓冲隐藏传输,并优化Agent状态缓存。相比llama.cpp静态卸载,FreeToken更高效,但仅适用于MoE模型。
Security researcher Christopher Domas developed skitter-creek-bath-salts, an open-source hardware security tool that disrupts CPU privilege boundaries by manipulating memory controller translation...
GitHub因流量激增和基础设施扩展不足,于8月17日发生近八小时宕机,这是当月第二次重大事故。尽管已迁移至Azure并增加大量资源,但扩展速度仍跟不上需求。GitHub正采取措施改进稳定性,同时其故障为竞争对手如Entire和Cursor提供了机会。
rustprofile 是面向 Linux 的 CPU、off-CPU 与堆分析器,支持 native 进程、Docker 和 Kubernetes。它输出 pprof、Firefox profile 和诊断 JSON,可选 SVG 火焰图及 OTLP。支持按线程采样、窗口切分、导入 perf.data 和符号服务。需 root 运行,Linux 5.4+,构建需 Rust 1.88+。部署需特权权限,限制包括压缩输入 512 MiB 等。
Akamai报告显示,企业AI部署在峰值负载下半数未达延迟目标,82%的关键用例需在500毫秒内响应。问题源于智能体多跳操作跨网络传输,CPU处理占延迟高达90.6%,增加GPU无效。建议采用分层架构,将CPU任务移至边缘,并明确各跳性能预算,而非单纯采购GPU。
Windows 11 8月更新后,微软的低延迟配置文件技术已从系统组件扩展至Chrome、EPIC商店等常规应用。该技术通过竞速休眠机制,在软件启动时短暂提升CPU频率,加快加载速度,减少卡顿感。目前该功能正逐步推送,仅部分用户可用,后续将覆盖所有Windows 11 24H2+用户。
本文介绍Off-CPU分析,用于定位CPU使用率低但延迟高的问题。Off-CPU时间指线程被阻塞等待的时间,与On-CPU互补。文章归纳四类根因:同步网络I/O、子进程调用、文件/管道I/O阻塞及CPU争用,并给出真实案例,如io.popen阻塞致吞吐量提升150倍。通过双层调用栈分析可追踪到具体代码行,OpenResty XRay工具可自动定位瓶颈。
英特尔CEO陈立武表示,因AI数据中心内存需求巨大,公司正考虑重返存储器市场,并探索内存与CPU堆叠封装技术。英特尔曾以DRAM起家,后因竞争退出。2024年月亮湖处理器曾尝试堆叠内存,但因OEM抵制而放弃。若自产内存封装,或具价格优势。
本文介绍SPDK用户态存储栈的环境准备与设备绑定。核心是:通过setup.sh分配hugepage并解绑NVMe设备,推荐使用VFIO+IOMMU路径确保DMA安全;设备独占会移除内核块设备路径,需用reset回退;CPU亲和需预留内核核;容器编排需将绑盘和大页视为节点状态。
随着AI从聊天机器人转向自主代理,CPU的重要性日益凸显。Arm和Google专家指出,CPU在代理工作负载中扮演“空中交通管制员”角色,负责编排、数据准备和代码执行。Google的Axion芯片提供高性能和成本优化选项,配合gVisor隔离技术确保安全,实现每秒300个沙箱的扩展能力,同时提升能效和性价比。
文章讨论了CPU在人工智能基础设施中的重要性,特别是在聊天机器人向自主代理转变的过程中。Google的Farhat和Arm的Patel指出,CPU在任务执行、内存管理和API交互中起着关键作用。Google的gVisor项目为代理提供了安全的执行环境,支持高效的云计算,提升了性能和成本效益。
Supermicro推出搭载第六代AMD EPYC 9006系列CPU的新服务器,最高256核心,性能提升1.7倍,支持云端、AI等负载。产品包括Hyper、CloudDC等,并推出5U GPU服务器及液冷Helios平台,配备AMD Instinct GPU和Pensando网络技术。
英特尔确认2028年起在至强服务器处理器中恢复超线程技术,以提升竞争力。消费级处理器是否支持尚不明确。此前英特尔因能效考虑取消该技术,但专业用户仍看重其价值。
NVIDIA将Vera CPU用于自家芯片设计,与Cadence和Synopsys合作优化EDA工作负载。早期测试显示,在逻辑仿真和形式验证等关键任务上性能提升高达1.5倍。Vera结合88个定制核心和高带宽内存,加速验证流程,缩短开发周期。未来将采用Rosa CPU,形成芯片设计与软件优化的持续反馈循环。
Java 21虚拟线程在同步锁或本地方法栈帧阻塞时可能发生Pinning,导致CPU占用低但吞吐量卡死。JDK 24通过JEP 491修复了synchronized固定问题,但本地栈帧仍存在。检测可用JFR事件或线程转储,修复建议改用ReentrantLock、升级JDK或避免持锁阻塞。
完成下面两步后,将自动完成登录并继续当前操作。