我和我的 AI 手机吃了 3 顿饭

我和我的 AI 手机吃了 3 顿饭

💡 原文中文,约4800字,阅读约需12分钟。
📝

内容提要

高通提出HBC近存计算,将计算单元移至内存旁以减少数据搬运,破解AI“内存墙”。下一代骁龙旗舰芯片围绕智能体手机重构,集成5GHz Oryon CPU、FlexCache缓存、Adreno矩阵核心与18MB显存、Hexagon NPU,并扩容共享内存、支持MoE,形成异构分工,提升AI速度与能效。

🔎

延伸解读

内存墙:AI 加速的真正瓶颈

文章指出,AI 推理时 CPU、GPU、NPU 常处于等待状态,因为数据从内存搬运的速度跟不上计算需求。过去十年计算力和模型规模猛增,内存带宽却未同步,导致时间和能耗大量消耗在数据移动上,这就是“内存墙”。理解这一点,就能明白为何单纯提升算力数字对 AI 体验的改善有限,减少数据搬运才是关键。

HBC 近存计算:把计算搬到内存旁

高通提出的 HBC 借鉴餐厅“潮 1/2”模式,将计算单元移至内存附近,减少数据搬运。文章用 SRAM 和 HBM 作对比:SRAM 像板前料理,成本高、容量有限;HBM 像寿司郎,带宽高但依赖复杂堆叠封装,价格昂贵且供不应求。HBC 则是一种近内存计算思路,适合矩阵乘、向量运算、Embedding 查询等数据搬运成本高的任务,而 Prefill 等高计算强度任务仍由 CPU/GPU/NPU 负责。

下一代骁龙:为智能体手机重构异构分工

面向 AI 智能体手机,下一代骁龙旗舰芯片围绕 Agent 需求重新安排计算单元。Oryon CPU 最高主频达 5GHz,并引入 FlexCache 可扩展缓存,让核心共享缓存池并动态调整,适应智能体任务频繁切换的特点。Adreno GPU 加入矩阵计算核心和 18MB 独立高速显存,Hexagon NPU 新增 Element Accelerator 并扩大共享内存最高 50%,同时支持 MoE 模型,每次仅激活部分参数,以降低计算负载和内存带宽需求。

体验背后:复杂调度终将隐形

文章认为,AI 智能体手机不会在包装盒上标注 KV-cache 或 NPU 规格,用户最终感受到的只是手机更懂你、一句话能完成更多事情。就像影像旗舰不强调 ISP 架构,游戏手机不强调 GPU 型号,发生在 CPU、GPU、NPU 和内存之间的复杂调度会被隐藏起来。高通正试图回答一颗真正为 Agent 而生的芯片应该长什么样,而答案可能既复杂又简单:把饭桌搬到厨房那里去。

Q&A

什么是内存墙?为什么AI计算会撞上内存墙?

内存墙是指AI计算能力和模型规模快速膨胀,但内存容量、带宽和数据搬运效率没有以相同速度增长,导致越来越多的时间和能耗花在数据移动上,而非真正的计算。大语言模型因为参数规模大,在生成每个token时需要不断读取模型参数和上下文,但实际计算相对有限,因此受限于内存带宽。

高通HBC技术是什么?它如何解决AI计算中的内存瓶颈?

HBC(High Bandwidth Compute,高带宽计算)是一种近内存计算架构,将计算单元移到内存旁边,减少数据搬运,从而加速AI并降低功耗。它适合数据搬运成本高的计算,如矩阵乘、向量运算、Embedding查询和部分Attention/KV Cache操作,而CPU/GPU/NPU仍负责计算复杂的任务,形成异构分工。

下一代骁龙旗舰芯片在CPU和缓存方面有哪些针对AI智能体的改进?

下一代骁龙旗舰的Qualcomm Oryon CPU最高主频达到5GHz,是全球最快的移动CPU;同时引入Qualcomm Oryon FlexCache可扩展缓存架构,允许不同类型核心共享缓存池,并根据任务动态分配空间。5GHz让智能体任务跳得更快,FlexCache让任务跳得更轻松。

Adreno GPU为AI做了哪些专门优化?

下一代Adreno GPU加入了Adreno Matrix Cores(矩阵计算核心),专门负责AI/矩阵计算硬件加速;同时推出Adreno Neural Fusion神经网络融合渲染技术,将神经网络处理、AI超级分辨率和AI帧生成统一到图形管线中。此外,GPU旁还集成了18MB Adreno独立高速显存HPM,用于存放渲染目标、颜色缓冲、深度缓冲、纹理及中间结果,让更多图形和AI数据停留在GPU内部。

Hexagon NPU在AI智能体手机中扮演什么角色?有哪些升级?

Hexagon NPU承担主要的高效端侧AI推理。下一代Hexagon NPU新增了Element Accelerator,专门针对Transformer工作负载设计;同时扩大共享内存最高扩容50%,让更多模型状态、上下文以及KV-cache保留在靠近加速器的位置,减少访问DDR内存的次数。此外,高通还引入混合专家模型(MoE)架构,让30B MoE模型每次生成词元仅需激活约30亿个参数,降低计算负载和内存带宽需求。

AI智能体手机需要芯片如何协同工作?

AI智能体手机需要芯片异构分工:Sensing Hub保持低功耗环境感知;Oryon CPU负责规划、推理和编排工作流,决定何时调用工具或访问云端;Hexagon NPU承担主要的高效端侧AI推理;Adreno GPU参与多模型推理,同时完成图形任务。这种协作让手机能理解用户情境,在多个应用间运行,持续推理并采取行动。

🏷️

标签

➡️

继续阅读