Pie: Pooling CPU Memory for Large-Scale Language Model Inference

💡 原文英文,约100词,阅读约需1分钟。
📝

内容提要

本研究提出了一种名为Pie的新框架,旨在解决大规模语言模型推理中的CPU和GPU内存交换导致的高延迟和低吞吐量问题。通过智能内存访问和自适应扩展,Pie优化了内存使用,显著提高了性能,实验结果显示其吞吐量优于现有方案。

🏷️

标签

➡️

继续阅读