MoE Lightweight: High-Throughput MoE Inference on Memory-Constrained GPUs

💡 原文英文,约100词,阅读约需1分钟。
📝

内容提要

本研究提出了MoE-Lightning系统,旨在高效部署混合专家模型(MoE)于内存受限的GPU上。通过引入CPU-GPU-I/O流水线调度方法CGOPipe和性能模型HRM,该系统显著提高了资源利用率和吞吐量,超越了现有推理系统。

🏷️

标签

➡️

继续阅读