Optimizing Inference of Large Language Models: Fluid-Guided Online Scheduling under Memory Constraints

💡 原文英文,约100词,阅读约需1分钟。
📝

内容提要

该研究提出了WAIT和Nested WAIT算法,以优化大型语言模型在内存限制下的推理过程,提升计算资源利用效率,显著改善数据吞吐量和延迟。

🏷️

标签

➡️

继续阅读