Seesaw: Achieving High Throughput in Large Language Model Inference through Dynamic Model Resharding

💡 原文英文,约100词,阅读约需1分钟。
📝

内容提要

本研究提出Seesaw推理引擎,通过动态模型重分片技术优化大型语言模型的并行推理策略,最高提升吞吐量1.78倍。

🏷️

标签

➡️

继续阅读