Prism: Unleashing GPU Sharing for Cost-Effective Multi-LLM Serving

💡 原文英文,约100词,阅读约需1分钟。
📝

内容提要

Prism系统通过跨模型内存协调和动态内存分配,降低了多大型语言模型服务的成本,实验结果显示其在成本节省和服务效率方面优于现有系统,具有显著的经济效益。

🏷️

标签

➡️

继续阅读