TAPAS: Energy and Power-Aware Scheduling for Large Language Model Inference in Cloud Platforms

💡 原文英文,约100词,阅读约需1分钟。
📝

内容提要

本研究提出TAPAS框架,旨在优化云数据中心大型语言模型推理中的热管理和功耗控制,通过历史数据优化GPU虚拟机配置,提高系统效率,降低总拥有成本。

🏷️

标签

➡️

继续阅读