CUDA时间切片是GPU默认共享机制,但低利用率进程会拖慢其他进程。NVIDIA MPS允许多进程并发执行内核,提升GPU利用率。文章通过Triton内核测试展示,启用MPS后8个单SM工作负载的吞吐量从3.02提升至17.09请求/秒,约6倍改进,并提供了启用/禁用MPS及Docker配置方法。
完成下面两步后,将自动完成登录并继续当前操作。