Qwen 3.8 27B:算力舱还是 Mac Studio?
原文中文,约700字,阅读约需2分钟。
📝
内容提要
优化Qwen 3.8 27B模型时发现,这类重思考的稠密模型适合算力舱(2070T),Prefill速度达3500-4000 TPS,因模型70%-80%时间在思考,Prefill性能关键。Mac Studio虽显存带宽大,但Prefill能力弱,不适合重思考模型,更适合轻思考模型。选硬件需匹配模型推理范式。
🏷️