懒猫AI算力仓单台运行Qwen 3.8 27B模型,创下性能纪录:prefill速度3754 TPS,长代码解码125 TPS,八会话解码231 TPS,显存占用70GB。该模型为稠密型,专注写代码,单台可跑且不降智,相比Mac Studio,英伟达芯片prefill和并发性能更强,兼容CUDA,价格更优,现推出优惠促销。
作者在懒猫AI算力舱X5上部署Qwen 3.8 27B模型,通过真实项目测试,发现其性能良好。经MTP投机解码和NVFP8优化,速度从13.9提升至30.8 Tokens,但关闭思考模式会降低代码推理准确度。开启思考模式后,实际速度稳定在26.47 Tokens,若计入思考阶段,可达35.23 Tokens/s。未来计划进一步优化draft engine以提升速度。
Qwen 3.8 27B在编程任务中表现惊艳,能一次修复多个bug,并仅凭需求描述自主分析代码关系。尽管思考时间较长,但结果出色,优化速度后可作为主力编程模型,全离线AI编程能力强大。
完成下面两步后,将自动完成登录并继续当前操作。