小红花·文摘
  • 首页
  • AI Tokens🪙
  • 排行榜🏆
  • 直播
  • FAQ
Dify.AI
世界纪录,Qwen 3.8 27B 单台 125 token

懒猫AI算力仓单台运行Qwen 3.8 27B模型,创下性能纪录:prefill速度3754 TPS,长代码解码125 TPS,八会话解码231 TPS,显存占用70GB。该模型为稠密型,专注写代码,单台可跑且不降智,相比Mac Studio,英伟达芯片prefill和并发性能更强,兼容CUDA,价格更优,现推出优惠促销。

世界纪录,Qwen 3.8 27B 单台 125 token

Andy Stewart Andy Stewart · 2026-08-26T16:00:00Z
Pi Agent + Qwen 3.8 27B 深度优化

作者在懒猫AI算力舱X5上部署Qwen 3.8 27B模型,通过真实项目测试,发现其性能良好。经MTP投机解码和NVFP8优化,速度从13.9提升至30.8 Tokens,但关闭思考模式会降低代码推理准确度。开启思考模式后,实际速度稳定在26.47 Tokens,若计入思考阶段,可达35.23 Tokens/s。未来计划进一步优化draft engine以提升速度。

Pi Agent + Qwen 3.8 27B 深度优化

Andy Stewart Andy Stewart · 2026-08-24T16:00:00Z
Qwen 3.8 27B 编程能力实测:一次修复4个复杂 Bug

Qwen 3.8 27B在编程任务中表现惊艳,能一次修复多个bug,并仅凭需求描述自主分析代码关系。尽管思考时间较长,但结果出色,优化速度后可作为主力编程模型,全离线AI编程能力强大。

Qwen 3.8 27B 编程能力实测:一次修复4个复杂 Bug

Andy Stewart Andy Stewart · 2026-08-24T16:00:00Z
  • <<
  • <
  • 1 (current)
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码