小红花·文摘
  • 首页
  • AI Tokens🪙
  • 排行榜🏆
  • 直播
  • FAQ

优化Qwen 3.8 27B模型时发现,这类重思考的稠密模型适合算力舱(2070T),Prefill速度达3500-4000 TPS,因模型70%-80%时间在思考,Prefill性能关键。Mac Studio虽显存带宽大,但Prefill能力弱,不适合重思考模型,更适合轻思考模型。选硬件需匹配模型推理范式。

Qwen 3.8 27B:算力舱还是 Mac Studio?

Andy Stewart Andy Stewart · 2026-08-28T16:00:00Z
Qwen 3.8 27B YaRN 768K 上下文实测

文章实测Qwen 3.8 27B模型通过YaRN技术扩展上下文长度,发现实际可从265K扩展至768K,而非宣传的1M,原因是1M时KV Cache需84GB显存,超出128GB机器可用内存约3GB。作者计划进一步测试768K上下文在实际编程中的表现。

Qwen 3.8 27B YaRN 768K 上下文实测

Andy Stewart Andy Stewart · 2026-08-27T16:00:00Z
Qwen 3.8 27B 实现 900K 代码上下文

该文章介绍通过YaRN技术将Qwen 3.8 27B模型的上下文长度从786K提升至900K,接近1M,可支持99%的大型代码项目,避免因上下文不足导致的性能下降。模型占用120GB显存,在懒猫AI算力舱上运行速度快且稳定。

Qwen 3.8 27B 实现 900K 代码上下文

Andy Stewart Andy Stewart · 2026-08-27T16:00:00Z
vLLM 默认多模态参数导致 Qwen 3.8 27B 报错

vLLM部署Qwen 3.8 27B时,默认参数限制了图片和视频输入,导致报错。通过删除`--limit-mm-per-prompt.image 2`和`--limit-mm-per-prompt.video 0`并重启Docker,问题得到解决,模型恢复正常。

vLLM 默认多模态参数导致 Qwen 3.8 27B 报错

Andy Stewart Andy Stewart · 2026-08-27T16:00:00Z
世界纪录,Qwen 3.8 27B 单台 125 token

懒猫AI算力仓单台运行Qwen 3.8 27B模型,创下性能纪录:prefill速度3754 TPS,长代码解码125 TPS,八会话解码231 TPS,显存占用70GB。该模型为稠密型,专注写代码,单台可跑且不降智,相比Mac Studio,英伟达芯片prefill和并发性能更强,兼容CUDA,价格更优,现推出优惠促销。

世界纪录,Qwen 3.8 27B 单台 125 token

Andy Stewart Andy Stewart · 2026-08-26T16:00:00Z
27B AI 科学家论文复现能力超越 GPT-5.5/Claude Opus 4.8,Faraday 探索长程科学创新

论文复现是科学基石,但机器学习领域面临可复现性危机。Inherent Labs团队训练了270亿参数的AI智能体Faraday,利用Codex GPT-5.5作为工具,在73%的分布内任务和60%的AI for Science任务上超越Claude和GPT-5.5。Faraday通过自动生成任务空间和稳定GRPO后训练,展现出更强的科学严谨性,能指导更大模型工作,提升复现能力。

27B AI 科学家论文复现能力超越 GPT-5.5/Claude Opus 4.8,Faraday 探索长程科学创新

HyperAI超神经 HyperAI超神经 · 2026-08-26T10:25:56Z
Pi Agent + Qwen 3.8 27B 深度优化

作者在懒猫AI算力舱X5上部署Qwen 3.8 27B模型,通过真实项目测试,发现其性能良好。经MTP投机解码和NVFP8优化,速度从13.9提升至30.8 Tokens,但关闭思考模式会降低代码推理准确度。开启思考模式后,实际速度稳定在26.47 Tokens,若计入思考阶段,可达35.23 Tokens/s。未来计划进一步优化draft engine以提升速度。

Pi Agent + Qwen 3.8 27B 深度优化

Andy Stewart Andy Stewart · 2026-08-24T16:00:00Z
Qwen 3.8 27B 编程能力实测:一次修复4个复杂 Bug

Qwen 3.8 27B在编程任务中表现惊艳,能一次修复多个bug,并仅凭需求描述自主分析代码关系。尽管思考时间较长,但结果出色,优化速度后可作为主力编程模型,全离线AI编程能力强大。

Qwen 3.8 27B 编程能力实测:一次修复4个复杂 Bug

Andy Stewart Andy Stewart · 2026-08-24T16:00:00Z
从代码开发到自动化执行,Muse-Glimmer-30B让本地Agent更强大;Qwen3.8-27B-FP8发布,270亿参数挑战高效推理极限

Muse-Glimmer-30B是Meta推出的300亿参数多模态智能体模型,支持本地运行,融合推理、工具调用和多模态理解,性能优异。文章还介绍了HyperAI平台更新的数据集、教程及社区内容,涵盖人物画像、车辆检测、分子处理、语音识别等AI资源。

从代码开发到自动化执行,Muse-Glimmer-30B让本地Agent更强大;Qwen3.8-27B-FP8发布,270亿参数挑战高效推理极限

HyperAI超神经 HyperAI超神经 · 2026-08-22T09:16:25Z
阿里千问Qwen3.8-27B实测碾压Opus 5!一张3090就够了

阿里开源Qwen3.8-27B模型,在编程等任务上超越Claude旗舰,仅需一张二手3090显卡即可运行。其Sharp聊天模板优化了性能,引发对云端订阅价值的质疑。但测试条件存疑,结果可能仅在特定配置下成立,开源与闭源模型竞争仍存变数。

阿里千问Qwen3.8-27B实测碾压Opus 5!一张3090就够了

极道 极道 · 2026-08-18T22:56:00Z

本文介绍如何用三条命令将Qwen3.8-27B模型配置为本地AI编程助手。首先检查硬件(建议24GB显存和32GB内存),然后安装Ollama、下载模型,最后在OpenCode中启动。测试显示模型能快速构建并测试应用,适合初学者快速体验本地AI编程,无需复杂配置。

仅需三条命令,将Qwen3.8-27B配置为本地AI编程助手

KDnuggets KDnuggets · 2026-08-18T14:00:29Z
在线教程丨Qwen3.8-27B重磅开源,推理/编程/Agent能力齐升级

Qwen3.8-27B开源模型发布,拥有270亿参数,强化推理、编程与Agent能力,在代码、多模态和智能体评测中表现优异,接近顶级闭源模型。支持图像视频理解及灵活思考控制,HyperAI已上线教程供开发者快速调用。

在线教程丨Qwen3.8-27B重磅开源,推理/编程/Agent能力齐升级

HyperAI超神经 HyperAI超神经 · 2026-08-18T09:54:13Z
两块RTX 3090跑105 tok/s!Qwen3.8-27B本地部署实测

阿里开源Qwen3.8-27B模型,270亿参数,支持262K上下文,性能接近闭源旗舰。社区实测在双RTX 3090上达105 tok/s,通过量化、MTP加速等技术实现。模型Apache 2.0协议,48小时下载86万次。但速度受场景、配置影响大,多卡未必更快,且长上下文需量化KV缓存牺牲质量。

两块RTX 3090跑105 tok/s!Qwen3.8-27B本地部署实测

极道 极道 · 2026-08-17T04:23:00Z
Qwen3.8-27B在Mac上快3倍:mlx-dspark无损加速实测揭秘

mlx-dspack项目在Mac上通过投机解码技术,将Qwen3.8-27B模型推理速度提升至3倍,8-bit量化下性能优于4-bit。项目基于DeepSeek的DSpark和z-lab的DFlash,支持自动调参优化草稿长度。实测显示8-bit加投机解码比4-bit普通解码快39%,但加速效果受硬件、量化方式和MLX版本影响,长上下文和内存限制仍是瓶颈。

Qwen3.8-27B在Mac上快3倍:mlx-dspark无损加速实测揭秘

极道 极道 · 2026-08-15T22:53:00Z
27B的Qwen3.8与3.6架构相同!性能怎么反超50%?

阿里巴巴发布Qwen3.8-27B,与3.6版架构相同,但性能大幅提升,编程测试领先,部分超越闭源旗舰。提升源于训练数据优化和推理深度调节,代价是token消耗和耗时增至三倍。用户需权衡智能与成本,引发对“性能提升”本质的讨论。

27B的Qwen3.8与3.6架构相同!性能怎么反超50%?

极道 极道 · 2026-08-15T06:22:00Z
源神启动!一张消费级显卡跑“Opus级”Agent,Qwen3.8-27B多项榜单反超Claude

Qwen3.8-27B开源,拥有270亿参数,支持原生多模态和262K上下文,可扩展至100万Token。在SWE-bench Pro和QwenSWEBench上超越Claude Opus 4.6 Max,Agent和多模态评测表现优异。内置推理档位可调,支持关闭Thinking模式,默认开启preserve_thinking。量化后可在24GB显存显卡运行,支持Transformers、vLLM等部署。

源神启动!一张消费级显卡跑“Opus级”Agent,Qwen3.8-27B多项榜单反超Claude

量子位 量子位 · 2026-08-15T06:05:31Z
Qwen 3.8 27B叫板Opus:拉长思考时间补参数不足

阿里通义实验室开源Qwen 3.8 27B模型,以270亿参数在DeepSWE编程测试中超越万亿参数的Opus 4.6 Max,引发热议。其成功依赖“测试时扩展”技术,通过拉长思考时间弥补参数不足,但推理极慢,且存在刷榜争议。本地部署可行,但速度与质量需权衡,参数规模不再是唯一标准。

Qwen 3.8 27B叫板Opus:拉长思考时间补参数不足

极道 极道 · 2026-08-14T21:45:00Z
刚刚,Qwen3.8-27B 开源了!家用显卡也能跑

Qwen3.8系列模型正式开源,所有开发者、科研机构和企业可免费下载、部署及商用。其中27B参数模型支持原生多模态和262K上下文,编程和办公性能大幅提升,新增推理控制功能。模型以Apache2.0协议开放,累计开源460余个模型,全球下载超30亿次。

刚刚,Qwen3.8-27B 开源了!家用显卡也能跑

量子位 量子位 · 2026-08-14T15:41:12Z
Qwen3.8-Max开源双炸:2.4万亿参数免费公开,27B模型专攻消费级显卡

通义千问开源Qwen3.8-Max和27B模型,前者拥有2.4万亿参数并免费公开,后者适配消费级显卡。Max版展示了自主编码和芯片设计能力,27B使本地部署接近顶级AI,降低了开发成本。此举打破闭源垄断,推动行业生态加速,引发社区热议。

Qwen3.8-Max开源双炸:2.4万亿参数免费公开,27B模型专攻消费级显卡

极道 极道 · 2026-08-03T03:49:00Z
在线教程|27B大模型压缩到7.2GB!Ternary-Bonsai用「三进制魔法」让大模型跑进个人电脑

Prism ML团队发布Ternary-Bonsai-27B模型,基于Qwen3.6-27B架构,采用三进制量化将权重压缩至{-1,0,+1},体积从54GB降至7.2GB,性能保留95%。该模型支持262K上下文,峰值内存14.7GB,DSpark引擎提速1.34倍,已在HyperAI上线并支持一键部署,降低大模型使用门槛。

在线教程|27B大模型压缩到7.2GB!Ternary-Bonsai用「三进制魔法」让大模型跑进个人电脑

HyperAI超神经 HyperAI超神经 · 2026-07-24T03:51:02Z
  • <<
  • <
  • 1 (current)
  • 2
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
友情链接: MOGE.AI 九胧科技 1tok 菜鸟教程 Remio.AI DeekSeek连连 53AI 神龙海外代理IP IPIPGO全球代理IP 东波哥的博客 匡优考试在线考试系统 开源服务指南 蓝莺IM Solo 独立开发者社区 AI酷站导航 极客Fun 我爱水煮鱼 周报生成器 He3.app 简单简历 白鲸出海 T沙龙 职友集 TechParty 蟒周刊 Best AI Music Generator 模力方舟 Gitee AI

小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码