小红花·文摘
  • 首页
  • AI Tokens🪙
  • 排行榜🏆
  • 直播
  • FAQ
通过专用GPU内核生成实现极致效率

Proteus系统利用智能体自动生成GPU专用内核,针对不同模型和运行时形状实现极致性能优化。通过严格验证、防作弊检查及知识层管理,Proteus为Qwen 3.5 122B生成的内核比vLLM快1.8至5.2倍。核心挑战在于验证与上下文管理,而非生成本身,确保内核可靠且高效。

通过专用GPU内核生成实现极致效率

Databricks Databricks · 2026-09-04T20:00:00Z
Qwen Audio:复杂人声干扰下,如何让 ASR “听对人”

本文探讨语音识别在多人环境中“听对人”的挑战,即区分用户与背景人声。对比两种技术路线:基于身份注册的Target-Speaker ASR和基于场景线索的前景说话人转录,强调数据构造需明确时间、能量、空间关系,模型应学会选择交互主体而非单纯降噪,推动ASR从内容识别走向场景理解。

Qwen Audio:复杂人声干扰下,如何让 ASR “听对人”

实时互动网 实时互动网 · 2026-09-04T02:43:33Z
Qwen 3.8 Max 0902 现已上线 AI Gateway

阿里Qwen 3.8 Max 0902已上线AI Gateway,新快照提升大型项目编码、长时无人监督任务及智能体运行能力,图表和密集文档视觉处理更精准。用户可设模型为alibaba/qwen3.8-max-0902,通过AI SDK等工具使用,固定版本确保请求稳定。

Qwen 3.8 Max 0902 现已上线 AI Gateway

Vercel News Vercel News · 2026-09-01T00:00:00Z
LWiAI播客第255期 - Gemini 3.7、Jalapeño、Qwen 3.8、无人机

该播客第255期讨论上周AI新闻:谷歌发布Gemini 3.7 Flash;OpenAI公布Jalapeño芯片推理性能领先,计划年底内部部署;SpaceXAI推出Grok 4.6;OpenAI因AI入侵Hugging Face加强安全措施;报道称AI全程引导无人机袭击致三名乌克兰人死亡,及Grok涉生成CSAM诉讼。

LWiAI播客第255期 - Gemini 3.7、Jalapeño、Qwen 3.8、无人机

Last Week in AI Last Week in AI · 2026-08-31T08:20:04Z

Qwen 3.8 Flash Next经优化后,单台算力舱解码速度从23 TPS提升至102 TPS,创世界纪录。18K预填充达2588 TPS,30K首字延迟11.43秒。其T5000芯片FP4算力2070T,远超DGX G10的1000T,单台性能相当于两台DGX G10组合,性价比极高。

世界纪录,Qwen 3.8 Flash Next 单台 102 TPS

Andy Stewart Andy Stewart · 2026-08-30T16:00:00Z
Qwen 3.8 Flash Next:101 TPS + 320K 上下文

单台懒猫AI算力舱优化Qwen 3.8 Flash Next,Decode达100-102 TPS,Prefill 2070-2609 TPS,TTFT 5K 1.9s。通过YaRN技术将KV Cache调至16GB,上下文从265K扩展至320K,性能几乎不变,Edit Decode反升。72小时调优后,将部署图形化程序供用户使用。相比两台DGX GB10,算力舱因FP4算力翻倍、显存直连更快,单台即可实现100+ TPS。

Qwen 3.8 Flash Next:101 TPS + 320K 上下文

Andy Stewart Andy Stewart · 2026-08-30T16:00:00Z

优化Qwen 3.8 27B模型时发现,这类重思考的稠密模型适合算力舱(2070T),Prefill速度达3500-4000 TPS,因模型70%-80%时间在思考,Prefill性能关键。Mac Studio虽显存带宽大,但Prefill能力弱,不适合重思考模型,更适合轻思考模型。选硬件需匹配模型推理范式。

Qwen 3.8 27B:算力舱还是 Mac Studio?

Andy Stewart Andy Stewart · 2026-08-28T16:00:00Z
Qwen 3.8 27B YaRN 768K 上下文实测

文章实测Qwen 3.8 27B模型通过YaRN技术扩展上下文长度,发现实际可从265K扩展至768K,而非宣传的1M,原因是1M时KV Cache需84GB显存,超出128GB机器可用内存约3GB。作者计划进一步测试768K上下文在实际编程中的表现。

Qwen 3.8 27B YaRN 768K 上下文实测

Andy Stewart Andy Stewart · 2026-08-27T16:00:00Z
Qwen 3.8 27B 实现 900K 代码上下文

该文章介绍通过YaRN技术将Qwen 3.8 27B模型的上下文长度从786K提升至900K,接近1M,可支持99%的大型代码项目,避免因上下文不足导致的性能下降。模型占用120GB显存,在懒猫AI算力舱上运行速度快且稳定。

Qwen 3.8 27B 实现 900K 代码上下文

Andy Stewart Andy Stewart · 2026-08-27T16:00:00Z
vLLM 默认多模态参数导致 Qwen 3.8 27B 报错

vLLM部署Qwen 3.8 27B时,默认参数限制了图片和视频输入,导致报错。通过删除`--limit-mm-per-prompt.image 2`和`--limit-mm-per-prompt.video 0`并重启Docker,问题得到解决,模型恢复正常。

vLLM 默认多模态参数导致 Qwen 3.8 27B 报错

Andy Stewart Andy Stewart · 2026-08-27T16:00:00Z
Ollama首次尝试受阻后,Claude Desktop现可轻松运行Qwen、DeepSeek和Kimi模型

Ollama重新推出与Claude Desktop的集成,允许用户通过Ollama连接本地或云端模型(如Qwen、DeepSeek等),在Claude界面内使用。此功能支持Mac应用,用户可切换模型,强调成本、速度和灵活性。Ollama旨在让开源模型更易用,未来或支持Windows。

Ollama首次尝试受阻后,Claude Desktop现可轻松运行Qwen、DeepSeek和Kimi模型

The New Stack The New Stack · 2026-08-26T16:59:39Z
世界纪录,Qwen 3.8 27B 单台 125 token

懒猫AI算力仓单台运行Qwen 3.8 27B模型,创下性能纪录:prefill速度3754 TPS,长代码解码125 TPS,八会话解码231 TPS,显存占用70GB。该模型为稠密型,专注写代码,单台可跑且不降智,相比Mac Studio,英伟达芯片prefill和并发性能更强,兼容CUDA,价格更优,现推出优惠促销。

世界纪录,Qwen 3.8 27B 单台 125 token

Andy Stewart Andy Stewart · 2026-08-26T16:00:00Z
Qwen 3.8 Flash 现已在 AI Gateway 上线

阿里发布Qwen 3.8 Flash模型,现已在AI Gateway上线。该模型支持文本和图像输入,上下文窗口达100万token,输出可达65k token,适用于编码、工具调用和多步代理工作流。用户可通过AI SDK设置模型,或连接Claude Code等编码代理使用。AI Gateway提供统一API、成本追踪、重试和故障转移等功能,且无加价和平台费用。

Qwen 3.8 Flash 现已在 AI Gateway 上线

Vercel News Vercel News · 2026-08-26T00:00:00Z
Pi Agent + Qwen 3.8 27B 深度优化

作者在懒猫AI算力舱X5上部署Qwen 3.8 27B模型,通过真实项目测试,发现其性能良好。经MTP投机解码和NVFP8优化,速度从13.9提升至30.8 Tokens,但关闭思考模式会降低代码推理准确度。开启思考模式后,实际速度稳定在26.47 Tokens,若计入思考阶段,可达35.23 Tokens/s。未来计划进一步优化draft engine以提升速度。

Pi Agent + Qwen 3.8 27B 深度优化

Andy Stewart Andy Stewart · 2026-08-24T16:00:00Z
Qwen 3.8 27B 编程能力实测:一次修复4个复杂 Bug

Qwen 3.8 27B在编程任务中表现惊艳,能一次修复多个bug,并仅凭需求描述自主分析代码关系。尽管思考时间较长,但结果出色,优化速度后可作为主力编程模型,全离线AI编程能力强大。

Qwen 3.8 27B 编程能力实测:一次修复4个复杂 Bug

Andy Stewart Andy Stewart · 2026-08-24T16:00:00Z
我们如何为Junie智能体优化Qwen 3.6模型

JetBrains团队优化Qwen3.6-27B模型以支持Junie本地运行,通过扩展滚动上下文复用KV缓存、调整提示词顺序、禁用推理模式提升速度,并采用4位量化及优化推理引擎的预填充和投机解码。相比Qwen3.8,3.6无需推理模式,性能更佳,适合Mac硬件。

我们如何为Junie智能体优化Qwen 3.6模型

The JetBrains Blog The JetBrains Blog · 2026-08-24T14:11:34Z
早报|宇树「超人」原地跳高2米/小米SU7系列交付突破50万台/豆包支持手机远程操作电脑

DeepSeek API实行峰谷定价,高峰时段涨幅最高达1100%;OpenAI解散安全储备团队;Qwen3.8-27B开源两天下载破百万;阿里出售灵犀互娱股份;宇树科技将上市;iPhone国行AI采用双轨制,千问接入Apple智能;小米SU7交付破50万台;吉利管理层变动;大疆诉美国国防部案发回重审;段永平基金增持阿里;黄仁勋称AI工厂成可投资资产;斯坦福报告显示全球AI乐观与焦虑并存。

早报|宇树「超人」原地跳高2米/小米SU7系列交付突破50万台/豆包支持手机远程操作电脑

爱范儿 爱范儿 · 2026-08-18T00:47:21Z
Qwen GLM Grok Gemini四款实测:质量第一vs速度第一

2026年8月,四款大模型发布:Qwen3.8-27B质量最佳,Gemini 3.7 Flash速度最快但幻觉多,GLM-5.3代码安全突出,Grok 4.6输出不完整。实测显示参数非关键,后训练和蒸馏可提升能力,开源模型依赖闭源蒸馏,快与准难以兼得。

Qwen GLM Grok Gemini四款实测:质量第一vs速度第一

极道 极道 · 2026-08-16T23:56:00Z
Qwen 3.8 27B叫板Opus:拉长思考时间补参数不足

阿里通义实验室开源Qwen 3.8 27B模型,以270亿参数在DeepSWE编程测试中超越万亿参数的Opus 4.6 Max,引发热议。其成功依赖“测试时扩展”技术,通过拉长思考时间弥补参数不足,但推理极慢,且存在刷榜争议。本地部署可行,但速度与质量需权衡,参数规模不再是唯一标准。

Qwen 3.8 27B叫板Opus:拉长思考时间补参数不足

极道 极道 · 2026-08-14T21:45:00Z
让对话与执行真正并行:Qwen-Audio-Agent 架构解析

Qwen-Audio-Agent是开源实时语音运行时,旨在解决语音助理对话中断问题。其架构分为实时前台和后台Agent两层,前台仅暴露八个工具,支持全双工语音和边聊边干;后台处理多步任务,通过FIFO队列串行执行,结果择时播报。系统强调保守意图交接、确认式取消和精确记忆改写,使交流与执行真正并行。

让对话与执行真正并行:Qwen-Audio-Agent 架构解析

实时互动网 实时互动网 · 2026-08-13T08:34:33Z
  • <<
  • <
  • 1 (current)
  • 2
  • 3
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
友情链接: MOGE.AI 九胧科技 1tok 菜鸟教程 Remio.AI DeekSeek连连 53AI 神龙海外代理IP IPIPGO全球代理IP 东波哥的博客 匡优考试在线考试系统 开源服务指南 蓝莺IM Solo 独立开发者社区 AI酷站导航 极客Fun 我爱水煮鱼 周报生成器 He3.app 简单简历 白鲸出海 T沙龙 职友集 TechParty 蟒周刊 Best AI Music Generator 模力方舟 Gitee AI

小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码