Proteus系统利用智能体自动生成GPU专用内核,针对不同模型和运行时形状实现极致性能优化。通过严格验证、防作弊检查及知识层管理,Proteus为Qwen 3.5 122B生成的内核比vLLM快1.8至5.2倍。核心挑战在于验证与上下文管理,而非生成本身,确保内核可靠且高效。
本文探讨语音识别在多人环境中“听对人”的挑战,即区分用户与背景人声。对比两种技术路线:基于身份注册的Target-Speaker ASR和基于场景线索的前景说话人转录,强调数据构造需明确时间、能量、空间关系,模型应学会选择交互主体而非单纯降噪,推动ASR从内容识别走向场景理解。
阿里Qwen 3.8 Max 0902已上线AI Gateway,新快照提升大型项目编码、长时无人监督任务及智能体运行能力,图表和密集文档视觉处理更精准。用户可设模型为alibaba/qwen3.8-max-0902,通过AI SDK等工具使用,固定版本确保请求稳定。
该播客第255期讨论上周AI新闻:谷歌发布Gemini 3.7 Flash;OpenAI公布Jalapeño芯片推理性能领先,计划年底内部部署;SpaceXAI推出Grok 4.6;OpenAI因AI入侵Hugging Face加强安全措施;报道称AI全程引导无人机袭击致三名乌克兰人死亡,及Grok涉生成CSAM诉讼。
Qwen 3.8 Flash Next经优化后,单台算力舱解码速度从23 TPS提升至102 TPS,创世界纪录。18K预填充达2588 TPS,30K首字延迟11.43秒。其T5000芯片FP4算力2070T,远超DGX G10的1000T,单台性能相当于两台DGX G10组合,性价比极高。
单台懒猫AI算力舱优化Qwen 3.8 Flash Next,Decode达100-102 TPS,Prefill 2070-2609 TPS,TTFT 5K 1.9s。通过YaRN技术将KV Cache调至16GB,上下文从265K扩展至320K,性能几乎不变,Edit Decode反升。72小时调优后,将部署图形化程序供用户使用。相比两台DGX GB10,算力舱因FP4算力翻倍、显存直连更快,单台即可实现100+ TPS。
优化Qwen 3.8 27B模型时发现,这类重思考的稠密模型适合算力舱(2070T),Prefill速度达3500-4000 TPS,因模型70%-80%时间在思考,Prefill性能关键。Mac Studio虽显存带宽大,但Prefill能力弱,不适合重思考模型,更适合轻思考模型。选硬件需匹配模型推理范式。
文章实测Qwen 3.8 27B模型通过YaRN技术扩展上下文长度,发现实际可从265K扩展至768K,而非宣传的1M,原因是1M时KV Cache需84GB显存,超出128GB机器可用内存约3GB。作者计划进一步测试768K上下文在实际编程中的表现。
该文章介绍通过YaRN技术将Qwen 3.8 27B模型的上下文长度从786K提升至900K,接近1M,可支持99%的大型代码项目,避免因上下文不足导致的性能下降。模型占用120GB显存,在懒猫AI算力舱上运行速度快且稳定。
vLLM部署Qwen 3.8 27B时,默认参数限制了图片和视频输入,导致报错。通过删除`--limit-mm-per-prompt.image 2`和`--limit-mm-per-prompt.video 0`并重启Docker,问题得到解决,模型恢复正常。
Ollama重新推出与Claude Desktop的集成,允许用户通过Ollama连接本地或云端模型(如Qwen、DeepSeek等),在Claude界面内使用。此功能支持Mac应用,用户可切换模型,强调成本、速度和灵活性。Ollama旨在让开源模型更易用,未来或支持Windows。
懒猫AI算力仓单台运行Qwen 3.8 27B模型,创下性能纪录:prefill速度3754 TPS,长代码解码125 TPS,八会话解码231 TPS,显存占用70GB。该模型为稠密型,专注写代码,单台可跑且不降智,相比Mac Studio,英伟达芯片prefill和并发性能更强,兼容CUDA,价格更优,现推出优惠促销。
阿里发布Qwen 3.8 Flash模型,现已在AI Gateway上线。该模型支持文本和图像输入,上下文窗口达100万token,输出可达65k token,适用于编码、工具调用和多步代理工作流。用户可通过AI SDK设置模型,或连接Claude Code等编码代理使用。AI Gateway提供统一API、成本追踪、重试和故障转移等功能,且无加价和平台费用。
作者在懒猫AI算力舱X5上部署Qwen 3.8 27B模型,通过真实项目测试,发现其性能良好。经MTP投机解码和NVFP8优化,速度从13.9提升至30.8 Tokens,但关闭思考模式会降低代码推理准确度。开启思考模式后,实际速度稳定在26.47 Tokens,若计入思考阶段,可达35.23 Tokens/s。未来计划进一步优化draft engine以提升速度。
Qwen 3.8 27B在编程任务中表现惊艳,能一次修复多个bug,并仅凭需求描述自主分析代码关系。尽管思考时间较长,但结果出色,优化速度后可作为主力编程模型,全离线AI编程能力强大。
JetBrains团队优化Qwen3.6-27B模型以支持Junie本地运行,通过扩展滚动上下文复用KV缓存、调整提示词顺序、禁用推理模式提升速度,并采用4位量化及优化推理引擎的预填充和投机解码。相比Qwen3.8,3.6无需推理模式,性能更佳,适合Mac硬件。
DeepSeek API实行峰谷定价,高峰时段涨幅最高达1100%;OpenAI解散安全储备团队;Qwen3.8-27B开源两天下载破百万;阿里出售灵犀互娱股份;宇树科技将上市;iPhone国行AI采用双轨制,千问接入Apple智能;小米SU7交付破50万台;吉利管理层变动;大疆诉美国国防部案发回重审;段永平基金增持阿里;黄仁勋称AI工厂成可投资资产;斯坦福报告显示全球AI乐观与焦虑并存。
2026年8月,四款大模型发布:Qwen3.8-27B质量最佳,Gemini 3.7 Flash速度最快但幻觉多,GLM-5.3代码安全突出,Grok 4.6输出不完整。实测显示参数非关键,后训练和蒸馏可提升能力,开源模型依赖闭源蒸馏,快与准难以兼得。
阿里通义实验室开源Qwen 3.8 27B模型,以270亿参数在DeepSWE编程测试中超越万亿参数的Opus 4.6 Max,引发热议。其成功依赖“测试时扩展”技术,通过拉长思考时间弥补参数不足,但推理极慢,且存在刷榜争议。本地部署可行,但速度与质量需权衡,参数规模不再是唯一标准。
Qwen-Audio-Agent是开源实时语音运行时,旨在解决语音助理对话中断问题。其架构分为实时前台和后台Agent两层,前台仅暴露八个工具,支持全双工语音和边聊边干;后台处理多步任务,通过FIFO队列串行执行,结果择时播报。系统强调保守意图交接、确认式取消和精确记忆改写,使交流与执行真正并行。
完成下面两步后,将自动完成登录并继续当前操作。