内容提要
2026年8月,四款大模型发布:Qwen3.8-27B质量最佳,Gemini 3.7 Flash速度最快但幻觉多,GLM-5.3代码安全突出,Grok 4.6输出不完整。实测显示参数非关键,后训练和蒸馏可提升能力,开源模型依赖闭源蒸馏,快与准难以兼得。
延伸解读
参数规模与真实性能的落差
文章指出,Qwen3.8-27B虽仅270亿参数,却在多项真实任务中击败参数量大得多的闭源模型,而GLM-5.3的7430亿参数为MoE总参数,实际激活量远小于此。这提醒读者,参数规模并非衡量模型能力的唯一标准,架构、后训练和推理框架适配等因素同样关键。社区反馈中,同一模型在不同硬件和配置下表现差异巨大,说明跑分与实际部署体验可能存在显著差距。
速度与质量的权衡:两种失败模式
Gemini 3.7 Flash以每秒340 token的速度领先,但智能指数仅排第17,且存在幻觉和引用错误;Grok 4.6为节省token导致输出不完整,甚至出现认知断裂。这揭示了当前模型在“快”与“准”之间难以兼得的现实。文章强调,速度优势可能因频繁重试而抵消,但缺乏对真实任务中重试率和人工修正成本的量化测试,这是用户在选择模型时需自行评估的关键盲区。
后训练与蒸馏:能力提升的新路径
GLM-5.3在基座模型不变的情况下,通过后训练使能力大幅提升,表明“堆参数”不再是唯一途径。Empero AI的蒸馏实验显示,小模型经蒸馏和微调后智力可翻倍,这打破了参数规模的壁垒。然而,开源模型的能力提升常依赖对闭源模型的蒸馏,若闭源模型收紧输出或限制API,开源生态可能面临“断粮”风险,这是开源社区需警惕的潜在问题。
Q&A
2026年8月发布的四款大模型分别是什么?
2026年8月12日至16日,四款大模型相继发布:阿里的Qwen3.8系列(包括2.4万亿参数的MoE旗舰和270亿参数的稠密模型Qwen3.8-27B)、智谱AI的GLM-5.3、马斯克xAI的Grok 4.6,以及谷歌的Gemini 3.7 Flash。
在社区测试中,四款模型各自的表现如何?
在相同的提示词测试中,Qwen3.8-27B在生成质量上最佳,Gemini 3.7 Flash速度最快但幻觉较多,GLM-5.3在代码和安全方面表现突出,而Grok 4.6则存在输出不完整的问题。
为什么说Qwen3.8-27B的胜利打破了参数规模崇拜?
Qwen3.8-27B仅有270亿参数,但在真实任务中击败了参数量大得多的对手(如Opus-5),并在视觉质量上获得第一。这表明参数规模不再是决定模型能力的唯一因素,后训练和蒸馏等技术可以显著提升小模型的能力。
GLM-5.3的能力提升主要来自哪些方面?
GLM-5.3的基座模型与上一代GLM-5.2基本一致,能力跃升主要来自后训练阶段,包括更长的训练时间、更丰富的环境类型和更精细的强化学习。在Terminal Bench 3.0上得分从4.6飙升至28.3,在代码安全审查中表现突出,甚至能发现40年前的代码漏洞。
Grok 4.6的主要问题是什么?
Grok 4.6的主要问题是输出不完整,模型为了节省token在答案未写完时强行截断,甚至在超过10%的运行中在推理过程中声称“看不到数据”。这导致其失去了Grok 4.5的速度和成本优势,但输出质量却不稳定。
Gemini 3.7 Flash在速度和智能上的表现如何?
Gemini 3.7 Flash输出速度约每秒340个token,在同类模型中排名第一,且价格较低。但在Artificial Analysis的智能指数中仅得56分,排名第17位,且存在严重的幻觉问题,输出报告外表精美但内容可能虚构。
开源模型的能力提升是否依赖闭源模型?
是的,开源模型的能力提升很大程度上依赖于闭源模型的蒸馏,即用顶尖闭源模型的输出作为训练数据。例如Empero AI用Qwen3.8-27B的输出蒸馏出更小的模型,但更多时候开源模型依赖对闭源模型的“知识提取”,这存在风险,如果闭源模型收紧输出,开源模型可能面临“断粮”。
文章最后提到的数据缺口是什么?
文章指出,虽然各模型在速度和智能得分上有测试,但缺少对“一个真实任务从开始到可交付状态,各模型分别需要多少次重试、多少次人工修正、多少个小时”的测试。这个数据缺口是评估模型实际效率的关键。