研究表明,当前编码基准测试存在“意义差距”,即基准分数与模型实际性能之间的差异。基准测试通常只反映特定任务的能力,而非全面的编码能力。为改善评估,建议使用更广泛的基准套件,并强调持续维护和多样化任务的重要性,以更准确地反映模型的真实表现。
2026年3月27日,智谱AI发布了GLM-5.1模型,声称其在编码基准测试中表现达到94.6%的Claude Opus 4.6水平,较GLM-5提升28%。尽管开源AI在基准测试中缩小了与专有AI的差距,但GLM-5的自托管需求高达1490GB内存,限制了其可及性。GLM-5在多个评估中表现出色,但GPT-5.4在实际应用中仍具优势,尤其是在长上下文和多模态输入方面。选择模型时,团队需考虑成本、基础设施和具体需求。
完成下面两步后,将自动完成登录并继续当前操作。