内容提要
GLM-5.3在AI评委的创意写作测试中获全球第二,但人类投票榜未进前十,引发争议。测试由7个LLM评委按16维度打分,GLM-5.3因学会制造冲突而提升,但文笔被指退步。文章质疑AI评AI的可靠性,并指出其编程和安全能力提升显著,但“好故事”标准因AI介入而模糊。
延伸解读
AI评委的“审美”可能自带偏差
AI评委的训练数据来自人类写作,其评分标准可能隐含对特定风格的偏好,导致“像好故事”的故事得高分,而非人类真正爱读的故事。这解释了为何GLM-5.3在AI评委下排名第二,却在人类投票中未进前十。
写作测试测的是“听指令”还是“创造力”?
Lech Mazur基准要求模型将10个随机元素“有机”融入故事,高分模型可能更擅长遵循指令而非展现原创性。这引发疑问:测试究竟衡量写作能力,还是模型服从指令的能力?
GLM-5.3的进步与代价
GLM-5.3通过后训练学会了制造冲突,故事从“一个人思考”变为“两人交锋”,但文笔被指退步。这提示模型能力提升可能伴随风格变化,用户需根据需求权衡。
成本与效率:便宜但需按需使用
GLM-5.3定价与上代相同,但单任务输出token增加20%,实际成本上升约55%。不过横向对比仍属便宜,且编程任务效率提升显著。轻量任务使用它可能不划算,更适合长程Agent和复杂编程。
Q&A
GLM-5.3在创意写作测试中排名如何?
在Lech Mazur Writing Benchmark中,GLM-5.3(max)以3.3分、91%的预估胜率排名第二,仅次于Claude Opus 5。
Lech Mazur Writing Benchmark的测试方法是什么?
每个模型拿到同样的10个随机元素(人物、物件、核心概念等),写一篇400-500词的短故事,必须有机地融入所有元素。每个模型写500篇,由7个独立的LLM评委从16个维度打分。
为什么GLM-5.3在AI评委和人类评委中的排名差异巨大?
AI评委(Lech Mazur)给GLM-5.3全球第二,但人类投票的LMArena榜单上GLM-5.3未进前十。原因可能包括AI评委的系统性偏好、人类评委的不稳定性,以及测试任务本身可能更偏向听指令而非真正的写作能力。
GLM-5.3在写作上相比上一代有哪些改进?
GLM-5.3学会了制造冲突,会在故事中引入第二个人物来阻碍、评判或被主角改变,使主角的信念在交锋中存活。它不再让旁白解释意义,而是让事件直接发生并让角色付出代价。
GLM-5.3的编程和安全能力提升如何?
GLM-5.3在Terminal-Bench 3.0上从4.6分跳到28.3分,翻了六倍;在CyberGym漏洞发现上拿到84.5%,发现了潜伏40多年的DNS协议级风险,潜在影响超过1000万处公网服务。
GLM-5.3的API定价和成本如何?
GLM-5.3的API定价与GLM-5.2相同:输入每百万token 1.40美元,输出4.40美元。但单任务平均输出约18700个token,比上代多20%,因此单任务成本贵约55%。横向比仍是同级最便宜,比Kimi K3省19%,比GPT-5.6 Sol省45%。
GLM-5.3适合哪些任务?
GLM-5.3适合长程Agent、复杂编程、大型代码库等任务,不适合轻量高频任务如短分类、短摘要。