八个主流大语言模型在解答同一道概率题时表现出显著的思维路径差异。GLM 5.2表现自信,修正较少;而DeepSeek V4 Pro则频繁自我怀疑,思维过程复杂。可视化树状图显示了模型的认知风格,指出自我怀疑与模型性能之间的关系尚不明确,需进一步研究。
作者参加杭州站比赛的经历,与退役同事组队,解决了概率题和BFS题,提出了乘法题解决方案,对比赛结果满意。
完成下面两步后,将自动完成登录并继续当前操作。