内容提要
循环深度仅重复使用同一组Transformer层,并非真正思考,与思维链不同,其过程不可见。研究表明中间token与推理有效性关联松散,甚至可能误导信任。OpenAI Astra采用此技术引发安全担忧,因不透明计算增加风险,且隐藏思维链或为防蒸馏。本质是采样而非推理,需外部验证。
延伸解读
循环深度与思维链的本质区别
循环深度在潜空间迭代计算,不生成可见的思考token,而思维链会逐步写出推理过程。前者省内存和时间,但过程不可见,难以监控。Redwood Research专家担忧其可监控性大幅降低,可能导致所有推理从可见渠道消失,增加安全风险。
中间token并非可靠推理证据
研究显示,中间token与推理有效性仅松散相关。迷宫实验中,轨迹正确性与答案正确性关联弱;互换轨迹训练模型仍能高准确率,说明模型依赖格式而非语义。人类被试看到中间token后,无论答案对错都更信任模型,可能误导用户。
隐藏思维链的商业动机
OpenAI等厂商隐藏思维链,除安全考量外,更因防止模型蒸馏。公开思维链等于泄露制造工艺,竞争对手可收集高质量数据训练竞品,瓦解技术护城河。循环深度将中间计算移入潜空间,增加蒸馏难度,但加剧不透明性。
循环深度的实际局限
马里兰大学论文承认,循环迭代会收敛到固定点,状态不再变化,并非真正思考。Transformer本质是采样器,循环只是重复预测过程。建议将AI输出视为建议而非结论,用于有明确外部验证标准的任务,人工验证不可省。
Q&A
什么是循环深度(Recurrent Depth)?它与标准Transformer有何不同?
循环深度是一种参数复用机制,将同一组Transformer层重复使用多次,例如将第6层的输出反馈到第3层再计算,以时间(计算循环)换取空间(模型参数量)。标准Transformer是数据依次通过各层,而循环深度让数据在同一组层中反复迭代,直到输出。
循环深度与思维链(Chain of Thought)有何区别?
思维链模型(如DeepSeek-R1)会生成可见的推理token,逐步展示思考过程;而循环深度在潜空间迭代计算,不生成可见的思考token,因此过程不可见。循环深度省内存、省时间,但无法监控其内部推理。
为什么说中间token不能被视为真正的推理痕迹?
研究表明,中间token与推理的语义有效性只有松散相关性。例如,迷宫实验中轨迹正确性与最终答案正确性相关性弱;互换轨迹训练模型仍能获得高准确率;用错误中间轨迹配正确答案微调效果甚至更好。因此,中间token可能只是格式模式,而非真正的推理步骤。
循环深度技术可能带来哪些安全风险?
循环深度使推理过程不可见,增加了监控难度,可能隐藏模型的错误或恶意行为。OpenAI前安全负责人Steven Adler称其触碰了AI行业红线,因为无法判断模型是否在干坏事。此外,可能引发不透明推理竞赛,加剧监管难题。
OpenAI Astra为什么选择隐藏思维链?
除了安全考量,更现实的商业原因是防止模型蒸馏。思维链被视为核心算法,公开后竞争对手可收集高质量数据训练竞品模型,瓦解技术护城河。因此,隐藏思维链是为了保护商业利益。
根据文章,我们应该如何正确看待AI的输出?
文章建议,使用AI时应选择有明确外部验证标准的任务,将每个输出视为建议而非结论,并保留外部人工验证。因为Transformer本质是采样器而非推理引擎,循环深度或思维链都不能保证推理的正确性。