内容提要
研究测试语言模型通过自然语言传递树状表达式时的信息损耗:一模型生成应用题,另一模型提取表达式,以符号等价判定。结果显示通道有损且不对称,角色互换后准确率差达60.4个百分点;至少73.6%的失败源于生成端,难度取决于树结构;约3600条微调样本即可提升所有开源模型。
延伸解读
往返协议如何量化通信损耗
文章采用往返协议:一个模型将算术表达式转化为应用题,另一个模型从应用题中提取表达式,再通过符号等价精确判断是否成功。这种方法能分离生成和提取环节的质量,并构建通信矩阵。通过评估十六个模型的 pairwise 组合,研究者发现通道有损且不对称,角色互换后准确率差异可达60.4个百分点,最佳组合准确率为92.9%。
失败主要源于生成端且受树结构影响
分析表明,至少73.6%的往返失败起源于生成阶段,而非提取阶段。难度主要由树结构特征驱动,如运算符数量、深度和右分支情况,而非模型家族。这意味着改进生成端的序列化能力可能比优化提取端更有效,且树结构越复杂,通信损耗越大。
微调可提升通信能力但仍有前沿差距
通道具有可训练性:约3600条与评估共享运算符和树形状的微调样本,就能将所有开源模型提升到超过未训练的Gemini-3.1-Pro(匹配语义下的上界)。在具有新运算符和词汇的不相交领域,微调同样提升了所有开源模型,证实增益并非匹配语义的假象,但与前沿模型仍存在差距。
Q&A
语言模型在传递树状表达式时,信息损耗有多大?
研究显示,通道是有损且不对称的。交换生成和提取模型后,准确率变化可达60.4个百分点。最佳组合(不同模型分别生成和提取)达到92.9%的准确率。
为什么语言模型在往返传递树状表达式时经常失败?
至少73.6%的往返失败源于生成端,即生成模型将表达式转化为文字问题时引入错误。难度主要由树结构(如操作符数量、深度、右分支)决定,而非模型家族。
如何提升语言模型传递树状表达式的准确性?
使用约3600条与评估共享操作符和树形状的微调样本,可以提升所有开源权重模型,使其超过未训练的Gemini-3.1-Pro。即使在新操作符和词汇的不相交领域,微调也能提升所有开源模型,但前沿模型仍有差距。
树状表达式序列化的往返协议是如何设计的?
协议包括:一个生成器将程序生成的算术表达式转化为文字问题,一个独立的提取器仅从文字问题中恢复表达式,然后通过符号等价性进行精确判定。评估所有十六个模型的成对组合,得到通信矩阵。
树结构中的哪些因素影响语言模型通信的难度?
难度由树结构驱动,包括操作符数量、深度和右分支。这些结构因素比模型家族更能决定通信的准确性。
不同模型组合在树状表达式通信中的表现如何?
最佳组合是使用不同模型分别进行生成和提取,达到92.9%的准确率,优于同一模型同时负责生成和提取。交换生成和提取角色会导致准确率变化高达60.4个百分点。