研究测试语言模型通过自然语言传递树状表达式时的信息损耗:一模型生成应用题,另一模型提取表达式,以符号等价判定。结果显示通道有损且不对称,角色互换后准确率差达60.4个百分点;至少73.6%的失败源于生成端,难度取决于树结构;约3600条微调样本即可提升所有开源模型。
本研究提出了一种新框架,通过符号等价和语义一致性方法,评估和选择最佳的自动形式化结果,准确性提高了0.22至1.35倍。
完成下面两步后,将自动完成登录并继续当前操作。