CARL-GT:评估大型语言模型的因果推理能力
📝
内容提要
本研究针对大型语言模型(LLMs)在因果推理能力上的评估缺乏基准的问题,提出了一个名为CARL-GT的基准,旨在通过图形和表格数据来评估LLMs的因果推理能力。实验表明,LLMs在因果推理,尤其是使用表格数据发掘新见解方面仍显不足,同时不同任务之间的表现存在显著差异。
🏷️
本研究针对大型语言模型(LLMs)在因果推理能力上的评估缺乏基准的问题,提出了一个名为CARL-GT的基准,旨在通过图形和表格数据来评估LLMs的因果推理能力。实验表明,LLMs在因果推理,尤其是使用表格数据发掘新见解方面仍显不足,同时不同任务之间的表现存在显著差异。