CARL-GT:评估大型语言模型的因果推理能力

📝

内容提要

本研究针对大型语言模型(LLMs)在因果推理能力上的评估缺乏基准的问题,提出了一个名为CARL-GT的基准,旨在通过图形和表格数据来评估LLMs的因果推理能力。实验表明,LLMs在因果推理,尤其是使用表格数据发掘新见解方面仍显不足,同时不同任务之间的表现存在显著差异。

🏷️

标签

➡️

继续阅读