小红花·文摘

本研究提出CausalGraph2LLM基准，用于评估大型语言模型在因果推理中的能力。结果显示，尽管这些模型有潜力，但对编码的敏感性很高，像GPT-4和Gemini-1.5的表现差异可达60%。