小红花·文摘

研究分析大型语言模型在因果推断中对未知现象的泛化能力。通过多层次问题复杂度的数据集，测试五个模型在四个任务上的表现。结果表明，模型在简单问题上表现良好，但在复杂问题上表现不佳，术语干扰影响其泛化能力。