小红花·文摘

本文提出了一种推理一致性评估指标，分析大型语言模型在高中数学新问题上的推理能力。研究发现，推理步骤增多时，模型的准确率显著下降，主要问题在于推导结论的能力，而理解输入前提的能力相对稳定。

BriefGPT - AI 论文速递 ·

本文提出了一种新型非线性回归模型，用于在小效应和强混淆情况下估计异质性治疗效应。该模型通过将倾向函数估计值纳入响应模型，避免了标准模型的偏倚问题。在吸烟对医疗支出的因果效应分析中，该方法表现出色，并有效处理聚类误差等挑战。

BriefGPT - AI 论文速递 ·