Are Large Language Models Prescient? A Continuous Evaluation Based on Daily News

💡 原文英文,约100词,阅读约需1分钟。
📝

内容提要

本研究探讨了大型语言模型(LLM)的评估方法,提出通过预测未来事件和生成问答对进行连续评估。研究表明,LLM的性能随时间下降,强调了持续更新模型的重要性。

🏷️

标签

➡️

继续阅读