A Non-Judgmental Benchmark for Open-Ended Generation of Large Language Models Based on Distributional Assumptions

💡 原文英文,约100词,阅读约需1分钟。
📝

内容提要

本研究提出了一种新基准,通过n-gram统计和规则评估大型语言模型(LLMs)的开放式文本生成,避免了人工判断的依赖。该基准与GPT-4o评估高度相关,显著降低了计算资源消耗,展示了其有效性。

🏷️

标签

➡️

继续阅读