小红花·文摘

本研究提出了MEMERAG，一个多语言端到端元评估基准，旨在解决现有评估主要集中于英语的问题。通过使用本土语言问题和多种大型语言模型生成的响应，增强了评估的准确性，实验结果表明该基准能有效识别多语言自动评估者的改进效果。