Multi-IF: Benchmarking LLMs on Multi-Turn and Multilingual Instruction Following

💡 原文英文,约100词,阅读约需1分钟。
📝

内容提要

本研究提出了Multi-IF基准,以评估大型语言模型(LLMs)在多轮和多语种指令执行中的能力。研究发现,最新的LLM在多轮指令执行中的失败率显著提高,尤其是在非拉丁文字语言中,显示出其多语种能力的局限性。

🏷️

标签

➡️

继续阅读