PPTC 基准:评估大型语言模型对于 PowerPoint 任务完成的能力

💡 原文中文,约400字,阅读约需1分钟。
📝

内容提要

本研究记录了医院中患者、陪伴者和社交机器人之间的29个多方对话,并对此语料库进行了注释。GPT-3.5-turbo在少样本设置中表现最佳。多方对话仍然是大规模语言模型的挑战。

🏷️

标签

➡️

继续阅读