一品威客平台服务升级,从匹配执行者转向匹配判断者。企业需求从“能干活的人”变为“能判断的人”,平台汇聚能提供专业判断和过程服务的服务商,可理解业务目标、提供建议并对结果负责。平台已有超2700万注册用户,创意服务涵盖设计、开发、人工智能、文案、营销、视频等300多个细项。
本研究解决了自动文本摘要评估指标和大型语言模型(LLM)作为评判者模型在西班牙语和巴斯克语中的有效性不足的问题。通过新的BASSE数据集,我们收集了2040个摘要的人类评估数据,结果显示专有评判的LLM与人类判断的相关性最高,这为多语言摘要评估提供了重要的见解和影响。发表的BASSE数据集和代码为后续研究提供了基础。
完成下面两步后,将自动完成登录并继续当前操作。