金融领域大型语言模型的不足:幻觉的实证研究
现有的大型语言模型在金融任务中存在严重的幻觉问题,迫切需要研究努力来缓解这一问题。
该研究通过细致分类和度、方向及类别上的倾向进行细粒度的幻视建模和缓解。提供了两个幻视方向(FM 和 SL)的全面理解,并将其进一步细分为内在和外在,分为温和、中度和令人担忧的三个严重程度,同时还对幻视进行了六种类型的细致分类。提供了包含75,000个样本和人工注释的HallucInation eLiciTation(HILT)数据集。提出了Hallucination Vulnerability Index(HVI),该指数可以量化和评估语言模型在产生幻视方面的脆弱性,并作为人工智能相关政策制定的标准工具。