2024年,加拿大法庭裁定加拿大航空公司需对其聊天机器人的虚假丧失政策负责,尽管赔偿仅为812加元,此判决强调公司需对AI的错误承担责任。2019年的研究指出,医疗算法系统性忽视黑人患者。AI事件数据库记录了700多起失败案例,凸显治理问题的重要性。文章提供了构建AI治理系统的四个Python组件,包括模型卡生成器和偏见检测管道,以帮助开发者遵循EU AI法案和NIST AI风险管理框架。
CustomerAI是一个开源工具,旨在识别和减少金融、医疗、HR和零售等领域机器学习系统中的偏见。它支持多种框架,适合云部署,并符合监管要求,提供偏见检测和缓解策略,以实现公平的AI应用。
本研究提出了BIASINSPECTOR框架,旨在自动检测结构化数据中的偏见,克服现有技术的局限性。该框架通过多代理协作,有效识别偏见,提升数据应用的公正性。
本研究提出了一种新方法,通过规则定义检测训练数据中的偏见和缺陷,以建立可信的模型基准。该方法适用于小规模数据集,扩展了传统统计测试的应用。
随着人工智能的发展,AI模型的自动化测试变得至关重要。自动化测试提升了效率、准确性和可扩展性,能够处理复杂数据集和模型。关键领域包括数据验证、模型性能、偏见检测和可解释性。工具如Genqe.ai可简化测试流程,确保AI系统的可靠性和合规性。
本文探讨了大型语言模型(LLM)输出中的偏见检测,强调统计方法的重要性。LLM在文本生成和情感分析等任务中表现优异,但仍存在性别、社会经济和能力等偏见。通过数据分布分析、嵌入测试和AI公平性360框架等方法,可以量化和检测这些偏见。研究者们致力于提高模型的透明度和公平性,以减少偏见带来的歧视。
本研究提出了一种新方法,针对多保护属性下的偏见检测问题,将其重新定义为测度空间中的点到子空间问题,展示了高效的子抽样能力,具有重要的实际应用价值。
本研究探讨了新闻文章中的多重偏见,强调综合性偏见检测的重要性。通过大型语言模型构建数据集,使用多种检测技术,旨在提高新闻文章的完整性,增强公众对媒体的信任。
本研究提出了ViLBias框架,结合语言模型与视觉-语言模型,提升偏见新闻检测的准确性3至5%。该方法为媒体偏见检测提供了更强大且可扩展的解决方案。
本文分析了大型语言模型中的偏见检测方法,比较了语境化和静态单词嵌入的效果,强调了去偏方法的必要性,并提出了缓解策略以增强模型性能。
本研究探讨了自然语言处理中的偏见检测与减轻方法,特别是在机器翻译领域。分析表明,现有研究主要集中于少数语言,未来应扩大研究范围以提高多样性。
本文探讨了机器学习中实现公平性的多种方法,包括对抗学习、偏见检测和数据预处理算法。研究提出了新的分类器和算法,旨在减少训练数据中的不公平性,并通过实证分析验证其有效性。这些方法强调在不损害模型准确性的情况下提高公平性和透明度。
该论文提出了一种自动化流程,用于抓取和检测大学报纸档案中的偏见,生成了包含23,154个条目的数据集。通过比较语言模型摘要与原文情绪,计算偏见。研究发现现有自动模型在偏见检测上能力不足,需改进。提出的DocNet模型在资源有限环境中表现优越,能有效检测政治偏见。未来研究应整合最新机器学习进展,提升偏见评估策略。
IndiBias是一个评估印度社会偏见的数据集,包含800个句子,提供英语和印地语版本。研究比较了不同语言模型的偏见表现,发现大多数模型在交叉群体中存在偏见。文章分析了偏见检测方法的有效性,并提出改进方向,以建立更公平的语言模型。
本文探讨了自然语言生成中的厌恶问题,指出通用的“有害性”分类器不足以评估。通过分析 Reddit 上的 Incel 社区数据,研究表明特定词汇索引方法能更有效地评估厌恶。同时介绍了 Biasly 数据集,旨在捕捉对女性的厌恶,适用于多种 NLP 任务,促进 AI 在偏见检测和消除中的社会价值。
本研究探讨了社交媒体文本摘要模型的偏见问题,发现大多数模型存在固有偏见。通过调整训练数据的主题多样性和微调方法,提出了一种改进的摘要生成框架,能够生成更高质量和一致性的摘要。此外,研究还介绍了基于推文的政治偏见检测和个性化摘要生成方法,显示出在多个基准测试中优于传统技术。
该文介绍了一个名为“Nbias”的框架,用于检测和消除文本数据中的偏见,确保数据的公正和道德使用。该框架包括数据层、语料库构建、模型开发层和评估层,并应用了基于transformer的标记分类模型识别具有独特命名实体的偏见词语/短语。通过定量和定性评估的混合方法,该方法能够取得1%至8%的准确率改进,并促进了文本数据的公正和道德使用。
本文提出了一种新的基于风险差的算法,用于量化受保护变量在图中的歧视影响力,并提出了一种快速适应的偏差控制方法,以减少元学习中组的不公平性。实验结果表明,该方法可以高效地检测偏见并减轻模型输出上的偏见以及对训练样本量少的未见任务的精度和公平度的泛化。
该研究探索了新兴的提示工程领域,应用于检测语言模型偏见的下游任务。研究者设计了4种不同类型偏见的提示,并在多个模型上应用这些提示进行评估。研究者提供了这些模型的比较分析,并采用两种方法进行评估。
本文提出了一种新的基于风险差的算法,通过创建因果贝叶斯知识图,发现了机器学习模型中的偏见,并量化了每个受保护变量在图中的歧视影响力。同时,还提出了一种快速适应的偏差控制方法,有效减少了元学习中组的不公平性。通过实验验证了该方法可以高效地检测偏见,并减轻模型输出上的偏见,同时在训练样本量少的未见任务上具有较好的精度和公平度的泛化能力。
完成下面两步后,将自动完成登录并继续当前操作。