研究表明,AI在社会判断中存在严重的视觉偏见,尤其体现在穿衣风格、年龄和体型上。六种多模态模型对五百张假脸进行评估,发现AI比人类更容易以貌取人,尤其对穿着和体型的偏见更为明显。穿着风格对AI的判断影响最大,甚至超过种族和性别。这些偏见反映了人类社会的刻板印象,强调了外观在与AI互动中的重要性。
文章探讨了偏见的形成及其社会影响。人们倾向于将好事归因于“我们”,而坏事归咎于“他们”,这种分类源于人类的认知机制,导致刻板印象的产生。社会压力和算法的影响加剧了偏见的传播。尽管偏见根深蒂固,但通过反思和重新定义身份边界,可以逐步减少其影响。
ProText是一个用于测量长文本中性别化和误性别化的数据集,涵盖主题名词、主题类别和代词类别。该数据集旨在通过先进的语言模型探讨文本转换中的性别偏见和刻板印象,研究发现模型在缺乏明确性别线索时倾向于默认异性恋假设,揭示了系统性性别偏见。
我黑入了Monster Energy,揭示了品牌对消费者外貌的误解和刻板印象,以及其对目标受众的定位。
我揭示了Monster Energy对消费者外貌的误解和刻板印象,探讨了品牌如何看待和定位目标受众。
程序员的刻板印象多样,包括追求潮流的技术迷、怀疑技术的人、内向的天才和社交能力强的程序员等,每种类型都有独特特点和编程哲学,展现了编程世界的多样性。
本研究探讨大型语言模型在生成多语言响应时的文化知识差异。提供文化上下文可提升模型的本地化能力,并发现可跨非英语语言使用的文化定制向量,从而增强多样性并减少刻板印象。
本研究探讨大型语言模型的性别偏见表现,发现其能够中等程度推测性别,但仍受刻板印象影响,需加强偏见缓解策略。
本研究探讨了大语言模型在欺骗攻击下的脆弱性,尽管经过训练以抵制误导性内容,但仍可能被突破,导致生成仇恨言论和刻板印象。因此,保护这些模型免受欺骗攻击至关重要。
本研究探讨生成语言模型中的偏见与任务特定缺陷之间的关系,提出了一种偏见缓解框架,通过指令微调减少了60%以上的刻板印象输出,强调了区分“偏见”与其他错误的重要性。
文章探讨了对“叙利亚风格”称谓的误解,强调设计应传达空间的氛围与理念。作者认为设计应关注情感与关怀,而非仅仅追求流行元素,避免用刻板印象定义风格。
本研究探讨用户姓名等身份细微线索如何影响ChatGPT的回应,关注是否会引发有害刻板印象,同时希望ChatGPT能根据用户偏好调整回答,避免引入偏见。
ChatGPT是一种语言模型,对非“标准”英语存在偏见,包括刻板印象和贬低内容,理解能力较差,回答傲慢。该模型更多地模仿标准美式英语,但也经常模仿使用人数更多的其他变体。它默认使用美国惯例,对非美国用户造成了困扰。母语者评级显示,对非“标准”英语的回答在刻板印象、理解能力、自然度和傲慢程度方面较差。新一代模型GPT-4加剧了刻板印象。这种现象延续了语言歧视,强化了权力动态,对少数语言社群造成了伤害。
研究表明,英语语料库中的性别偏见体现在词嵌入中,男性与技术、暴力等概念相关,女性则与外观、厨房等相关。男性词汇情感更强,女性词汇更温馨。此外,男女在语言使用、情感表达和社交网络中存在差异,揭示了性别刻板印象对语言的影响。
本文探讨了大型语言模型(LLMs)中的社会偏见及其评估方法,提出了大型语言模型偏差指数(LLMBI)以量化多维度偏见,并强调监测和校准模型以提高公平性。实证分析显示,LLMs在文本生成中存在显著偏见,影响其作为评估器的有效性。研究还提出了新的测试和度量方式,以减少性别、种族等刻板印象的负面影响。
本研究提出了一个四阶段框架,用于评估大型语言模型(LLMs)中的刻板印象和偏见,并包含多维度评估指标。以教育领域为例,构建了Edu-FairBench,发现五个LLMs存在不同程度的偏见。研究还探讨了性别偏见的检测和缓解方法,强调提高自然语言处理系统公平性的重要性。
这项研究分析了三种流行的生成AI工具(Midjourney、Stable Diffusion和DALLE 2)中的性别和种族偏见。结果表明,AI生成的图像可能放大了训练数据中的刻板印象,且偏见与数据集大小和模型设计相关。研究还探讨了缓解这些偏见的方法及其社会影响。
本研究构建了多维度刻板印象数据集和新型分类器,评估了大型语言模型(LLM)的刻板印象行为,发现性别和种族偏见依然存在,并提出了新的评估框架以量化偏见,强调了解决人工智能中的伦理风险的重要性。
研究发现,为ChatGPT分配假想角色会增加生成结果的亵渎程度,存在刻板印象、有害对话和伤人观点。研究呼吁AI社区重新思考安全措施,开发更好的技术实现强大、安全和值得信赖的AI系统。
本研究提出了一种四阶段的框架,用于评估大型语言模型生成的内容中的刻板印象和偏见。以教育领域为案例研究,构建了Edu-FairBench,并发现五个LLMs存在不同程度的刻板印象和偏见。自动评估方法与人工注释相关性高。
完成下面两步后,将自动完成登录并继续当前操作。