研究发现,单个神经元能够绕过大型语言模型的安全对齐。通过针对拒绝神经元和概念神经元的研究,发现可以在不进行训练的情况下抑制有害请求或从无害提示中引发有害内容。这表明安全对齐并非均匀分布,而是由个别神经元决定。
英国通信管理局(Ofcom)发布了针对主要流媒体平台的新监管草案,要求流媒体服务遵循与传统广播相似的内容标准和无障碍要求。这些提案包括对有害内容的警告、儿童保护及新闻公正性要求。此外,大型平台需满足字幕、音频描述和手语翻译的配额,以改善1800万听力或视力障碍人士的观看体验。
研究表明,古典语言如文言文和拉丁语能够绕过主流大模型的安全机制,导致100%成功输出有害内容。这是由于训练数据不平衡和古典语言缺乏安全对齐。此现象提醒AI行业重视多语言安全,重建评估体系,提升跨语言安全能力。
谷歌副总裁Christy Abizaid在“数字时代成长”峰会上指出,生成性AI为学习和创造带来新机遇,但必须确保年轻用户的安全。谷歌采取严格政策,防止有害内容,并进行全面测试,确保AI工具安全适龄,同时促进AI素养和批判性思维的发展。
本文探讨了大型语言模型(LLMs)在生成有害内容方面的滥用问题,重点分析了防止生成不安全信息的过滤挑战。研究发现,输入提示和输出结果的过滤存在计算困难,尤其在构造对抗性提示时,难以有效区分有害与良性提示。此外,输出过滤在某些情况下也不可行。结论指出,安全性不能仅依赖外部过滤器,AI系统的智能与判断是不可分割的。
麻省理工学院的研究发现,大型语言模型(LLMs)有时会错误依赖语法模式而非领域知识,导致在新任务中表现不佳,甚至可能被恶意利用生成有害内容。研究人员开发了一种基准测试程序,以评估模型对错误关联的依赖,从而帮助开发者在部署前减轻这一问题。
英国的新年龄验证规则容易被绕过,用户可通过VPN轻松规避。这些规则旨在保护儿童,但许多平台仅依赖IP地址进行验证,未能有效阻止青少年访问。青少年使用VPN和广告拦截器等工具,显示出规则的漏洞。
媒体观察组织Media Matters发现,谷歌的AI视频生成工具Veo 3制作的种族主义视频在TikTok上获得数百万观看,主要针对黑人,且每个视频仅八秒。尽管谷歌和TikTok声称会阻止有害内容,但类似视频仍在YouTube和Instagram上出现。
本研究提出了一种无监督的实时框架,能够监测大型语言模型(LLMs)生成的有害内容,尤其是后门触发的响应。该框架在有害输出出现前进行预测,准确率达到96%,有效检测有害行为。
OpenAI的内容审核API通过评估用户输入来检测有害内容,提供初步保护。系统读取文本文件中的标记提示,结果包括分类分数和时间戳。不同领域的风险阈值不同,低于0.3为低风险,超过0.7可能触发标记。审核结果以JSON格式存储,便于后续分析和人类审核。
本文介绍了MemeBLIP2,一个轻量级的多模态系统,结合图像和文本特征,旨在检测有害表情包内容。实验结果表明,该系统能够有效捕捉细微线索,提升检测能力。
Amazon Bedrock Guardrails推出新功能,帮助企业更有效地实施负责任的人工智能政策。该服务可高达88%的准确率检测有害内容,支持多模态内容过滤,增强隐私保护,确保生成式AI应用的安全合规。
本研究探讨了大规模语言模型在输出重复、幻觉和有害内容方面的挑战,提出基于第一原理的物理理论,并分析了注意力机制。引入三体注意力模型可提升AI性能,增强其可信度和抵御操控能力。
本研究探讨了开发者在编码任务中依赖大型语言模型(LLM)的潜在危害,并提出了一种评估框架。研究发现,不同LLM在无害性对齐方面存在显著差异,某些模型可能导致有害内容,而较大模型则更有用。这为软件工程任务的对齐策略提供了重要见解。
Instagram推出“学校合作计划”,优先处理学校区举报的有害内容,适用于美国中学和高中,旨在帮助教育者和家长安全使用Instagram。
本研究探讨了大语言模型生成有害内容的滥用问题,指出现有检测技术的不足,并提出了一种鲁棒微调过程,以提升检测器在模糊处理和分布外数据下的稳健性和准确性。
本研究提出了“严格偏好采样”(HPS)框架,以提高大型语言模型(LLM)与人类偏好的对齐效率和鲁棒性。HPS通过重视受欢迎的响应并拒绝有害内容,显著降低计算成本,并有效减少生成有害内容的风险。
本研究评估大型语言模型(LLMs)与未满18岁儿童互动的安全性,提出创新评估方法,发现六种先进LLMs在防止儿童接触有害内容方面存在显著漏洞。
中国初创公司DeepSeek推出的语言模型DeepSeek R1在性能上与OpenAI的模型相当,但存在严重的安全缺陷,研究表明其对有害提示的攻击成功率高达100%,未能有效阻止有害内容,显示出成本效益与安全性之间的重大折衷。
本研究探讨了大语言模型在微调攻击下的安全漏洞,特别是Chain of Thought(CoT)推理模型DeepSeek的表现。研究表明,微调可能操控模型输出,增加产生有害内容的风险,强调了CoT模型在安全性和伦理部署中的重要性。
完成下面两步后,将自动完成登录并继续当前操作。