OpenAI因安全考量放缓前沿模型研发,新模型Astra已达关键网络安全能力门槛。公司暂停强化学习训练两周,加强研究环境隔离、监控和红队测试,防范模型逃逸。监控开销约占推理算力20%,若安全条件不达标,将继续暂停或放缓训练。
在AI工程中,评估管道至关重要,通常被忽视。有效评估需包含数据集、标准、执行器和打分器。使用大型语言模型(LLM)作为裁判可以解决缺乏标准答案的问题,但需警惕偏见。评估应关注领域能力、生成质量和指令遵循。红队测试应持续进行,以应对用户的创新使用方式。建立评估管道可防止模型回归,确保AI系统质量。
谷歌在网络安全方面采取了多种现代化措施,包括威胁检测、漏洞管理和利用AI增强防御能力。通过安全设计和网络安全策略,确保云环境的安全性,并利用威胁情报追踪网络犯罪,通过红队测试发现系统弱点。
OpenAI推出的Guardrails安全框架旨在提升AI安全性,但研究显示其存在漏洞,攻击者可通过提示注入绕过安全检测,生成有害内容。这一发现突显了保护AI系统的挑战,专家建议采用独立验证和红队测试以增强防御。
本文介绍了PersonaTeaming方法,通过引入角色提升AI模型在自动化红队测试中的风险识别能力。该方法利用“红队专家”或“普通用户”角色生成对抗性提示,实验结果显示攻击成功率提高了144.1%。研究分析了不同角色类型和变异方法的优缺点,为未来自动化与人工红队测试的结合提供了新思路。
2015年,我创立了一家专注于自动化渗透测试的网络安全软件公司。随着AI的发展,未来五年内,安全验证方式将发生显著变化。Pentera的愿景是通过AI实现情境化红队测试,使安全验证更加智能和互动。AI将贯穿测试生命周期,提高攻击模拟的准确性和实时性,保障企业安全。
在访谈中,The Motley Fool的Paolo del Mundo探讨了企业如何通过防护机制扩展AI应用,降低生成式AI的风险,包括提示注入和数据泄露。安全从业者需关注新型漏洞,OWASP大语言模型十大风险清单是良好起点。企业应清点LLM使用情况,确保负责任使用,实施输入输出净化和访问控制,保护敏感数据。红队测试和安全工具的集成至关重要,以确保模型行为受控并提升安全意识。
谷歌DeepMind发布白皮书,介绍Gemini 2.5在安全性方面的提升,特别是针对间接提示注入攻击的防御。通过自动化红队测试和模型强化,Gemini的防御能力显著提高,降低了攻击成功率,但仍需持续改进以应对不断演变的威胁。
本研究探讨了大型语言模型(LLMs)在红队测试中的局限性,并提出通过代码混合和语音扰动的新策略。研究表明,利用语音错误拼写的混合提示,成功绕过安全过滤器,文本和图像生成任务的成功率分别为99%和78%,对多语言模型的安全性改进具有重要意义。
伊利亚·苏茨克维尔指出,AI系统推理能力越强,行为越不可预测。他强调AI代理面临外部操控风险,需通过红队测试确保安全。红队模拟攻击以识别脆弱性,帮助开发者改进安全措施,应对复杂环境挑战。
AI系统在生活中日益重要,但存在缺陷。红队测试可识别其弱点,确保安全性。通过模拟攻击和偏见识别,组织能够改进系统,防止严重问题。随着AI技术的发展,建立强有力的安全措施至关重要。
本文总结了一项研究,分析了100种生成性AI产品的安全漏洞。通过红队测试,识别攻击向量和防御策略,并提出改进AI系统安全的建议。
全国公安机关去年侦破1600余起网络黑客案,抓获4900人,维护网络安全。英国提议禁止公共部门支付勒索款,美国金融机构因数据泄露被罚超1.4亿元。微软认为红队测试仍需人类参与,多个行业和机构遭遇勒索软件攻击。
微软研究人员指出,尽管AI工具能简化红队测试中的攻击模拟,但人类的专业知识在发现漏洞和评估风险方面仍不可或缺。研究强调文化能力和情商在AI安全中的重要性,并指出生成式AI模型可能带来新漏洞,需关注操作员的心理健康。
本研究提出生成对抗后缀提示器(GASP),旨在增强大型语言模型对越狱攻击的抵抗力。该方法结合人类可读提示生成与贝叶斯优化,显著提高攻击成功率,缩短训练时间,加快推理速度,为红队测试提供高效解决方案。
研究提出了一种新方法,通过“学生-教师”对抗模型测试AI系统的安全性。学生模型尝试规避教师模型的检测,揭示系统漏洞,类似红队测试。此方法旨在提高AI模型的可靠性,但其可扩展性、效率和伦理影响需进一步研究。
本文探讨了大型语言模型(LLMs)的红队测试,旨在发现和减少潜在危害。研究通过分析模型行为、建立不良行为标准和应用红队方法,识别可引发有毒言论的提示,并构建了包含20,000条声明的CommonClaim数据集。提出了ASSERT和MART等自动红队技术,以提升模型安全性。同时引入HarmBench框架,比较多种红队测试方法,增强LLMs的鲁棒性,推动攻击与防御的共同发展。
文章列出了参与红队测试的个人和组织,强调了社区合作与伦理安全的重要性。
本文探讨了大型语言模型的红队测试,提出了ASSERT方法以评估模型在不同环境下的鲁棒性。尽管现有模型有安全措施,但在语义相关场景中仍存在分类准确率差异,可能影响用户安全。此外,研究还涉及检测生成有害回应和改进翻译模型性能的方法。
微软发布了首份负责任人工智能透明报告,强调2023年在安全部署AI产品方面的成就。报告指出,微软创建了30个负责任AI工具,增强了团队,并要求生成性AI应用在开发过程中评估风险。此外,微软为Azure AI客户提供了检测有害内容的工具,并扩展了红队测试,以确保AI模型的安全性。尽管面临争议,微软仍致力于负责任AI的持续改进。
完成下面两步后,将自动完成登录并继续当前操作。