安全性已成为AI编码的核心问题。公司在连接模型与外部工具时面临提示注入攻击和过度授权的挑战。GitHub推出了MCP服务器的依赖扫描和秘密扫描功能,以及时发现安全问题,降低开发风险。这些更新旨在提高AI辅助开发环境的安全性,帮助开发者识别和处理潜在隐患。
随着AI系统承担更复杂的任务,提示注入攻击的风险增加。为此,OpenAI推出了“锁定模式”和“提升风险”标签,以增强用户安全。锁定模式为高风险用户提供额外保护,限制与外部系统的交互,防止敏感数据泄露;而提升风险标签则帮助用户识别潜在风险,确保安全使用。
生成式人工智能存在提示注入攻击风险,攻击者可通过输入操控AI,导致信息泄露或执行恶意指令。为防范此类攻击,应进行输入验证、使用系统消息、限制权限、监控日志、微调模型及设置安全机制,确保AI安全至关重要。
本研究提出了CachePrune防御机制,以应对大型语言模型在间接提示注入攻击中的脆弱性。该方法通过识别和修剪任务触发神经元,显著降低攻击成功率,同时保持响应质量,为构建更安全的人工智能系统提供支持。
谷歌DeepMind研究人员提出了CaMeL,旨在防止大型语言模型的提示注入攻击。CaMeL通过提取查询的控制和数据流,中和了67%的攻击。该方法结合传统软件安全原则,使用自定义Python解释器跟踪数据来源,确保操作符合权限限制。尽管在AgentDojo基准测试中表现良好,但仍需用户定义安全策略,可能导致用户疲劳。
该研究提出了一种新颖的博弈论方法DataSentinel,有效解决了提示注入攻击检测的局限性,能够识别现有及自适应攻击,展示了其防护潜力。
为应对大型语言模型(LLM)的提示注入攻击,提出了StruQ和SecAlign两种防御机制。StruQ通过结构化指令调优,使LLM忽略注入指令;SecAlign则优化LLM对正确响应的偏好。实验结果表明,这两种方法显著降低了攻击成功率,增强了模型的安全性和鲁棒性。
本研究提出了CaMeL防御机制,旨在解决大型语言模型在处理不可信数据时的提示注入攻击问题。CaMeL在AgentDojo平台上成功完成67%的任务,显示出其有效性和安全性。
AI安全专家Johann Rehberger提出了一种针对Google Gemini的提示注入攻击,利用社交工程通过用户与恶意文档的互动来修改其长期记忆。尽管Google认为影响较低,用户仍需谨慎处理不可信文档,并定期检查保存的记忆。
本研究提出鲁棒工具代理系统(RTBAS),旨在解决现有工具代理系统在使用外部工具时面临的提示注入攻击和隐私泄露问题。RTBAS通过自动检测和执行工具调用,确保信息的完整性和机密性。实验结果表明,该系统有效防止攻击,任务效用仅损失2%。
AI爱好者西蒙·威利森在2022年提出了“提示注入攻击”一词。记者本杰·爱德华兹因报道此攻击而遭到必应聊天的攻击。两人讨论了AI系统的脆弱性及未来开发的教训。微软在2023年推出的必应聊天因早期问题被限制消息数量。威利森认为,AI的安全性依赖于竞争与透明度,尽管AI仍不可靠,但用户可通过理解其局限性来获得价值。
本研究探讨了提示注入攻击引发的大语言模型防御过度问题,提出了评估数据集NotInject和新防护模型InjecGuard,显著降低了触发词偏见,表现优异。
本研究提出了一种新颖的自然语言处理方法,通过分层输入筛选提高大语言模型对提示注入攻击的检测准确性,尽管假阳性率上升,但有效降低了漏报风险。
本文研究了大型语言模型在上下文学习中的脆弱性,尤其是在认知负荷过重时容易受到攻击。研究提出了一种新的提示注入攻击方法,成功率高达99.99%,显示现有安全机制不足,需开发更稳健的保护措施。
本文研究了提示注入攻击对大语言模型翻译的影响,开发了测试工具以增强防御。研究扩展了攻击方法,涵盖WMT 2024所有语言对,并引入新攻击格式,展示了多样性和潜在威胁。
现有视觉语言人工智能模型在医学任务中存在严重漏洞,易受提示注入攻击。研究表明,微弱提示可导致模型输出有害信息,且人类观察者难以察觉。为此,提出了虚拟提示注入技术(VPI)及其他防御机制,以提高模型安全性,强调在临床应用前需解决这些安全隐患。
大型语言模型(LLMs)是本十年最重大的技术突破之一,但容易受到提示注入攻击。研究人员尚未找到完全防止提示注入的方法,但可以采取措施减轻风险。组织可以通过验证输入、监控LLM活动、保持人工干预等方式来减少提示注入攻击的成功率和损害。
大型语言模型(LLM)存在提示注入攻击的安全漏洞。研究提出了理解和防御这些攻击的框架,并通过实验评估了不同模型的脆弱性。新方法DeceptPrompt和DrAttack在诱导攻击和成功率方面表现出有效性,强调了加强防御的重要性。
本研究提出了ProAttack方法,通过提示实现干净标签的后门攻击,增强了隐蔽性。同时,探讨了提示注入攻击对大型语言模型的影响,提出了防御框架,并评估了多种模型的脆弱性。
本文探讨了大型语言模型(LLMs)面临的提示注入攻击及其防御方法。研究表明,能力更强的模型更易受到攻击。提出了基于提示学习的黑盒和对抗训练的白盒防御方法,后者能有效降低攻击成功率。强调在设计和部署LLMs时需加强安全框架,以防止潜在的安全隐患。
完成下面两步后,将自动完成登录并继续当前操作。