小红花·文摘
  • 首页
  • AI Tokens🪙
  • 排行榜🏆
  • 直播
  • FAQ
我们发现,每5个MCP访问策略中就有1个返回时已损坏或缺失

2026年MCP协议更新聚焦授权,暴露原信任模型缺陷。研究显示,MCP服务器易受提示注入攻击,平均攻击成功率达36.5%。多数服务器权限过大,仅8.5%使用OAuth,超半数依赖静态密钥。企业AI活动常通过个人账户运行,超20%访问策略缺失或失效。核心问题在于组织无法区分无害工具与持有生产令牌的工具,缺乏清单和轮换机制。

我们发现,每5个MCP访问策略中就有1个返回时已损坏或缺失

The New Stack The New Stack · 2026-09-10T15:00:00Z
Claude in Chrome 现已全面上线

Anthropic宣布Claude in Chrome正式上线,支持所有付费计划,可自主执行浏览器操作。为防提示注入攻击,系统采用分类器验证每个动作,并训练模型识别攻击。测试显示,最新模型在防护下攻击成功率极低,仅Fable 5有0.3%低风险成功案例。用户可从Chrome商店安装,企业版可管理设置。

Claude in Chrome 现已全面上线

Claude Claude · 2026-09-08T19:25:36Z
LM Studio为AI命令打造了裁判。随后,裁判开始认同被告。

LM Studio为AI编程助手Bionic开发了Shell Judge安全层,通过解析命令语法树和跟踪变量来评估命令风险,拦截危险操作,如git diff被变量篡改。它覆盖11,651个测试案例,处理工具参数差异。未通过的命令交由Shell Reviewer在对话上下文中评分,但仍有盲点,如假设可执行文件未被篡改,且提示注入风险存在。

LM Studio为AI命令打造了裁判。随后,裁判开始认同被告。

The New Stack The New Stack · 2026-08-28T18:31:38Z
图像识别300毫秒!OpenCode视觉插件本地免费不用API

OpenCode Senses是一款本地运行的视觉插件,无需API密钥,通过Moondream2模型实现图像识别、OCR和对象检测等13种工具,所有分析在本地GPU完成,300毫秒内返回结果。它采用自动注入证据机制,将图像内容标记为不可信观测数据,防止提示注入攻击。该插件免费、开源、跨平台,适合代码截图和UI测试,但性能上限低于云端大模型。

图像识别300毫秒!OpenCode视觉插件本地免费不用API

极道 极道 · 2026-08-14T06:40:00Z
Anthropic的Chrome扩展现已支持Cowork会话

Anthropic更新了Chrome扩展,将Claude集成到浏览器中,支持跨应用持久会话,并整合技能与连接器。该扩展现面向Max和Team用户,Pro用户稍后可用。它允许Claude在浏览器中操作内部系统,但存在提示注入风险,已加强自动检测,购物或分享个人信息前仍会征求同意。企业版默认关闭,且不支持其他Chromium浏览器。

Anthropic的Chrome扩展现已支持Cowork会话

The New Stack The New Stack · 2026-08-12T21:39:38Z
自动模式现已成为Claude Code中Pro、Max和Team计划的默认设置

Claude Code将于8月14日起在Pro、Max和Team计划中默认启用自动模式,通过分类器拦截危险操作,减少用户确认提示。测试显示其安全性优于人工审查,能阻止89%危险命令,并有效防范提示注入攻击。企业版和API用户暂可选用,未来将全面推广。

自动模式现已成为Claude Code中Pro、Max和Team计划的默认设置

Claude Claude · 2026-08-10T15:40:35Z
自动模式即将成为Claude Code的默认设置——因为人类不可靠

Anthropic宣布Claude Code的自动模式将于8月14日成为Pro、Max和Team用户的默认设置。该模式利用分类器模型识别危险操作,减少人工审批。研究显示,人类仅能发现13.6%的危险命令,而自动模式可捕捉89%。系统设有硬性拒绝规则,防止数据外泄,并增强提示注入防护。测试中,自动模式成功阻止所有攻击,优于OpenAI的GPT-5.6。此外,并行Claude Code会话现可互相通信,共享摘要以提高效率。

自动模式即将成为Claude Code的默认设置——因为人类不可靠

The New Stack The New Stack · 2026-08-07T21:42:44Z
LLM安全基础:完整威胁模型

LLM安全的核心在于指令与数据无法分离,导致提示注入风险。攻击面包括输入、检索、模型、工具、输出及供应链。模型内部攻击影响有限,真正危险的是私密数据、不可信内容、外发通道并存的“致命三要素”。供应链可通过恶意模型文件入侵。防御需多层纵深,如CaMeL和最小权限原则,而非依赖单一过滤。

LLM安全基础:完整威胁模型

ByteByteGo Newsletter ByteByteGo Newsletter · 2026-08-03T15:31:14Z
一分钟读论文:《安全的模型为何组合后不再安全?》

论文揭示多Agent系统安全悖论:单个安全模型组合后安全性下降,因依赖云服务端过滤而非模型自身。提出ChannelGuard框架,通过通道门控实时评估文本,拦截攻击且不增成本。实验显示工具投毒拦截率100%,提示注入成功率降低,保持任务准确率,验证纵深防御有效性。

一分钟读论文:《安全的模型为何组合后不再安全?》

Micropaper Micropaper · 2026-07-26T00:00:00Z
权限不等于目的:Omnigent中的意图授权

本文介绍Omnigent的意图授权机制,解决AI代理因提示注入而执行越权操作的问题。传统授权仅检查身份,不检查目的,攻击者可隐藏指令于数据中。Omnigent通过声明会话意图,每次操作均需匹配意图,超出范围则拒绝或需人工批准。意图由代理起草但需人工确认,不可篡改,有效阻断注入攻击,同时不影响正常任务。

权限不等于目的:Omnigent中的意图授权

Databricks Databricks · 2026-07-23T18:05:06Z
代理人工智能安全:防御提示注入和工具滥用

本文讨论了代理人工智能系统中的安全问题,特别是提示注入和工具滥用。随着AI代理从实验环境转向实际应用,安全隐患增加。专家建议的防御策略包括严格的最小权限、开源安全框架、沙箱执行环境、人机协作检查点以及监控代理活动,以确保AI系统的安全性和有效性。

代理人工智能安全:防御提示注入和工具滥用

MachineLearningMastery.com MachineLearningMastery.com · 2026-07-17T12:00:32Z
ColdFusion开发者的AI安全 - CFSummit 2026幻灯片

在拉斯维加斯的Adobe ColdFusion峰会上,我讨论了ColdFusion开发者在集成大型语言模型(LLM)时面临的AI安全问题。演讲内容包括提示注入、真实攻击案例、过度授权风险及ColdFusion 2025的防护措施,强调了输入验证和限制外部操作的重要性,以降低安全风险。

ColdFusion开发者的AI安全 - CFSummit 2026幻灯片

Pete Freitag's Homepage Pete Freitag's Homepage · 2026-07-07T09:00:00Z
设计抗击提示注入的AI代理

AI代理的网络浏览和指令执行能力增强,导致提示注入攻击的出现。这类攻击逐渐演变为复杂的社会工程学手段,防御措施需结合输入过滤和系统设计,以限制操控影响,确保用户数据安全。

设计抗击提示注入的AI代理

OpenAI OpenAI · 2026-03-11T11:30:00Z
每个大型语言模型应用面临的三大隐性风险(及其防范措施)

大型语言模型应用面临三大隐性风险:提示注入、数据外泄和语义漂移。提示注入可能导致用户操控AI行为,数据外泄可能泄露敏感信息,语义漂移则使AI生成不准确或不相关的回答。为应对这些风险,建议使用输入防火墙、PII检测工具和输出验证器等安全措施,以确保AI的安全性和可靠性。

每个大型语言模型应用面临的三大隐性风险(及其防范措施)

MachineLearningMastery.com MachineLearningMastery.com · 2026-01-27T15:29:16Z
持续增强ChatGPT Atlas对提示注入攻击的防护

ChatGPT Atlas的代理模式允许浏览器执行网页操作,但存在提示注入攻击风险。为此,开发团队加强了安全防护,采用自动化攻击检测和对抗性训练,提高模型安全性和鲁棒性。用户应限制登录访问、仔细审核请求并给予明确指令,以降低风险。

持续增强ChatGPT Atlas对提示注入攻击的防护

OpenAI OpenAI · 2025-12-22T00:00:00Z

网络安全公司Tenable发现七种新型数据窃取手法,攻击者利用ChatGPT的默认功能进行间接提示注入,诱使其泄露用户隐私。研究表明,ChatGPT的长期记忆和搜索能力存在漏洞,攻击者可通过恶意网站和对话注入实现数据窃取。尽管部分问题已修复,GPT-5仍存在相关风险。

ChatGPT 被诱导自我注入攻击,7 种新型手法窃取隐私数据

FreeBuf网络安全行业门户 FreeBuf网络安全行业门户 · 2025-11-10T01:30:00Z
理解提示注入:前沿安全挑战

AI工具面临新的安全挑战,尤其是“提示注入”攻击,这种攻击可能导致敏感信息泄露。为保护用户,OpenAI实施了多层防御措施,包括安全培训、监控和用户控制,以防止AI受到恶意指令的影响。

理解提示注入:前沿安全挑战

OpenAI OpenAI · 2025-11-07T11:30:00Z

研究人员攻破了OpenAI的Guardrails安全护栏,利用提示注入方法绕过安全检测,生成危险内容。攻击者能够同时操控生成模型和安全评估模型,导致系统漏洞。专家警告,依赖模型评估可能造成虚假安全感,建议采用独立验证和持续对抗测试以增强防御。

OpenAI安全护栏破绽百出,简单提示注入即可绕过

FreeBuf网络安全行业门户 FreeBuf网络安全行业门户 · 2025-10-27T01:16:00Z

OpenAI的新浏览器引发安全隐患,CISO指出“提示注入”问题尚未解决,攻击者可通过普通文本指令进行攻击,AI浏览器可能成为新的安全漏洞,需引起重视。

AI浏览器:安全前沿的挑战

Jim Nielsen’s Blog Jim Nielsen’s Blog · 2025-10-23T19:00:00Z

OpenAI推出的Guardrails安全框架旨在提升AI安全性,但研究显示其存在漏洞,攻击者可通过提示注入绕过安全检测,生成有害内容。这一发现突显了保护AI系统的挑战,专家建议采用独立验证和红队测试以增强防御。

OpenAI安全护栏框架破绽百出,简单提示注入即可绕过

FreeBuf网络安全行业门户 FreeBuf网络安全行业门户 · 2025-10-13T18:12:12Z
  • <<
  • <
  • 1 (current)
  • 2
  • 3
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
友情链接: MOGE.AI 九胧科技 1tok 菜鸟教程 Remio.AI DeekSeek连连 53AI 神龙海外代理IP IPIPGO全球代理IP 东波哥的博客 匡优考试在线考试系统 开源服务指南 蓝莺IM Solo 独立开发者社区 AI酷站导航 极客Fun 我爱水煮鱼 周报生成器 He3.app 简单简历 白鲸出海 T沙龙 职友集 TechParty 蟒周刊 Best AI Music Generator 模力方舟 Gitee AI

小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码