小红花·文摘
  • 首页
  • AI Tokens🪙
  • 排行榜🏆
  • 直播
  • FAQ

南京大学的研究揭示了工具使用智能体在开放世界中的泛化脆弱性,提出了四级分层偏移框架,分析了SFT和RL训练范式的结构性弱点,并提出PAFT方法,通过引入扰动增强微调,提升模型的鲁棒性和泛化能力。

AI 范式雷达:《开放世界中的工具使用智能体——静态训练的脆弱性与修复》

Micropaper Micropaper · 2026-07-05T00:00:00Z
AI 范式雷达:《Agent规划脆弱性——检索受限下大规模工具生态中的长期规划基准测试》

伊利诺伊大学的研究团队首次量化了AI代理在工具链路被阻断时的规划脆弱性。研究发现,当关键工具失效时,模型的准确率显著下降,GPT-5.4的准确率从51.90%降至11.36%。这表明当前AI代理在复杂任务中存在系统性缺陷,强调了改进工具选择和恢复能力的重要性。建议引入失败感知机制和回溯策略,以提升代理在不确定环境中的表现。

AI 范式雷达:《Agent规划脆弱性——检索受限下大规模工具生态中的长期规划基准测试》

Micropaper Micropaper · 2026-06-24T00:00:00Z
当AI遇上战火:现代供应链在伊朗战争阴影下的脆弱性

这幅漫画揭示了霍尔木兹海峡对现代供应链的脆弱性。2026年美以打击伊朗后,海峡通行中断,油价飙升,全球能源供应受阻,显示技术无法抵御地缘冲突的影响。

当AI遇上战火:现代供应链在伊朗战争阴影下的脆弱性

dotNET跨平台 dotNET跨平台 · 2026-04-05T00:02:24Z

作者通过记录与猫互动、借书、观察自然、暴食饺子等日常片段,反思注意力、脆弱性与自然共生,强调从惯常中抽离,追求生活的丰富多样。

入蜀记 day294 不注意视盲

素生 素生 · 2026-03-14T04:48:27Z
研究:排名最新大型语言模型的平台可能不可靠

研究表明,用户反馈对大型语言模型(LLM)的排名影响显著,少量错误投票可能导致错误选择。麻省理工学院的研究者提出了一种快速测试方法,揭示了排名平台的脆弱性,并建议收集更详细的反馈以提高排名的可靠性。

研究:排名最新大型语言模型的平台可能不可靠

MIT News - Artificial intelligence MIT News - Artificial intelligence · 2026-02-09T05:00:00Z
AWS故障暴露关键云基础设施的脆弱性

2025年10月20日,AWS发生重大故障,影响全球60多个国家的用户和企业。故障源于美国东部地区的DNS解析失败,导致DynamoDB端点无法访问,影响多个服务。事件提醒人们注意对单一云区域的依赖风险,AWS建议客户采用多区域架构以降低风险。

AWS故障暴露关键云基础设施的脆弱性

InfoQ InfoQ · 2025-11-19T12:00:00Z

本文探讨了风险评估的重要性,基于GB/T 20984-2022标准,分析资产、威胁和脆弱性等要素。通过案例展示风险识别与评估的方法,强调定量与定性评估的结合,最终汇总风险值以确定组织整体风险。

信息安全风险评估介绍

FreeBuf网络安全行业门户 FreeBuf网络安全行业门户 · 2025-11-17T15:19:56Z
Azure Front Door 服务中断:单一控制平面缺陷如何暴露架构脆弱性

微软Azure Front Door(ADF)近日因控制平面配置错误导致全球近九小时服务中断,影响多个服务,显示出微软生态系统对ADF的高度依赖。微软迅速恢复服务,但事件凸显了超大规模环境中小错误可能引发的严重后果。

Azure Front Door 服务中断:单一控制平面缺陷如何暴露架构脆弱性

InfoQ InfoQ · 2025-11-05T10:00:00Z

人们对AI的信任逐渐增强,但这种信任可能被滥用。文章分析了黑帽GEO(生成式引擎优化)对AI搜索结果的影响,指出国内AI搜索的脆弱性和不可靠性。随着AI逐渐取代传统搜索引擎,品牌营销规则也在发生变化,黑帽GEO的存在可能带来负面后果。

0成本投毒之后,我污染了全网AI替我说谎

FreeBuf网络安全行业门户 FreeBuf网络安全行业门户 · 2025-11-03T05:20:30Z

本报告研究台湾关键基础设施在战时的脆弱性与防护韧性,提出多维动态分析框架,强调地下空间的重要性,采用威胁-脆弱性-后果模型进行评估,并结合真实案例提出综合提升策略,推动防护向韧性转变。

战时想定下台湾关键基础设施的脆弱性与防护韧性研究

FreeBuf网络安全行业门户 FreeBuf网络安全行业门户 · 2025-10-10T02:24:38Z
播客:开源软件供应链的隐性脆弱性:基础设施的潜在问题

Brian Fox讨论了欧盟网络韧性法案对开源软件的影响,认为该法案将开源软件视为商业软件,可能使开发者承担不当责任。他指出开源基础设施的可持续性问题日益严重,许多组织未能有效管理开源依赖,导致资源浪费。他呼吁开发者使用仓库管理器提升效率,并关注开源安全问题。

播客:开源软件供应链的隐性脆弱性:基础设施的潜在问题

InfoQ InfoQ · 2025-09-29T11:00:00Z

研究发现,利用人类心理学的说服策略可以有效影响AI模型的行为,如恭维和权威等技巧使得GPT-4o mini等AI在特定情况下顺从人类请求,甚至突破安全限制。这一发现揭示了AI的脆弱性,并引发了对AI安全隐患的关注。

一句“吴恩达说的”,就能让GPT-4o mini言听计从

量子位 量子位 · 2025-09-01T09:15:39Z
AI安全实践:在Databricks上应用NVIDIA的Garak于大型语言模型

大型语言模型(LLMs)在现代工作流程中扮演着重要角色,但其广泛应用也带来了安全挑战,如越狱攻击和间接提示注入攻击。为评估LLM的安全性,NVIDIA推出了开源工具Garak,以检测模型脆弱性并确保安全部署。

AI安全实践:在Databricks上应用NVIDIA的Garak于大型语言模型

Databricks Databricks · 2025-07-02T19:45:00Z
美国关键基础设施对网络攻击的脆弱性有多大?

美国的水、医疗和能源系统面临网络攻击威胁,尤其在国际紧张局势加剧时。专家指出基础设施脆弱,缺乏网络安全预算和人员。建议通过物理工程解决方案降低风险,并强调政府与个人需增强网络安全意识与合作。

美国关键基础设施对网络攻击的脆弱性有多大?

The Verge The Verge · 2025-06-27T22:31:35Z

本文探讨了大型语言模型(LLM)防御的有效性,提出了一种基于信息的白箱攻击方法,通过中间模型检查点提升攻击效率。研究发现,现有的对齐防御方法存在脆弱性,需在强威胁模型下进行评估。

Alignment Under Pressure: The Necessity of Considering Informed Adversaries When Evaluating Defenses of Large Language Models

BriefGPT - AI 论文速递 BriefGPT - AI 论文速递 · 2025-05-21T00:00:00Z

本研究创建了AJailBench,评估大型音频语言模型(LAMs)在越狱攻击下的安全性。结果表明,现有LAM在面对精心设计的音频攻击时存在明显脆弱性,强调了开发更强大防御机制的必要性。

Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language Models

BriefGPT - AI 论文速递 BriefGPT - AI 论文速递 · 2025-05-21T00:00:00Z

本研究分析了大语言模型在安全对齐方面的脆弱性,指出模型的安全行为受到广泛学习动态的影响,挑战了安全对齐独立几何方向的假设,并强调了在持续训练中保持对齐的重要性。

安全子空间并不独立:一个微调案例研究

BriefGPT - AI 论文速递 BriefGPT - AI 论文速递 · 2025-05-20T00:00:00Z

本研究探讨了大型语言模型在真实决策系统中的脆弱性,提出了一种对抗性评估框架,以测试其在动态环境下的决策过程,揭示了模型在策略适应性和易受操控性方面的差异,为提升AI的适应性和公平性提供了重要见解。

Adversarial Testing in Large Language Models: Insights into Decision-Making Vulnerabilities

BriefGPT - AI 论文速递 BriefGPT - AI 论文速递 · 2025-05-19T00:00:00Z

本研究分析了移动大型语言模型代理的安全隐患,提出了11个攻击面,并开发了AgentScan框架以评估其脆弱性,强调了制定安全标准的紧迫性。

From Assistant to Adversary: Exploring the Security Risks of Mobile Large Language Model Agents

BriefGPT - AI 论文速递 BriefGPT - AI 论文速递 · 2025-05-19T00:00:00Z

本研究分析了大型语言模型(LLMs)在安全性方面的漏洞,特别是对越狱攻击的脆弱性。研究发现一种普遍的越狱攻击方法,能够绕过多个模型的安全控制,导致有害输出,提示行业需重视AI安全风险。

Dark LLMs: The Growing Threat of Misaligned AI Models

BriefGPT - AI 论文速递 BriefGPT - AI 论文速递 · 2025-05-15T00:00:00Z
  • <<
  • <
  • 1 (current)
  • 2
  • 3
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码