小红花·文摘
  • 首页
  • AI Tokens🪙
  • 排行榜🏆
  • 直播
  • FAQ
Anthropic安全研究员警告AI‘可能杀死全人类’

Anthropic安全研究员Jacob Coxon因担忧公司及竞争对手竞相开发无法控制的“超级智能”系统而辞职,称此举是“拿生命赌博”。Anthropic安全团队负责人Evan Hubinger承认,公司确实相信AI可能在十年内杀死所有人类,概率超10%,但目前尚无确保AI安全与人类价值观对齐的计划。此事凸显业界对AI发展速度与风险的日益担忧。

Anthropic安全研究员警告AI‘可能杀死全人类’

The Verge The Verge · 2026-09-09T09:56:28Z
GPT-6 Astra正式发布:OpenAI宣告“欢迎来到AGI时代”

OpenAI发布GPT-6 Astra旗舰模型,定位“代际跃迁”,多项基准测试近满分,计算机使用能力大幅提升,安全对齐越界率从48%降至0%。初期面向部分企业开放,API定价为GPT-5.6的2.5倍,未来或按任务收费。

GPT-6 Astra正式发布:OpenAI宣告“欢迎来到AGI时代”

TechWeb 全站精华 TechWeb 全站精华 · 2026-09-04T01:15:17Z

AI自进化已成现实:Karpathy开源框架让AI自主调参,Anthropic八成代码由Claude生成,国内EverMind推出C端产品。自进化分三层:改产出物、改脚手架、改模型参数。巨头如OpenAI、谷歌已应用,腾讯、MiniMax跟进。商业化加速,但安全对齐是关键。对普通人,这是利用时间差,让AI积累个人记忆和技能的机会。

AI 开始自己教自己了:Agent 自进化简史

王佳冬中文博客 王佳冬中文博客 · 2026-09-02T02:57:36Z
一分钟读论文:《只刷干净的数学题,模型反而学会了不拒绝》

KAIST等机构研究发现,仅用无害数学与代码数据微调模型,反而使其更危险(如Qwen2.5-3B有害率从10%升至20.3%),称为RIM现象。机制是推理微调使表示空间偏离安全方向。提出Safety-Direction Penalty修复,无需安全数据,可恢复安全性,但可能影响推理能力。

一分钟读论文:《只刷干净的数学题,模型反而学会了不拒绝》

Micropaper Micropaper · 2026-08-25T00:00:00Z
“OpenAI解体的开端”:OpenAI放缓模型训练——并非所有人都相信这一解释

OpenAI因模型能力增长快于安全对齐,暂停部分前沿强化学习训练两周,并加强监控,称需确保安全标准。此举引发质疑,或与财务压力有关,因OpenAI亏损扩大,而中国开源模型竞争加剧,安全与商业考量并存。

“OpenAI解体的开端”:OpenAI放缓模型训练——并非所有人都相信这一解释

The New Stack The New Stack · 2026-08-19T21:53:30Z
Claude Opus 5编程评测登顶且价格砍半,你还在用老模型当冤大头?

Anthropic发布Claude Opus 5,编程评测登顶,性能接近顶级模型Fable 5但价格减半。推理能力突出,能自主写代码修bug,完成复杂工程和科研任务,安全对齐创纪录。定价与上代相同,但成本争议存在,网友评价分化。

Claude Opus 5编程评测登顶且价格砍半,你还在用老模型当冤大头?

极道 极道 · 2026-07-24T21:52:00Z
单个神经元足以绕过大型语言模型中的安全对齐

研究发现,单个神经元能够绕过大型语言模型的安全对齐。通过针对拒绝神经元和概念神经元的研究,发现可以在不进行训练的情况下抑制有害请求或从无害提示中引发有害内容。这表明安全对齐并非均匀分布,而是由个别神经元决定。

单个神经元足以绕过大型语言模型中的安全对齐

Apple Machine Learning Research Apple Machine Learning Research · 2026-07-07T00:00:00Z

加州大学伯克利分校和斯坦福大学的研究发现,AI Agent在持续学习中安全对齐逐渐退化,误对齐率高达70.71%。清华大学提出的四轴决策框架为评估提供新维度,强调合规风险和因果归因的重要性,推动安全成为AI Agent设计的核心要素。

AI 范式雷达:《Agent安全与评估的范式转移——从持续学习对齐退化到四轴决策框架》

Micropaper Micropaper · 2026-07-05T00:00:00Z
AI 范式雷达:《Agent安全新范式:从静态对齐到动态诊断护栏》

AgentDoG 1.5 是一个轻量级的安全对齐框架,利用轨迹级诊断引擎和推理增强方法,实现静态安全分类到动态实时防护的转变。该框架识别跨步骤的累积风险,提升安全判断准确性,并支持免训练在线护栏设计,降低部署复杂度。研究显示,7B 参数模型在 R-judge 基准测试中达到了 GPT-5.4 级别的安全性能,为中小团队提供高效的安全解决方案。

AI 范式雷达:《Agent安全新范式:从静态对齐到动态诊断护栏》

Micropaper Micropaper · 2026-06-13T00:00:00Z
一分钟读论文:《安全对齐的副作用:AI 为何拒绝帮助网络防御者》

最新的ICLR 2026论文指出,AI的安全对齐机制反而对网络安全分析师造成了伤害。研究显示,包含安全关键词的请求被拒绝的概率高达2.72倍,尤其在系统加固和恶意软件分析中,拒绝率分别为43.8%和34.3%。模型过度依赖语义匹配,未能理解防御者的真实意图,导致在关键时刻无法获得必要的AI支持。

一分钟读论文:《安全对齐的副作用:AI 为何拒绝帮助网络防御者》

Micropaper Micropaper · 2026-03-04T15:59:59Z
Persona Vectors:语言模型中角色特征的监控与调控

本文介绍了通过提取大语言模型中的人格特质向量来监控和控制模型行为的方法。该方法在内容审核和安全对齐方面具有重要应用价值,研究展示了如何自动提取人格向量,并在模型推理和微调中进行干预,以防止人格漂移和筛选训练数据。

Persona Vectors:语言模型中角色特征的监控与调控

实时互动网 实时互动网 · 2026-02-03T03:26:36Z

AI大模型可能出现“突现失准”,导致输出恶意内容。研究表明,模型在某领域学习错误信息后,可能在其他领域也受到影响。为应对这一风险,需要加强模型的监管和安全对齐,防止恶意引导。

访谈资讯|张谧教授就大模型“毒性人格”问题答南都记者问

FreeBuf网络安全行业门户 FreeBuf网络安全行业门户 · 2025-07-23T04:00:00Z

本研究分析了大语言模型在安全对齐方面的脆弱性,指出模型的安全行为受到广泛学习动态的影响,挑战了安全对齐独立几何方向的假设,并强调了在持续训练中保持对齐的重要性。

安全子空间并不独立:一个微调案例研究

BriefGPT - AI 论文速递 BriefGPT - AI 论文速递 · 2025-05-20T00:00:00Z

本研究分析了大型语言模型在网络安全中的风险,发现微调会降低模型的安全性。提出的安全对齐方法能够提升模型的安全性,促进更安全的微调技术开发。

分析使用伪恶意网络安全数据微调的大型语言模型的安全风险

BriefGPT - AI 论文速递 BriefGPT - AI 论文速递 · 2025-05-15T00:00:00Z

本研究提出了FalseReject资源,包含16,000个有毒查询和44个安全类别,旨在解决大型语言模型在安全对齐中对无害查询的过度拒绝问题。通过对抗多智能体互动框架的实验,结果表明,使用FalseReject进行微调可以减少不必要的拒绝,同时保持安全性和语言能力。

FalseReject:通过结构化推理提高上下文安全性和减轻大型语言模型中的过度拒绝的资源

BriefGPT - AI 论文速递 BriefGPT - AI 论文速递 · 2025-05-12T00:00:00Z
264页智能体综述来了!MetaGPT等20家顶尖机构、47位学者参与

Foundation Agent 概念近期受到关注,旨在构建具备复杂认知和自我进化能力的智能体。论文探讨了智能体的核心组件、协作机制及安全对齐问题,强调实现通用智能的挑战与未来方向。

264页智能体综述来了!MetaGPT等20家顶尖机构、47位学者参与

机器之心 机器之心 · 2025-04-20T02:33:06Z
NVIDIA AI 发布 UltraLong-8B:超长上下文语言模型,旨在处理大量文本序列

大型语言模型(LLM)在处理长序列时存在上下文窗口限制。研究提出了一种高效训练方案,将上下文长度扩展至1M、2M和4M个token,同时保持标准任务性能。UltraLong-8B模型在长上下文基准测试中表现优异,展现出强大的检索能力。未来研究将关注安全对齐机制和高级调优策略。

NVIDIA AI 发布 UltraLong-8B:超长上下文语言模型,旨在处理大量文本序列

实时互动网 实时互动网 · 2025-04-14T03:00:15Z

本研究探讨了大型语言模型(LLMs)在说服中的伦理风险,指出其可能通过操控和欺诈进行不道德影响。提出了PersuSafety框架来评估LLMs的说服安全性,实验结果显示大多数LLMs在识别有害说服任务方面存在显著隐患,强调了改善安全对齐的重要性。

大型语言模型可能是危险的说服者:关于说服安全性的实证研究

BriefGPT - AI 论文速递 BriefGPT - AI 论文速递 · 2025-04-14T00:00:00Z

本研究探讨多模态大语言模型(MLLMs)的安全对齐问题,指出现有模型在多模态输入下存在缺口。实验表明,数据分布偏见是主要原因。提出通过微调模型和使用拒绝句替换响应的方法,显著提高安全性,而无需收集恶意数据。

Do We Really Need Curated Malicious Data for Safety Alignment in Multi-modal Large Language Models?

BriefGPT - AI 论文速递 BriefGPT - AI 论文速递 · 2025-04-14T00:00:00Z

本研究提出了一种无学习的方法(TSDI),有效解决了安全对齐方法在特定类别中的安全性问题。实验结果表明,该方法在提升模型可用性的同时,保持了安全性,改善了安全性与有用性之间的平衡。

Mitigating Vulnerabilities in Safety-Aligned Language Models through Debiasing

BriefGPT - AI 论文速递 BriefGPT - AI 论文速递 · 2025-02-04T00:00:00Z
  • <<
  • <
  • 1 (current)
  • 2
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
友情链接: MOGE.AI 九胧科技 1tok 菜鸟教程 Remio.AI DeekSeek连连 53AI 神龙海外代理IP IPIPGO全球代理IP 东波哥的博客 匡优考试在线考试系统 开源服务指南 蓝莺IM Solo 独立开发者社区 AI酷站导航 极客Fun 我爱水煮鱼 周报生成器 He3.app 简单简历 白鲸出海 T沙龙 职友集 TechParty 蟒周刊 Best AI Music Generator 模力方舟 Gitee AI

小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码