小红花·文摘
  • 首页
  • 广场
  • 排行榜🏆
  • 直播
  • FAQ
Dify.AI

本研究提出了一种新方法,通过识别和修改负责安全约束的神经元,诱发大型语言模型的失调,揭示现有对齐技术的脆弱性,并强调需要加强对抗性微调攻击的防御。

NeuRel-Attack: Neural Relearning of Neurons for Security Disruption in Large Language Models

BriefGPT - AI 论文速递
BriefGPT - AI 论文速递 · 2025-04-29T00:00:00Z

本研究提出了NeoRL-2基准,旨在解决离线强化学习中的数据保守性和环境访问限制问题。该基准应对现实世界中的高延迟效应和安全约束,实验结果显示现有方法在这些基准上表现不佳,强调了对更有效算法的需求。

NeoRL-2: Near Real-World Benchmarks for Offline Reinforcement Learning with Extended Realistic Scenarios

BriefGPT - AI 论文速递
BriefGPT - AI 论文速递 · 2025-03-25T00:00:00Z

本研究提出了一种新的量化约束强化学习方法,有效解决了以往安全约束表达不足的问题。该方法通过倾斜量化梯度更新,在满足安全要求的同时显著提升了回报性能,超越了现有基准。

Tilted Quantile Gradient Updates for Quantile-Constrained Reinforcement Learning

BriefGPT - AI 论文速递
BriefGPT - AI 论文速递 · 2024-12-17T00:00:00Z

本研究提出了一种基于Wiener核回归的新误差界限,解决了贝叶斯优化在安全约束下的性能问题,结果表明该界限更为紧凑,扩大了安全区域。

Research on Safe Bayesian Optimization Based on Wiener Kernel Regression

BriefGPT - AI 论文速递
BriefGPT - AI 论文速递 · 2024-11-04T00:00:00Z

本研究探讨了在线强化学习中如何在学习未知环境的同时满足安全约束,提出了针对受约束线性二次调节器的后悔界限,表明安全性提升了探索机会。

Stronger Safety Regret Bounds in Online Reinforcement Learning: A Case Study of Linear Quadratic Regulators

BriefGPT - AI 论文速递
BriefGPT - AI 论文速递 · 2024-10-28T00:00:00Z

本文探讨了安全强化学习算法的进展,提出了如Recovery RL和Unrolling Safety Layer等新方法,以提高学习效率和安全性。这些方法在仿真和实际环境中有效减少安全事故并提升任务性能,强调了在机器人技术中整合安全约束的重要性,以应对复杂环境的挑战。

通过子目标改进安全策略探索

BriefGPT - AI 论文速递
BriefGPT - AI 论文速递 · 2024-08-25T00:00:00Z

本文研究了薪水优化与多目标强化学习,提出了一种新算法以平衡多个财务目标和安全约束。通过强化学习和在线凸优化,确保在未知环境中实现公平性,并展示了算法在复杂任务中的有效性和优势。

多目标强化学习的最大最小公式:从理论到无模型算法

BriefGPT - AI 论文速递
BriefGPT - AI 论文速递 · 2024-06-12T00:00:00Z

本文介绍了多种安全强化学习方法,包括可行行动者-评论家算法、RCRL方法和可行策略迭代算法,旨在解决安全约束问题。这些方法在优化代理策略的同时,能够有效满足安全性要求,并在多个基准测试中表现优越。

安全强化学习的一致性可行性表征学习

BriefGPT - AI 论文速递
BriefGPT - AI 论文速递 · 2024-05-20T00:00:00Z

该论文探讨了在随机和部分未知环境中控制器综合的问题,提出了一种基于安全的马尔可夫决策过程的解决方案。研究了多种安全强化学习方法,强调安全约束与强化学习公式的分离,从而降低计算要求。通过引入安全状态和新的优化方法,提升了学习性能和约束满足能力,并验证了在多种环境中的有效性。

学习的非马尔可夫安全性约束下的安全强化学习

BriefGPT - AI 论文速递
BriefGPT - AI 论文速递 · 2024-05-05T00:00:00Z

本文介绍了一种名为SAFE-BOCP的基于安全约束的贝叶斯优化算法,能够在确保安全的前提下快速优化机器人算法参数。同时,研究提出了StageOpt算法,解决了优化未知效用函数的安全性问题,并通过实验验证了其在扩展安全区域和最大化效用方面的高效性。

关于安全的安全贝叶斯优化

BriefGPT - AI 论文速递
BriefGPT - AI 论文速递 · 2024-03-19T00:00:00Z

本文提出了广义安全探索问题,使用元算法MASE解决。该算法在方格世界和Safety Gym基准测试上表现更好,且没有违反任何安全约束。

强化学习中的安全探索:广义形式与算法

BriefGPT - AI 论文速递
BriefGPT - AI 论文速递 · 2023-10-05T00:00:00Z

该文介绍了一个新的强化学习框架,用于在随机环境中实现安全约束。该算法通过最小化违规行为来保持持续的安全特性,并基于可达性估计来优化该框架。在多个安全强化学习环境中进行评估,结果显示了在提高奖励性能和安全性方面的优势。

安全强化学习中的迭代可达性估计

BriefGPT - AI 论文速递
BriefGPT - AI 论文速递 · 2023-09-24T00:00:00Z

该研究提出了一种基于线性时态逻辑的可查询安全约束模块,用于机器人代理的合规性。实验证明该系统适用于复杂的安全约束,具备实际应用潜力。

安全芯片插入:强制 LLM 驱动的机器人代理遵守限制

BriefGPT - AI 论文速递
BriefGPT - AI 论文速递 · 2023-09-18T00:00:00Z
  • <<
  • <
  • 1 (current)
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
友情链接: MOGE.AI 九胧科技 模力方舟 Gitee AI 菜鸟教程 Remio.AI DeekSeek连连 53AI 神龙海外代理IP IPIPGO全球代理IP 东波哥的博客 匡优考试在线考试系统 开源服务指南 蓝莺IM Solo 独立开发者社区 AI酷站导航 极客Fun 我爱水煮鱼 周报生成器 He3.app 简单简历 白鲸出海 T沙龙 职友集 TechParty 蟒周刊 Best AI Music Generator

小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码