AgentDoG 1.5 是一个轻量级的安全对齐框架,利用轨迹级诊断引擎和推理增强方法,实现静态安全分类到动态实时防护的转变。该框架识别跨步骤的累积风险,提升安全判断准确性,并支持免训练在线护栏设计,降低部署复杂度。研究显示,7B 参数模型在 R-judge 基准测试中达到了 GPT-5.4 级别的安全性能,为中小团队提供高效的安全解决方案。
在2026年RSAC创新沙盒中,Geordie AI凭借其“AI Agent安全治理平台”获奖,显示出AI Agent安全治理的产业需求。绿盟科技同样强调实时治理和动态防护,致力于构建全面的AI安全体系,具备技术落地、项目实战和生态建设的优势,提供全生命周期的安全服务,推动AI智能体安全的规模化落地。
本研究提出DELMAN方法,旨在解决大型语言模型在决策应用中的越狱攻击问题。该方法通过调整少量参数实现动态防护,同时保持模型性能,实验结果表明其有效应对新攻击实例。
完成下面两步后,将自动完成登录并继续当前操作。