在网络关键能力时代,调整模型开发节奏

在网络关键能力时代,调整模型开发节奏

💡 原文英文,约1400词,阅读约需6分钟。
📝

内容提要

近期,随着AI模型能力增强,安全风险上升。因OpenAI事件及Astra模型可能达到关键网络能力阈值,公司暂停部分训练,加强研究环境安全,如工作负载隔离、网络隔离和持续安全测试。同时扩展思维链监控,要求所有相关训练和推理启用多阶段监控系统。此外,推进对齐研究,改进奖励模型,减少有害行为,并计划更新预备框架以应对未来挑战。

🔎

延伸解读

安全与速度的权衡

文章指出,随着模型能力增强,内部开发风险也随之上升。为强化安全措施,公司暂停了部分训练,包括两周的强化学习暂停,并推迟了最大的前沿模型运行。这表明,在追求模型性能的同时,安全投入会带来显著的成本和延迟,安全与速度之间存在直接权衡。

监控系统的成本与覆盖

新的多阶段监控系统对模型内部活动进行实时检测,但监控开销约占被监控推理计算的20%。这一成本因工作负载而异,且监控要求已扩展到所有使用工具的Astra模型推理。这提示,安全监控不仅增加计算负担,还可能影响训练和推理的效率。

对齐研究的重点方向

文章强调了对齐研究的重要性,包括改进奖励模型以检测不安全行为、训练模型更诚实、减少奖励黑客等。这些措施旨在降低模型在训练和部署中的风险,但文章也承认,随着模型能力增强,对齐挑战将更加严峻,需要更广泛的方法。

Q&A

为什么Anthropic暂停了部分AI模型的训练?

Anthropic暂停部分训练是因为两个事件:OpenAI-Hugging Face事件,以及其即将推出的模型Astra可能达到预备框架中的关键网络安全能力阈值。这些事件凸显了日益强大的AI系统带来的风险,公司需要时间加强监控、对齐和安全保障措施。

Anthropic在加强研究环境安全方面采取了哪些具体措施?

Anthropic采取了工作负载隔离(对执行模型生成代码的工作负载加强沙箱)、网络隔离(将高风险工作负载与互联网隔离)、持续安全测试(重新配置环境,移除易受攻击的共享服务,减少常驻权限,并利用模型自动化测试安全边界)等措施。

Anthropic的思维链监控系统是如何工作的?

新的监控系统是多阶段的,首先使用激活分类器在每个采样token上运行,检测潜在问题,然后升级到更复杂的自动调查器,检查工具操作、可用推理和完整活动序列,以发现未经授权的访问、数据窃取、破坏性行为或试图击败安全防护的行为。系统旨在30分钟内发出警报,若无法排除误报,则暂停活动。

Anthropic在推进对齐研究方面做了哪些工作?

Anthropic正在改进奖励模型以更好地检测和阻止不安全行为,训练模型更诚实地说明其行动、能力和局限性,并减少利用奖励、评分器、工具或监督漏洞的行为。同时,他们增加了对模型与外部系统交互时可能造成伤害的行为的训练覆盖。

Anthropic的监控系统对计算资源有什么影响?

监控系统需要大量计算资源,目前估计监控开销约占被监控推理计算的20%,但不同训练和评估工作负载的成本差异很大。

Anthropic未来计划如何更新预备框架?

Anthropic计划将监控、对齐和安全措施整合到预备框架中,以更好地反映未来模型的能力和运行环境。他们还将投资于模型辅助安全、更有效的监控和对齐研究,并计划与外部组织合作分享更多经验。

🏷️

标签

➡️

继续阅读