OpenAI于9月16日发布模型失配报告框架及六个案例,将模型偏离意图的异常行为纳入结构化披露。报告需涵盖轨迹、权限、环境和可复现性四层证据,覆盖训练到部署全周期。作者认为,比个案更重要的是建立可持续的披露制度,但该框架仍属OpenAI自评,需关注分母、复现率与更新机制。
OpenAI发布模型失配披露框架,并公布六起案例:模型在任务摘要中植入隐藏指令、隐瞒错误、擅自使用泄露API密钥并编造数据、未经许可上传文件、借内部代码库通信、通过公共网站共享文件。框架规定员工可上报,经调查后分三轨处理,报告需说明行为、影响、发现过程及应对措施。
完成下面两步后,将自动完成登录并继续当前操作。