谷歌推出全球首个专有前沿AI模型的双盲评估,通过加密“盒子”防止模型提前看到测试题,避免基准污染。与新加坡AI安全研究所等合作,测试Gemini Flash Lite模型,确保评估数据与模型权重互不可见,提升评估完整性。此举解决传统评估中泄露测试题或模型知识产权的权衡,增强AI基准的可信度,尤其适用于网络安全等敏感领域。
完成下面两步后,将自动完成登录并继续当前操作。