谷歌DeepMind首次采用双重盲测评估AI模型,隐藏模型权重和测试问题以防基准数据泄露。通过机密计算环境加密传输数据,确保双方互不窥探。试点测试Gemini 2.5 Flash Lite,开销低于5%,但法律协议和代码审查仍是挑战,信任部分转移至硬件。此方法或为AI评估提供更可靠方式。
完成下面两步后,将自动完成登录并继续当前操作。