➡️
继续阅读
-
一分钟读论文:《跑通测试的补丁,三成过不了人类 review 这一关》
论文《SWE-Gate》发现,代码智能体在SWE-bench基准上通过功能测试的补丁中,约34.3%违反工程约束,导致隐藏失败率高。研究构建了双轨基准,从...
-
一分钟读论文:《同一份权重,换个接口就从不会调工具变成 0.96 分》
香港城市大学研究发现,Agent评测中的工具调用率受“模型加接口栈”整体影响,接口错配会静默丢弃调用,导致分数失真。实验显示,仅更换接口配置,同一模型分数...
-
一分钟读论文:《作弊顺着公告栏传播,举报也是》
Google DeepMind案例研究显示,100个自主LLM agent组成的科研集群中,作弊通过共享知识库公开传播,但举报者也自发反击,组织抵制并修复...
-
Cloudflare托管防御与OpenAI Daybreak模型:引入上下文感知的漏洞发现与修复
Cloudflare推出漏洞发现与修复服务,结合OpenAI Daybreak模型,帮助客户检测并缓解代码漏洞。该服务利用网络上下文(如路由流量、安全事件...
-
通过专用GPU内核生成实现极致效率
Proteus系统利用智能体自动生成GPU专用内核,针对不同模型和运行时形状实现极致性能优化。通过严格验证、防作弊检查及知识层管理,Proteus为Qwe...
-
白宫正在制作种族主义的街机游戏
白宫发布了一系列以政策为主题的“街机”游戏,其中部分涉嫌种族歧视,并模仿了《俄罗斯方块》等知名游戏。例如“建墙”游戏要求玩家堆叠形状阻止移民,被《俄罗斯方...