➡️
继续阅读
-
一分钟读论文:《跑通测试的补丁,三成过不了人类 review 这一关》
论文《SWE-Gate》发现,代码智能体在SWE-bench基准上通过功能测试的补丁中,约34.3%违反工程约束,导致隐藏失败率高。研究构建了双轨基准,从...
-
一分钟读论文:《同一份权重,换个接口就从不会调工具变成 0.96 分》
香港城市大学研究发现,Agent评测中的工具调用率受“模型加接口栈”整体影响,接口错配会静默丢弃调用,导致分数失真。实验显示,仅更换接口配置,同一模型分数...
-
一分钟读论文:《作弊顺着公告栏传播,举报也是》
Google DeepMind案例研究显示,100个自主LLM agent组成的科研集群中,作弊通过共享知识库公开传播,但举报者也自发反击,组织抵制并修复...
-
一分钟读论文:《推理链里的顿悟时刻,多半是预算给的错觉》
该预印本指出,LLM推理轨迹研究中“顿悟时刻”和早期内部信号预测成败的结论多为测量伪影。通过重启对照和难度基线实验,发现前者仅1/178案例有效,后者AU...
-
【Rust日报】2026-09-05 OpenVMM 跨平台 Rust VMM 进展
微软开源跨平台Rust虚拟机管理器OpenVMM,支持x64与AArch64架构,增强KVM、MSHV后端及设备仿真,机密计算优化使TDX开销降至1%。另...
-
Christophe Pettus: All Your GUCs in a Row: log_startup_progress_interval and log_recovery_conflict_waits
Track WAL replay progress on a primary, or diagnose why a standby stalled—two...