➡️
继续阅读
-
早报|苹果将迎来史上最大产品发布潮/微信小微内测Agent间沟通/何庭波发布「韬定律」新论文
苹果将迎来史上最大产品发布潮,包括折叠屏iPhone和iPhone 18 Pro;GPT-6 Astra全量发布;Anthropic用Claude完成费马...
-
从AI代码到可信软件:工程约束的实践
文章探讨了“工程约束”如何通过仓库强制执行标准,确保AI生成代码的质量与问责。它强调权限、质量门、证据和可观测性,并描述了从辅助到自主的成熟度阶段。核心是...
-
AI如何改变补丁管理及开发者需了解的暴露管理知识
AI正在改变漏洞管理方式,但仅按严重性评分修复并不足够。文章强调应从传统漏洞修补转向暴露管理,结合代码可达性、依赖树和SBOM等上下文评估真实风险。开发者...
-
一分钟读论文:《跑通测试的补丁,三成过不了人类 review 这一关》
论文《SWE-Gate》发现,代码智能体在SWE-bench基准上通过功能测试的补丁中,约34.3%违反工程约束,导致隐藏失败率高。研究构建了双轨基准,从...
-
一分钟读论文:《同一份权重,换个接口就从不会调工具变成 0.96 分》
香港城市大学研究发现,Agent评测中的工具调用率受“模型加接口栈”整体影响,接口错配会静默丢弃调用,导致分数失真。实验显示,仅更换接口配置,同一模型分数...
-
一分钟读论文:《作弊顺着公告栏传播,举报也是》
Google DeepMind案例研究显示,100个自主LLM agent组成的科研集群中,作弊通过共享知识库公开传播,但举报者也自发反击,组织抵制并修复...