➡️
继续阅读
-
一分钟读论文:《跑通测试的补丁,三成过不了人类 review 这一关》
论文《SWE-Gate》发现,代码智能体在SWE-bench基准上通过功能测试的补丁中,约34.3%违反工程约束,导致隐藏失败率高。研究构建了双轨基准,从...
-
一分钟读论文:《同一份权重,换个接口就从不会调工具变成 0.96 分》
香港城市大学研究发现,Agent评测中的工具调用率受“模型加接口栈”整体影响,接口错配会静默丢弃调用,导致分数失真。实验显示,仅更换接口配置,同一模型分数...
-
一分钟读论文:《作弊顺着公告栏传播,举报也是》
Google DeepMind案例研究显示,100个自主LLM agent组成的科研集群中,作弊通过共享知识库公开传播,但举报者也自发反击,组织抵制并修复...
-
Podcast: Personality Over Skillset: How Adam Wachtel Builds Engineering Teams
In this podcast, Shane Hastie, Lead Editor for Culture & Methods, spoke t...
-
告别重复手工迁仓,码道MCP+Skill实现仓库批量迁移
本文介绍华为云码道代码智能体配合CodeArts MCP与Skill实现代码仓库批量迁移的实操案例。相比传统手动逐仓填表,该方案通过一份清单文件即可完成多...
-
自建 RTC 推流与使用第三方 SDK 哪个更划算?
自建RTC与第三方服务的成本比较,核心在于工程质量、运维损耗和机会成本等隐性成本。自建需满足规模大、团队成熟、网络可控等条件;否则,第三方SDK更划算,因...