联想天禧自研代码智能体TianxiCode斩获SWE-bench-Live全球第一

联想天禧自研代码智能体TianxiCode斩获SWE-bench-Live全球第一

💡 原文中文,约2000字,阅读约需5分钟。
📝

内容提要

联想自研代码智能体框架TianxiCode与DeepSeek-v4.1-Flash配合,在SWE-bench-Live评测中以71%的问题解决率位列全球第一,并通过官方Verified认证。该框架支持跨文件检索、自主规划和闭环补丁生成,未来将应用于联想AI硬件产品,赋能开发者。

🔎

延伸解读

评测含金量:Verified认证意味着什么

SWE-bench-Live官方设立Verified核验机制,要求参评方案提交全链路智能体运行轨迹,并审查评测输入、信息隔离环境,排查是否泄露标准答案或测试用例。TianxiCode与DeepSeek-v4.1-Flash通过审查获得认证,说明其71%问题解决率可复现,成绩并非依赖数据泄露或特殊调参,在动态评测中更具参考价值。

模型与框架的分工:为何缺一不可

文章将DeepSeek-v4.1-Flash比作工程师的大脑,负责阅读代码、理解语义、构思解法;TianxiCode则是眼、手、工具箱和工作流规范。榜单对比显示,若缺乏顶层智能体架构协同,即便调用顶级闭源模型,面对真实工程难题也常束手无策。这提示读者,代码智能体的实际表现不仅取决于底层模型能力,更依赖工程框架的系统协同。

三大工程能力如何贴近真实开发

TianxiCode具备跨文件多跳检索与上下文管理,能在大型代码库中定位缺陷根因;自驱动规划与多轮工具调用,可主动运行测试、翻阅日志、比对修改记录;闭环补丁生成与测试驱动自愈,能在隔离环境自测自纠直至补丁通过验收。这些能力对应真实开发中的排错、验证与迭代流程,而非仅生成代码片段。

落地方向:从榜单到开发者工具链

文章指出,代码智能体的最终价值不在于单一榜单排名,而在于为一线开发者分担排错与工程协同成本。联想天禧AI计划将TianxiCode的技术成果向开发者实际工具链沉淀,并应用到联想AI硬件产品中。这意味着该框架未来可能以工具或硬件集成形式与开发者见面,但具体产品形态和可用时间尚未在文中明确。

❓

Q&A

联想天禧自研的TianxiCode在SWE-bench-Live评测中取得了什么成绩?

TianxiCode配合DeepSeek-v4.1-Flash在SWE-bench-Live(Lite分榜)中以71%的问题解决率登顶全球第一名,并正式通过官方审核,获得Verified认证。

SWE-bench-Live评测有什么特点?为什么它比传统代码测试更难?

SWE-bench-Live以真实GitHub项目中的问题为基础,评估模型与智能体生成代码补丁、修复问题的能力,并提供可复现的执行环境。它更贴近真实开发中的问题处理过程,对系统理解代码、定位问题和完成修复提出了综合要求,不同于考查简单语法或单函数生成的传统代码测试。

TianxiCode和DeepSeek-v4.1-Flash在系统中各自扮演什么角色?

DeepSeek-v4.1-Flash是工程师的大脑,负责阅读代码、理解语义、构思解法;TianxiCode则是工程师的眼、手、工具箱以及工作流规范,负责跨文件检索、自主规划、工具调用和闭环补丁生成等工程能力。

TianxiCode具备哪些核心工程能力?

TianxiCode具备三大系统工程能力:跨文件多跳检索与精准上下文管理、自驱动规划与多轮工具调用、闭环补丁生成与测试驱动自愈。

TianxiCode的闭环补丁生成与测试驱动自愈是如何工作的?

TianxiCode会自动在隔离环境中运行代码,一旦发现新代码报错或破坏了其他功能,就立刻进行自我反思与修改,直至补丁通过项目验收。

TianxiCode未来会应用在哪些地方?

TianxiCode是联想天禧AI聚焦代码生成、工程开发的代码智能子能力,未来将应用到联想AI硬件产品中,并持续推动技术成果向开发者实际工具链沉淀,深度赋能到联想的硬件设备中。

🏷️

标签

➡️

继续阅读