小红花·文摘
  • 首页
  • AI Tokens🪙
  • 排行榜🏆
  • 直播
  • FAQ
从排行榜到模型画像:面向智能体编码的大语言模型深度评估

JetBrains研究团队提出一种超越“解决率”的编码智能体评估方法,从结果、效率、补丁质量和过程四个维度分析模型轨迹。对比Claude Opus 4.7和Gemini 3.5 Flash发现,两者解决率相近但行为差异显著:Opus诊断强但验证不足,Gemini验证好但易冗余和幻觉。该框架旨在构建模型画像,优化模型选择与智能体设计。

从排行榜到模型画像:面向智能体编码的大语言模型深度评估

The JetBrains Blog The JetBrains Blog · 2026-08-31T10:44:48Z
面向人机交互设计 Harness:构建以产物为中心的 Agent Loop

文章探讨了编码智能体交互模式从“以对话为中心”向“以产物为中心”的转变。作者提出,当工作对象从代码扩展到PPT、网页等持续演化的产物时,对话不再是完整工作现场,产物本身应成为人机协作的核心。通过引入Artifact View,Harness需统一意图、版本、操作和验证,连接人与智能体直接操作同一份产物,形成多元化的Agent Loop。

面向人机交互设计 Harness:构建以产物为中心的 Agent Loop

phodal phodal · 2026-08-22T14:49:00Z
Harness 不是一次性脚手架:自进化 Coding Agent 系统如何越跑越强

南京大学综述《Self-Evolving Coding Agents》提出编码智能体应基于执行反馈自我进化,而非静态固定。文章将进化对象分为框架、记忆、技能工具、模型、工作流拓扑五类,并区分任务内、任务后、阶段性三种时机及结果、环境、轨迹三类证据。同时指出可复现性、反馈可靠性、记忆腐化、评测短视四大挑战,为手搓Harness的工程师提供系统化进化方向。

Harness 不是一次性脚手架:自进化 Coding Agent 系统如何越跑越强

Tony Bai Tony Bai · 2026-08-18T21:00:00Z
编码智能体可以评估。我们只需评估其工作成果。

编码智能体虽难评估,但并非不可评估。应将其视为整体系统,通过可执行测试、多次运行、交互模拟等分层方法,衡量结果、质量、轨迹、成本及生产影响,而非依赖单一指标或演示。评估旨在提供可复现证据,辅助决策,而非追求完美。

编码智能体可以评估。我们只需评估其工作成果。

The New Stack The New Stack · 2026-08-09T15:00:00Z
Meta发Muse Code:常驻后台不失忆,巨仓自主规划写码验证全闭环

Meta发布Muse Code终端编码智能体,能在大型代码仓库中自主规划、写码和验证,后台持续积累上下文,24小时执行超千次工具调用,崩溃后可从日志恢复,任务可并行拆分。定价低廉,但切换成本高,旨在锁定开发者生态。它从问答式工具升级为驻场智能体,挑战传统AI编码模式。

Meta发Muse Code:常驻后台不失忆,巨仓自主规划写码验证全闭环

极道 极道 · 2026-08-06T04:11:00Z

多伦多大学的论文《GameEngineBench》提出了针对游戏引擎开发的编码智能体基准测试,发现最强模型在真实C++编译下的通过率仅为55.5%。该测试涵盖110个复杂任务,强调现有评估标准无法反映大型C++项目的挑战,并指出智能体在跨模块开发中存在显著能力缺口。

一分钟读论文:《游戏引擎编码智能体基准测试》

Micropaper Micropaper · 2026-07-07T00:00:00Z
Piece:将 Coding Agent 的局部构建反馈提速 10x

文章探讨了在编码智能体时代,如何重新设计工程反馈系统以适应AI生成和修改代码的方式。传统反馈系统围绕文件展开,但随着AI能力提升,代码修改单位变得更细粒度,如函数和组件。因此,构建系统需要理解这些“语义片段”,以提高代码修改的效率和准确性。

Piece:将 Coding Agent 的局部构建反馈提速 10x

phodal phodal · 2026-07-04T11:57:00Z
套壳不丢人!我用Go+AI搓了一个Agent统一编排框架,ClaudeCode-Codex-Pi全被我包了

文章探讨了如何利用现有的编码智能体(如Claude Code、Codex等)构建统一的Agent框架。作者指出“套壳”是一种有效的快速开发产品原型的方法,通过agent-wrapper,用户可以简化不同智能体的调用,增强安全性和预算控制,实现高效协作。最终,合理的“套壳”被认为是提升开发效率的关键。

套壳不丢人!我用Go+AI搓了一个Agent统一编排框架,ClaudeCode-Codex-Pi全被我包了

鸟窝 鸟窝 · 2026-06-11T00:10:28Z

安德烈·卡尔帕西加入Anthropic,负责提升Claude模型能力,并计划扩展AutoResearch理念。马斯克对OpenAI的诉讼因超时被驳回,助力OpenAI IPO。过去六个月,编码智能体显著进步,开源模型表现优异。苹果发布无障碍功能更新,提升用户体验。CISA承包商泄露AWS密钥,暴露安全漏洞。

2026 05 20 HackerNews

介绍 on SuperTechFans 介绍 on SuperTechFans · 2026-05-20T00:08:58Z
技术速递|在 Copilot 应用科学中的智能体驱动开发

作者通过使用编码智能体(如GitHub Copilot)提升团队协作效率,强调清晰架构、完善文档和充分测试的重要性,促进项目快速发展。

技术速递|在 Copilot 应用科学中的智能体驱动开发

dotNET跨平台 dotNET跨平台 · 2026-04-07T23:53:40Z
技术速递|使用 GitHub Agentic Workflows 自动化仓库任务

GitHub Agentic Workflows 进入技术预览阶段,利用编码智能体在 GitHub Actions 中实现自动化,处理问题分流和文档更新等任务。用户可通过 Markdown 描述工作流,智能体执行并确保安全性,旨在提升开发者效率,推动仓库自动化发展。

技术速递|使用 GitHub Agentic Workflows 自动化仓库任务

dotNET跨平台 dotNET跨平台 · 2026-03-03T00:03:45Z
如何设计智能体循环

编码智能体如Claude Code和Codex CLI正在改变编程方式,能够运行和修正代码。设计智能体循环至关重要,需谨慎使用YOLO模式以避免数据丢失和攻击风险。安全运行智能体可通过沙盒或他人电脑实现,选择合适的工具和环境也很重要。

如何设计智能体循环

宝玉的分享 宝玉的分享 · 2025-10-01T00:47:49Z
  • <<
  • <
  • 1 (current)
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
友情链接: MOGE.AI 九胧科技 1tok 菜鸟教程 Remio.AI DeekSeek连连 53AI 神龙海外代理IP IPIPGO全球代理IP 东波哥的博客 匡优考试在线考试系统 开源服务指南 蓝莺IM Solo 独立开发者社区 AI酷站导航 极客Fun 我爱水煮鱼 周报生成器 He3.app 简单简历 白鲸出海 T沙龙 职友集 TechParty 蟒周刊 Best AI Music Generator 模力方舟 Gitee AI

小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码