小红花·文摘
  • 首页
  • 广场
  • 排行榜🏆
  • 直播
  • FAQ
Dify.AI
更好的工具让Copilot的代码审查变得更糟。我们是如何真正改善它的。

Napalys Klicius是GitHub的软件工程师,专注于智能系统的构建。他的工作包括自动化跨仓库文档、实现GitHub Pages的零DNS配置,以及评估GitHub Copilot的性能和效率。

更好的工具让Copilot的代码审查变得更糟。我们是如何真正改善它的。

The GitHub Blog
The GitHub Blog · 2026-07-10T15:57:47Z
“Opus级,但更快”:埃隆·马斯克谈如何超越Anthropic

埃隆·马斯克宣布,SpaceXAI将于周四发布Grok 4.5模型,该模型在内部测试中获得积极反馈。Grok 4.5是一个更快、更高效、成本更低的Opus级模型,基于1.5万亿参数的V9基础模型,并经过Cursor的专门训练,可能在软件工程任务中表现更佳。此外,预计在八月发布更大规模的2万亿参数V系列模型。

“Opus级,但更快”:埃隆·马斯克谈如何超越Anthropic

The New Stack
The New Stack · 2026-07-08T18:59:49Z
介绍Kotlin基准测试以评估AI编码代理

JetBrains发布了Kotlin基准测试,旨在评估AI编码代理在Kotlin软件工程任务中的表现。基准测试基于SWE-bench方法,包含105个来自开源项目的任务,要求AI代理理解问题描述并生成有效补丁。初步结果显示,Claude Code以85.71%的解决率领先。未来计划扩展任务范围、增加评估指标,并评估更多代理和模型配置。

介绍Kotlin基准测试以评估AI编码代理

The JetBrains Blog
The JetBrains Blog · 2026-07-08T07:26:45Z

本文讨论了SWE-Doctor,一个通过多面Bug复现测试(BRT)指导软件开发的研究。研究表明,传统BRT主要用于验证,未能有效指导补丁生成。SWE-Doctor将BRT转变为实时诊断工具,收集丰富的运行时信息,从而提升补丁质量。实验结果显示,该方法在多个基准上显著提高了Bug修复率,并减少了部分补丁的产生,展示了BRT在软件工程中的潜力。

一分钟读论文:《SWE-Doctor——用多面 Bug 复现测试引导 Agent》

Micropaper
Micropaper · 2026-07-07T00:00:00Z
每个AI产品背后的隐秘工程:软件工程师应了解的内容

本文探讨了生产AI系统的工程挑战,强调模型只是系统的一部分。成功的AI产品需要良好的软件工程,包括API、权限管理、数据检索和安全检查。提示工程、评估和可观察性是确保AI功能可靠的关键。人机协作设计在高风险场景中尤为重要,部署过程应包括监控和回滚机制。强大的软件工程是将模型API转化为可信AI产品的基础。

每个AI产品背后的隐秘工程:软件工程师应了解的内容

freeCodeCamp.org
freeCodeCamp.org · 2026-07-06T18:42:15Z
HashiCorp 创始人:AI 时代,我们为什么越来越需要有“品味”的程序员?

随着AI技术的发展,软件工程的生产力显著提升,初级程序员能够快速生成完整系统。HashiCorp创始人Mitchell Hashimoto指出,未来软件工程师的核心竞争力在于“品味”,即在缺乏客观标准的情况下做出高质量判断的能力。工程师需保持对架构的控制,深入探究“为什么”,并跨界吸收知识,以提升自身的工程品味。

HashiCorp 创始人:AI 时代,我们为什么越来越需要有“品味”的程序员?

Tony Bai
Tony Bai · 2026-06-30T23:00:00Z
HashiCorp 创始人:AI 时代,我们为什么越来越需要有“品味”的程序员?

在AI时代,软件工程的核心竞争力转向“品味”。HashiCorp创始人Mitchell Hashimoto指出,品味是做出高质量判断的能力,体现在架构设计和代码简化中。随着AI使代码生成变得廉价,工程师需保持对架构的控制,深入理解“为什么”而非仅仅“怎么做”。提升品味需跨界学习,关注人文素养,以应对未来技术挑战。

HashiCorp 创始人:AI 时代,我们为什么越来越需要有“品味”的程序员?

Tony Bai
Tony Bai · 2026-06-30T23:00:00Z
“Harness是艰苦工作的地方”:Harness押注于企业在生产中可以信任的代理

Harness推出了自主工作代理,允许企业用AI代理替代固定脚本,提升交付流程的灵活性。代理在客户控制的基础设施上运行,确保安全性和审计。Harness还建立了代理市场,提供多种预构建代理,支持企业根据需求选择和管理。未来,Harness计划实现完全自主的软件工程流程。

“Harness是艰苦工作的地方”:Harness押注于企业在生产中可以信任的代理

The New Stack
The New Stack · 2026-06-30T15:00:00Z
01 引言:软件工程范式的五十年之变

自1968年以来,软件工程经历了重大变革。AI的崛起使编程主体从人类转向机器,编程方式演变为“氛围编程”,降低了门槛但也带来了质量隐患。工程师需掌握结构化方法,以确保AI生成代码的质量。未来的竞争力在于构建高效的AI协作系统,而非单纯的编码速度。

01 引言:软件工程范式的五十年之变

鸟窝
鸟窝 · 2026-06-21T16:00:00Z
00 卷首语:当 Karpathy 说他半年没写一行代码

Andrej Karpathy表示,他已半年未写代码,但仍在推动AI领域的创新。他将软件工程划分为三个时代,强调AI使编程更简单,同时也增加了软件质量的挑战。人类开发者的角色转变为定义目标和审查产出,AI成为强大的工具。工程师需提升判断力和责任感,以应对AI带来的新挑战。

00 卷首语:当 Karpathy 说他半年没写一行代码

鸟窝
鸟窝 · 2026-06-21T13:20:27Z
OpenClaw.NET 上线 MetaSkills :软件工程第一性原理的工业级实践 - 张善友

本文探讨了软件工程的第一性原理,强调管理复杂度的重要性。通过开源项目MetaSkills的实践,展示了利用抽象技术应对软件开发中的困难,提升开发效率。开发者需理解复杂性,但框架可减轻负担,使其专注于核心逻辑。最终,强调软件工程师在面对本质困难时的不可替代性。

OpenClaw.NET 上线 MetaSkills :软件工程第一性原理的工业级实践 - 张善友

张善友
张善友 · 2026-06-16T22:42:00Z
半年过去了,我和 AI Coding 的关系有什么变化?

作者回顾了半年使用AI编程的变化,强调VibeKanban在多任务处理中的重要性。AI正在改变软件工程行业,初级程序员的价值被压缩,而优秀工程师的价值提升。建议从业者培养判断力和开放心态,以适应技术变革。未来需要具备品味和判断力的人才。

半年过去了,我和 AI Coding 的关系有什么变化?

西秦公子
西秦公子 · 2026-06-16T15:30:22Z
AI 的天花板,比所有人说的都低

文章探讨了AI技术的短期高估与长期低估,指出当前主流的统计学习范式(如LLM)存在效用边界。AI的投资回报率不明确,许多投资实际上是对未来的期权,而非当前效率的投资。AI在软件工程中的影响有限,主要由于需求澄清和跨角色摩擦等成本结构未得到改善。文章认为,若不出现根本不同的新范式,AI的长期潜力可能被高估。

AI 的天花板,比所有人说的都低

乱世浮生
乱世浮生 · 2026-06-15T23:17:47Z
谷歌 SRE 重磅白皮书:当 AI 自动写出 10 倍代码,谁来阻止系统崩溃?

谷歌SRE发布白皮书,探讨生成式AI对软件工程的影响。随着AI加速代码生成,系统稳定性面临挑战。谷歌提出五个自治级别,强调AI在运维中的重要性,并介绍三大AI运维工具以提升效率和安全性。未来SRE角色将转变为“安全架构师”,专注于设计安全边界,确保系统可靠性。

谷歌 SRE 重磅白皮书:当 AI 自动写出 10 倍代码,谁来阻止系统崩溃?

Tony Bai
Tony Bai · 2026-06-14T16:00:00Z
码上见真章!挑战杯“揭榜挂帅”华为赛道,邀你来战!

2026年度中国青年科技创新“挑战杯”华为赛道大赛启动,鼓励参赛者利用华为云码道解决软件工程问题,涉及智慧医疗和智能制造等领域。获奖者将进入华为人才储备池,优先获得实习和就业机会。

码上见真章!挑战杯“揭榜挂帅”华为赛道,邀你来战!

华为云官方博客
华为云官方博客 · 2026-06-11T03:01:07Z
Anthropic发布首个神话级模型Claude Fable

Anthropic发布了最新的AI模型Claude Fable 5,称其为最强大的广泛可用模型。该模型在软件工程、知识工作和视觉任务中表现出色,并具备新的安全措施以防止高风险领域的响应。同时,公司还推出了Claude Mythos 5,提供有限访问权限,定价显著高于之前的模型。

Anthropic发布首个神话级模型Claude Fable

The Verge
The Verge · 2026-06-09T17:00:00Z
AI 范式雷达:《软件工程的终结:AI Agent 如何重写开发范式》

AI Agent系统的出现正在重构软件工程范式,挑战传统假设,如决策逻辑可编码和代码为决策载体。代码不再是静态的,而是动态生成的,工程师的角色转变为推理架构师。Agent能够自主理解需求并生成代码,改变了开发流程和工程师的核心技能。未来需关注Agent的质量、基础设施标准化及安全治理等问题。

AI 范式雷达:《软件工程的终结:AI Agent 如何重写开发范式》

Micropaper
Micropaper · 2026-06-07T00:00:00Z
传奇黑客 Geohot 炮轰 AI Agent:这是软件工程史上代价最昂贵的灾难!

传奇黑客Geohot批评AI Agent,称其为软件工程史上最昂贵的错误。他认为AI无法有效编写高质量代码,导致开发者提交大量垃圾代码,影响系统稳定性。企业因追求虚假指标而忽视代码质量,造成恶性循环。他建议工程师应回归基础,保持对代码质量的追求,避免盲目依赖AI。

传奇黑客 Geohot 炮轰 AI Agent:这是软件工程史上代价最昂贵的灾难!

Tony Bai
Tony Bai · 2026-06-05T16:00:00Z
一分钟读论文:《SpecBench:面向软件工程 Agent 的规范级推理评估》

多伦多大学等机构提出了规范级推理评估基准SpecBench,以评估软件工程Agent在规范设计阶段的能力。研究显示,GPT-5.4在基础级任务的准确率为62.1%,但在进阶和困难级任务中显著下降,分别为44.4%和28.7%。这表明当前Agent在规范推理上的能力低于预期,强调了规范设计在软件工程中的重要性。SpecBench为评估提供了标准化工具,推动评估体系向规范层面扩展。

一分钟读论文:《SpecBench:面向软件工程 Agent 的规范级推理评估》

Micropaper
Micropaper · 2026-06-02T00:00:00Z
Mellum2 开源:一个快速的 AI 工作流模型

Mellum2是一个开源的12B模型,专为AI工作流设计,旨在解决生产AI中的延迟、吞吐量和成本问题。它专注于自然语言和代码,适用于软件工程环境,支持低延迟的AI任务路由、快速摘要和本地部署,以提高效率并降低计算成本。

Mellum2 开源:一个快速的 AI 工作流模型

The JetBrains Blog
The JetBrains Blog · 2026-06-01T12:57:50Z
  • <<
  • <
  • 1 (current)
  • 2
  • 3
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码