小红花·文摘
  • 首页
  • AI Tokens🪙
  • 排行榜🏆
  • 直播
  • FAQ
GPT-6 Astra 正式发布:性能 AGI,贵到要负债

OpenAI发布GPT-6 Astra,宣称达到AGI水平。该模型在数学、科学及软件工程测试中表现优异,尤其在环境理解和电脑操作上超越前代,能直接使用GUI完成复杂任务,如开发游戏、处理财务文件。尽管通用智能评分非最高,但凭借高效token利用和低幻觉率,在编码领域具成本优势。OpenAI强调其对齐能力,同时警示监控难度增加。

GPT-6 Astra 正式发布:性能 AGI,贵到要负债

爱范儿 爱范儿 · 2026-09-04T00:36:58Z
Gemini 3.8 Flash 光速发布:干活挺勤快,就是没开窍

Google发布Gemini 3.8 Flash,六周内第三款Flash模型,主打长程软件工程和Agent任务,跑分接近Claude Opus 5,但实测细节粗糙,能力依赖推理超频。Google因3.5 Pro失败转向快速迭代策略,放弃前沿竞争,以低成本模型服务十亿用户,但Flash在真实任务中仍与旗舰模型有差距。

Gemini 3.8 Flash 光速发布:干活挺勤快,就是没开窍

爱范儿 爱范儿 · 2026-09-02T22:52:37Z
谷歌称其新Gemini 3.8 Flash模型‘更努力’但成本可能更高

谷歌发布Gemini 3.8 Flash模型,强调通过更多推理步骤提升复杂任务性能,但可能增加令牌消耗和成本。该模型在软件工程和自主AI代理基准测试中表现优异,超越前代及竞品。同时推出面向政府及可信伙伴的3.8 Flash Cyber版本及Fairwind计划,用于网络安全防护。

谷歌称其新Gemini 3.8 Flash模型‘更努力’但成本可能更高

The Verge The Verge · 2026-09-02T20:11:40Z
你的替代文本通过了自动化检查,但这并不意味着它写得很好。

文章介绍了GitHub上关于AI与软件工程的三项技术进展:Java开发者可通过Copilot SDK用Java代码驱动AI;将大型AI生成的拉取请求拆分为可审查的堆栈;以及通过分支循环和字节运算实现内存级高速代码大小写折叠,单核速度超45 GiB/s。

你的替代文本通过了自动化检查,但这并不意味着它写得很好。

The GitHub Blog The GitHub Blog · 2026-08-24T20:56:32Z
本地跑 AI Agent 成本到底有多低?

以懒猫AI算力舱(英伟达芯片,128GB显存)为例,通过Pi Agent运行DeepSeek V4 Flash,50分钟自动完成代码编写、Docker镜像构建及推送。两台设备运行时功耗约130W,一小时耗电0.13度,电费仅8分钱,日成本约1.9元。离线AI计算具备三大优势,适合处理软件工程体力活。

本地跑 AI Agent 成本到底有多低?

Andy Stewart Andy Stewart · 2026-08-20T16:00:00Z
GLM 5.3现已在AI Gateway上线

Z.ai推出GLM 5.3,现已在AI Gateway上线。该模型在复杂软件工程和多步代理任务上优于GLM 5.2,同时输出更少token,并增强漏洞发现能力。它支持1M上下文窗口、128K输出,具备函数调用等功能,可通过统一API使用,无加价和平台费。

GLM 5.3现已在AI Gateway上线

Vercel News Vercel News · 2026-08-18T00:00:00Z
Gemini 3.7 Flash 现已在 AI Gateway 上线,享五折优惠

Google推出Gemini 3.7 Flash,现于AI Gateway提供,享五折优惠至2026年底。该模型提升软件工程与代理任务性能,减少失败循环,并能从设计稿直接生成应用代码。用户可通过AI SDK设置模型,或配置编码代理使用。AI Gateway提供统一API、成本追踪及优化功能,无加价收费。

Gemini 3.7 Flash 现已在 AI Gateway 上线,享五折优惠

Vercel News Vercel News · 2026-08-13T00:00:00Z
Agent 系统的不确定性治理:当软件工程遭遇"梯度下降" - 张善友

本文探讨Agent系统评测难题:传统软件调用链编译期确定,而Agent工具调用运行时涌现,缺乏绝对正确性参照。核心挑战是任务目标不可计算,需用代理指标近似,但方向可能偏差。工程策略非求解而是约束:用确定性DAG骨架封装不确定性,为Skill定义多维评估向量,并插入可判定的Reflection Gate。最终目标非全局最优,而是预算内“足够好且可解释”的满意解,强调可靠性胜过聪明。

Agent 系统的不确定性治理:当软件工程遭遇"梯度下降" - 张善友

张善友 张善友 · 2026-08-11T11:53:00Z
3600人、95%覆盖率、24万次拦截:Cloudflare怎么用AI把“提效不降质”变成现实

Cloudflare用11个月构建了AI工程栈,分为平台、知识、治理三层:通过代理Worker和AI Gateway实现零信任与降本,用AGENTS.md和Backstage提供上下文,以Codex RFC标准库机器化工程规范。其AI代码评审系统由协调者调度7个专科Agent,按风险分级,四个月拦截1.6万次不合规合并,单次成本仅0.98美元,展示了AI时代软件工程的标准落地与审查执行之道。

3600人、95%覆盖率、24万次拦截:Cloudflare怎么用AI把“提效不降质”变成现实

Tony Bai Tony Bai · 2026-08-09T23:00:00Z
AI 范式雷达:《从代码补全到自主软件工程:Agentic Coding 的范式转移》

Agentic Coding将AI编程从被动补全转向主动规划-执行-验证循环,SWE-bench成绩三年内从不足6%跃升至50%-70%+。核心包括规划器、执行引擎和验证器,实现多文件修改与自我修正。主流框架有Claude Code、Cursor、OpenHands和Aider,各有适用场景。但存在幻觉、回归错误和安全风险,需谨慎使用。

AI 范式雷达:《从代码补全到自主软件工程:Agentic Coding 的范式转移》

Micropaper Micropaper · 2026-08-09T00:00:00Z
软件工程正经历价值转移:从代码制造转向品味选择

AI编程工具大幅提升代码生成效率,但技术门槛降低后,品味成为稀缺能力。文章指出,摩擦和错误是培养品味的关键,AI将代价归零,使新一代开发者失去学习机会。生成内容泛滥导致市场信号失灵,优质作品被平庸之作淹没。最终,软件工程的价值从制造转向选择,判断力成为核心,却难以量化奖励。

软件工程正经历价值转移:从代码制造转向品味选择

极道 极道 · 2026-08-07T00:35:00Z
机器人规模化软件工程师指南 – OpenCV Live 第219期

本文介绍OpenCV Live第219期节目,主题为机器人规模化软件工程。Civ Robotics CTO Amit Moran分享分布式机器人车队现场运维实践,包括固定版本构建、全面心跳监控、远程重启及任务数据保存。节目提供多平台直播,并赠送OpenCV大学课程。

机器人规模化软件工程师指南 – OpenCV Live 第219期

OpenCV OpenCV · 2026-08-06T06:38:40Z
一年连融三轮数亿元!字节+清华姚班,重构企业软件工程

词元无限是一家企业级AI Agent基础设施公司,成立一年融资数亿元。其核心是解决AI写代码快但企业交付效率提升有限的问题,通过全自主、高安全、自进化的平台,提供InfCode、InfTest等产品,实现“结果即服务”,目标将团队整体提效2倍以上。

一年连融三轮数亿元!字节+清华姚班,重构企业软件工程

量子位 量子位 · 2026-07-30T06:10:13Z
无需人工验证的代码交付

文章探讨AI时代软件工程中代码审查的瓶颈,提出以自动化验证取代人工审查。核心观点是将人类角色从“在环内”转为“在环上”,即维护自动化系统而非逐行审查。建议设立“自动化验证工程师”岗位,从1%的提交开始,逐步提高无需人工验证的比例,并借鉴CI/CD和芯片制造的质量控制经验,构建多层防护网。

无需人工验证的代码交付

The New Stack The New Stack · 2026-07-29T13:00:00Z
别再纠正AI代码,构建代理所需的系统。

AI工具正改变软件工程,开发者从写代码转向管理“上下文”。DevOps之父Patrick Debois指出,软件开发周期已演变为上下文开发周期,强调“改进系统而非提示词”。团队需共享上下文,构建内外部“护栏”和反馈循环,使AI代理自主评估改进。这一转变需组织级协作,从个人到平台扩展,实现AI驱动的持续迭代。

别再纠正AI代码,构建代理所需的系统。

The New Stack The New Stack · 2026-07-25T17:00:00Z
什么是工程问题?

本文探讨软件工程中技术问题与工程问题的区别,强调工程问题涉及真实需求、限制和环境,需权衡取舍。引用Brooks《无银弹》观点,指出软件复杂性、遵从性、易变性和不可见性等本质问题无法简单解决,LLM编程未消除这些挑战。作者呼吁区分娱乐与职责,重视长期维护和优秀设计,而非仅追求技术炫技。

什么是工程问题?

極客死亡計劃 極客死亡計劃 · 2026-07-25T03:27:21Z
软件正变得比理解更容易编写

AI编程工具降低了编码成本,但软件工程的核心仍是理解、设计与判断。代码生成速度超过人类理解,导致“理解债务”和问责问题。过度依赖AI有风险,复杂故障仍需人类经验。工程价值在于设计思维与协作,AI应辅助而非替代工程师,否则企业将失去长期能力。

软件正变得比理解更容易编写

Ben Morris. Agile enterprise architecture. Ben Morris. Agile enterprise architecture. · 2026-07-12T10:00:00Z
更好的工具让Copilot的代码审查变得更糟。我们是如何真正改善它的。

Napalys Klicius是GitHub的软件工程师,专注于智能系统的构建。他的工作包括自动化跨仓库文档、实现GitHub Pages的零DNS配置,以及评估GitHub Copilot的性能和效率。

更好的工具让Copilot的代码审查变得更糟。我们是如何真正改善它的。

The GitHub Blog The GitHub Blog · 2026-07-10T15:57:47Z
“Opus级,但更快”:埃隆·马斯克谈如何超越Anthropic

埃隆·马斯克宣布,SpaceXAI将于周四发布Grok 4.5模型,该模型在内部测试中获得积极反馈。Grok 4.5是一个更快、更高效、成本更低的Opus级模型,基于1.5万亿参数的V9基础模型,并经过Cursor的专门训练,可能在软件工程任务中表现更佳。此外,预计在八月发布更大规模的2万亿参数V系列模型。

“Opus级,但更快”:埃隆·马斯克谈如何超越Anthropic

The New Stack The New Stack · 2026-07-08T18:59:49Z
介绍Kotlin基准测试以评估AI编码代理

JetBrains发布了Kotlin基准测试,旨在评估AI编码代理在Kotlin软件工程任务中的表现。基准测试基于SWE-bench方法,包含105个来自开源项目的任务,要求AI代理理解问题描述并生成有效补丁。初步结果显示,Claude Code以85.71%的解决率领先。未来计划扩展任务范围、增加评估指标,并评估更多代理和模型配置。

介绍Kotlin基准测试以评估AI编码代理

The JetBrains Blog The JetBrains Blog · 2026-07-08T07:26:45Z
  • <<
  • <
  • 1 (current)
  • 2
  • 3
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码