小红花·文摘
  • 首页
  • 广场
  • 排行榜🏆
  • 直播
  • FAQ
Dify.AI
刚刚,一个免费AI Coding选手杀入全球第一梯队

Agnes AI推出了新一代文本模型Agnes-2.5-Flash,具备强大的编码能力,且永久免费。与Claude等工具相比,Agnes-2.5-Flash在代码理解、Bug修复和复杂任务执行上表现优异。同时,桌面端Agnes Code也上线,支持多模态内容处理,旨在降低开发者的使用门槛。Agnes AI的使命是让世界级AI普及到每个人,提供高性价比的服务。

刚刚,一个免费AI Coding选手杀入全球第一梯队

量子位
量子位 · 2026-07-14T12:36:48Z
GPT-5.6一发布,Claude终于舍得重置Fable 5额度了

OpenAI发布了GPT-5.6,推出Sol、Terra和Luna三个版本,具备更强的编码和知识工作能力。新模型引入ultra模式,支持多个agent并行处理任务,提高效率。同时,ChatGPT Work功能上线,能够跨应用生成专业成果。GPT-5.6在网络安全测试中表现优异,强调防范潜在滥用。

GPT-5.6一发布,Claude终于舍得重置Fable 5额度了

量子位
量子位 · 2026-07-10T09:41:25Z
Meta表示其新的AI模型已准备好在编码领域竞争

Meta推出了新的AI模型Muse Spark 1.1,旨在提升编码能力,支持复杂错误检测和修复。该模型通过Meta Model API向美国开发者开放,并提供20美元的免费积分。这是Meta在AI竞争中追赶OpenAI和谷歌的努力之一。

Meta表示其新的AI模型已准备好在编码领域竞争

The Verge
The Verge · 2026-07-09T14:00:00Z
Previewing GPT-5.6 Sol: a next-generation model

OpenAI预览了GPT-5.6 Sol,这是一个下一代模型,具备更强的编码、科学和网络安全能力,并配备了先进的安全系统。

Previewing GPT-5.6 Sol: a next-generation model

mongona news
mongona news · 2026-06-26T10:00:00Z
Anthropic 40万大样本揭秘:AI 时代为什么“专家”身价暴涨?

在AI时代,专家的经验因AI的辅助而获得更高的溢价。研究显示,专家使用AI工具的成功率高达91%,而新手仅为15%。AI成为高效执行者,人类负责决策。非软件行业的专家也通过AI提升编码能力,打破传统程序员的垄断。未来,程序员需转型为“代码审计师”,深入理解业务逻辑,以应对AI带来的挑战。

Anthropic 40万大样本揭秘:AI 时代为什么“专家”身价暴涨?

Tony Bai
Tony Bai · 2026-06-18T16:00:00Z
Claude Fable 5/Mythos 5模型发布 编码能力远远领先于其他模型

A社发布了Claude Fable 5和Claude Mythos 5模型,针对普通用户,编码能力超越其他模型。为防止滥用,特定请求将路由至Claude Opus 4.8。Claude Fable 5在多个领域表现优异,定价为百万输入10美元、输出50美元,使用成本较高。

Claude Fable 5/Mythos 5模型发布 编码能力远远领先于其他模型

蓝点网
蓝点网 · 2026-06-10T03:30:47Z

谷歌推出了Gemini 3.5系列模型,特别是3.5 Flash,具备卓越的智能和编码能力,能高效完成复杂任务,速度是其他模型的四倍,适用于长时间的代理任务,帮助企业和开发者提高工作效率。Gemini Spark是基于3.5 Flash的个人AI助手,旨在优化用户的数字生活。

Gemini 3.5:前沿智能与行动结合

The Keyword
The Keyword · 2026-05-19T17:45:00Z
AI Gateway上的Gemini 3.5 Flash

Gemini 3.5 Flash已在Vercel AI Gateway上线,提升了编码能力和并行执行,特别在核心推理、指令遵循和多轮对话方面表现优异,适合复杂任务。使用时需在AI SDK中设置为google/gemini-3.5-flash,AI Gateway提供统一API,支持模型调用、使用跟踪和性能优化。

AI Gateway上的Gemini 3.5 Flash

Vercel News
Vercel News · 2026-05-19T07:00:00Z

本文对四款国产大模型(GLM 5.1、Kimi K2.6、Mimo v2.5 Pro 和 DeepSeek V4 Pro)的编码能力进行了实测。结果显示,这些模型在短链路和简单任务中表现良好,但在复杂工程中容易出现上下文丢失和逻辑错误。尽管能够生成代码,但在高风险模块上仍需人工审核以确保安全性和准确性。总体而言,国产模型可作为辅助工具,但不应完全依赖。

国产大模型编码能力实测(GLM 5.1、Kimi K2.6、Mimo v2.5 Pro 和 DeepSeek V4 Pro)

I'm OWenT
I'm OWenT · 2026-04-30T18:00:45Z
中国DeepSeek预览新一代AI模型,距震撼美国竞争对手已一年

中国AI公司DeepSeek发布了其下一代AI模型V4,声称该模型在编码能力上有显著提升,并与美国领先系统竞争,兼容华为技术,标志着中国芯片产业的重要进步。

中国DeepSeek预览新一代AI模型,距震撼美国竞争对手已一年

The Verge
The Verge · 2026-04-24T09:45:30Z
OpenAI推出的新$100/月计划,旨在帮助开发者突破Codex(和Claude Code)的使用限制

OpenAI推出了新的$100/月的ChatGPT Pro计划,专为Codex用户设计,提供比$20/月的Plus计划多5倍的Codex使用量。该计划还包括对Pro模型和深度研究能力的访问,以及早期实验功能的使用权。与Anthropic的类似计划相比,OpenAI的Codex在付费层级中提供更高的编码能力。

OpenAI推出的新$100/月计划,旨在帮助开发者突破Codex(和Claude Code)的使用限制

The New Stack
The New Stack · 2026-04-09T18:30:11Z

智谱AI已开源GLM-5.1智能体模型,采用MIT许可证,开发者可通过HF和魔搭平台下载。该模型在编码能力和处理模糊问题上表现优异,支持个人及商业使用。完整部署说明见智谱GitHub。

继续采用MIT许可证:智谱现已开源旗舰级智能体工程模型GLM-5.1

蓝点网
蓝点网 · 2026-04-08T05:30:12Z
Qwen 3.6 Plus在AI Gateway上

阿里巴巴的Qwen 3.6 Plus已在Vercel AI Gateway上线,增强了编码能力和多模态感知,支持更复杂的任务。使用时需在AI SDK中设置为qwen/qwen3.6-plus。

Qwen 3.6 Plus在AI Gateway上

Vercel News
Vercel News · 2026-04-02T07:00:00Z
通过工程化的Harness改进Deep Agent

我们的Coding Agent在Terminal Bench 2.0中从第30名跃升至第5名,主要通过优化harness实现。该项目聚焦系统性解决方案,利用Trace分析失败模式,提升模型性能。通过调整系统提示词、工具和中间件,优化了agent的编码能力,最终得分达到66.5%。

通过工程化的Harness改进Deep Agent

Teach Talk
Teach Talk · 2026-03-16T06:13:07Z
AI代理能否构建真实的Stripe集成?我们开发了一个基准来验证这一点

研究表明,尽管先进的AI模型在编码能力上有所提升,但在完全自主管理软件工程项目方面仍存在差距。我们开发了Stripe集成基准,以评估AI代理在构建完整Stripe集成中的表现。结果显示,模型在处理后端和全栈任务时表现出色,但在模糊任务中仍有困难。通过这些基准,我们希望提高AI在Stripe集成中的准确性和可靠性。

AI代理能否构建真实的Stripe集成?我们开发了一个基准来验证这一点

Stripe Blog
Stripe Blog · 2026-03-02T00:00:00Z
GPT 5.3 Codex现已上线AI Gateway

GPT-5.3 Codex已在AI Gateway上线,结合了GPT-5.2的编码能力和推理深度,速度提升25%。该模型适用于软件生命周期的各个阶段,支持多步骤执行和上下文控制,特别适合网页开发。使用时需设置为openai/gpt-5.3-codex。

GPT 5.3 Codex现已上线AI Gateway

Vercel News
Vercel News · 2026-02-24T13:00:00Z
Kimi K2.5已在AI Gateway上线

Kimi K2.5是Moonshot AI最新的智能模型,支持无账户访问,具备强大的编码和视觉理解能力,能够创建动态用户界面。使用时需在AI SDK中设置为moonshotai/kimi-k2.5,AI Gateway提供统一API,支持跟踪和性能优化。

Kimi K2.5已在AI Gateway上线

Vercel News
Vercel News · 2026-01-26T13:00:00Z

DeepSeek V4预计春节前发布,专注编码能力,测试结果显示超越现有模型,在超长代码处理和数据理解上有显著突破,生成答案逻辑更清晰,推理能力增强。

DeepSeek V4爆料:春节档GPT/Claude编程危

量子位
量子位 · 2026-01-10T01:27:28Z
GLM-4.7 可以平替 Claude Code 的国产编码大模型

GLM-4.7是智谱的最新旗舰模型,增强了编码能力和任务规划,支持多种思考模式和工具调用,适用于Agentic Coding和多模态交互,提升编程和视觉效果,生成高质量内容。

GLM-4.7 可以平替 Claude Code 的国产编码大模型

文武科技柜
文武科技柜 · 2026-01-01T13:08:40Z
GLM-4.7上线并开源:更强的编码

智谱官微宣布GLM-4.7模型上线并开源,增强了编码、推理和工具协同能力,表现优于前版本。该模型在多项基准测试中领先,支持复杂任务的统一规划与协作,提升了生成质量和用户体验。

GLM-4.7上线并开源:更强的编码

实时互动网
实时互动网 · 2025-12-23T01:19:15Z
  • <<
  • <
  • 1 (current)
  • 2
  • 3
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码