小红花·文摘
  • 首页
  • 广场
  • 排行榜🏆
  • 直播
  • FAQ
Dify.AI

乔治·霍茨认为AI代理无法真正学会编程,因为它们只是统计模型,模仿而非理解编程过程。AI生成的代码虽然看似正确,但缺乏深思熟虑,导致质量下降,尤其影响大组织,底层员工难以识别错误。霍茨提倡使用世界模型以实现真正的编程能力。

TIL: George Hotz 说 AI agent 永远学不会编程

暗无天日
暗无天日 · 2026-07-08T00:00:00Z
实测腾讯 Hy3 正式版,这次终于赶上了「AI 下半场」

Hy3大模型经过两个月的迭代后正式上线,显著提升了编程和办公能力。用户反馈推动其在3D网页生成、任务规划和多工具调用等方面取得进展。Hy3在各项基准测试中表现优异,接近国内外旗舰模型水平,能够处理复杂任务并生成多种格式文件,成为AI工作的新选择。

实测腾讯 Hy3 正式版,这次终于赶上了「AI 下半场」

爱范儿
爱范儿 · 2026-07-06T10:25:56Z
智谱GLM-5.2开源模型杀疯了,编程能力对标Opus 4.8

智谱GLM-5.2开源模型在编程能力上已追平闭源的Claude Opus 4.8,标志着开源模型的重大进步。该模型在真实任务中表现出色,受到社区热烈反响,可能改变市场格局,推动更多开源模型的发展。

智谱GLM-5.2开源模型杀疯了,编程能力对标Opus 4.8

极道
极道 · 2026-06-24T22:31:00Z

文章讨论了AI编程对编程能力的影响。支持者认为依赖AI会导致动手能力退化,强调理解与实践的重要性;反对者则认为AI可以加速学习,编程技能并未完全丧失。核心争论在于“学会了”的定义,区分动手能力与理解能力。最终,冷漠态度比能力退化更可怕。

读:HN 热帖——用 AI 写代码,你的手艺在退化吗?

暗无天日
暗无天日 · 2026-06-22T00:00:00Z
华为云携手全国十所重点高校共建AI编程教学实践中心

华为云与十所高校联合发布“华为云码道高校教学实践计划”,旨在通过AI工具和校企合作提升学生编程能力,推动AI教育与产业需求对接。计划提供产品资源、技术保障、课程内容及师资培训等权益,建立“码道高校AI编程教学实践中心”,促进创新人才培养。

华为云携手全国十所重点高校共建AI编程教学实践中心

华为云官方博客
华为云官方博客 · 2026-06-08T09:58:43Z

随着Claude Opus 4.7和4.8的推出,关于新模型语言能力下降的讨论增多。Arena AI的数据分析显示,基础模型的编程能力显著提升,几乎是语言能力提升的两倍。厂商将资源重心转向编程能力,因其短期内的变现潜力更明确。尽管语言能力缓慢上升,但整体进展不如编程能力明显。未来大语言模型是否会转变为大编程模型仍需观察。

大语言模型正在变成大编程模型

少数派
少数派 · 2026-06-08T02:45:45Z
MiniMax M3一手实测:老黄PPT上74个Logo,我以为能难住它

MiniMax M3模型引发热议,提升了周用量限额并保持老用户设定。M3在长上下文、多模态和编程能力上表现突出,超越了GPT-5.5和Gemini 3.1 Pro,效率显著提高。M3成功复现多篇论文,展示了其强大的自主学习和实验能力。同时推出的MiniMax Code进一步增强了M3的功能。整体来看,M3在开源模型中具备竞争力,性价比高,成为开发者的新选择。

MiniMax M3一手实测:老黄PPT上74个Logo,我以为能难住它

量子位
量子位 · 2026-06-02T15:50:16Z

DeepSWE测试显示,GPT-5.5在编程能力上超越Claude Opus 4.8,表现出更高的效率和可靠性。新考试更真实,反映了AI在实际工作中的能力,用户普遍认为GPT-5.5更实用。

DeepSWE结果发布:GPT-5.5把Claude Opus 4.8比下去了

极道
极道 · 2026-06-01T02:38:00Z
国产AI编程冲上全球第二!实测五大模型,谁才是Vibe Coding神器

阿里推出的Qwen3.7 Max在编程能力评测中获得第二名,仅次于Claude Opus 4.7。该模型在网页设计和小游戏生成方面表现优异,用户体验和自定义功能有显著提升。尽管在某些任务中未必超越GPT-5.5,但整体能力已显著增强。用户可通过阿里云享受优惠的Token使用,进一步测试其性能。

国产AI编程冲上全球第二!实测五大模型,谁才是Vibe Coding神器

爱范儿
爱范儿 · 2026-05-28T04:02:13Z

埃隆·马斯克透露,xAI将在未来2~3周发布新模型Grok V9-Medium,参数达到1.5万亿,显著提升编程能力。新模型整合了Cursor AI的开发者数据,改善复杂编码任务表现。SpaceX计划收购Cursor AI,以增强在AI编程市场的竞争力。Grok V9-Medium将优先面向订阅用户,后续逐步开放。

Grok 1.5T参数版新模型将在2~3周内发布 利用Cursor真实数据大幅度提高编码能力

蓝点网
蓝点网 · 2026-05-26T02:00:34Z

Gemini 3.5 Flash在APEX测试中表现出色,擅长处理长流程和多工具切换的工作流,但不具备编程能力。其优势在于快速执行任务,而非深度推理。未来程序员的能力将侧重于任务拆解和工作流设计,管理代码的能力将变得更加重要。Gemini 3.5 Flash适合处理复杂的实际工作任务,而非仅仅进行算法考试。

Gemini 3.5 Flash编码能力真相解析:APEX冠军强在长流程多工具切换

极道
极道 · 2026-05-22T02:53:00Z
谷歌用 AI 「杀死」谷歌,这场发布会看得人缺氧

在Google I/O大会上,Google CEO宣布Gemini App的月活跃用户超过9亿,AI技术在各行业的应用不断扩展。新模型Gemini Omni和Gemini 3.5 Flash提升了视频生成和编程能力,支持更复杂的任务执行。同时,Google推出了个人AI代理Gemini Spark,能够在用户关机时继续工作。此外,Google计划通过订阅服务转型为AI基础设施公司,探索用户愿意为智能助手付费的可能性。

谷歌用 AI 「杀死」谷歌,这场发布会看得人缺氧

爱范儿
爱范儿 · 2026-05-19T21:52:48Z
从日入$10到不以物喜的修行:阿小信的自由职业周记(2026W18-19)

阿小信分享了作为独立开发者的经历,恢复了AdSense广告收入,日入10美元。他在武汉和岳阳旅行,感受到生活的复杂与挑战,同时面临健康和家庭问题。他强调编程能力的重要性,并探讨了AI编程的影响。尽管收入下降,他依然相信努力可以实现自由。

从日入$10到不以物喜的修行:阿小信的自由职业周记(2026W18-19)

人言兑
人言兑 · 2026-05-12T10:53:15Z
受够了 Kimi 的卡顿,我换 DeepSeek V4 跑 Claude Code,爽飞了

DeepSeek V4 的编程能力与 Claude Opus 相近,延迟从 Kimi 的 34 秒降至 2-3 秒,稳定性更好。月费仅 $73,节省92%。支持复杂重构和跨文件分析,但目前不支持图片输入。建议重度用户尝试切换,以提高开发效率。

受够了 Kimi 的卡顿,我换 DeepSeek V4 跑 Claude Code,爽飞了

dotNET跨平台
dotNET跨平台 · 2026-05-04T00:03:14Z
GPT-5.5与DeepSeek V4,AI 竞争进入新格局!

GPT-5.5与DeepSeek V4同时发布,标志着AI竞争的新阶段。GPT-5.5重心在Codex,强调编程能力和文档处理。DeepSeek V4在编程竞赛中表现突出,但整体性能仍与顶尖模型有差距,未能完全超越国际对手。

GPT-5.5与DeepSeek V4,AI 竞争进入新格局!

硕鼠的博客站
硕鼠的博客站 · 2026-04-27T11:18:21Z
Claude Opus 4.7 发布:更费token了,用户评价两极

Anthropic发布了新模型Claude Opus 4.7,增强了编程和多模态能力,但用户反馈两极。新模型在处理复杂任务时更严谨,支持高分辨率图像输入。然而,token消耗显著增加,部分功能下降,尤其在文案撰写和长上下文检索方面。用户在法律和金融领域需谨慎使用。

Claude Opus 4.7 发布:更费token了,用户评价两极

TechWeb 全站精华
TechWeb 全站精华 · 2026-04-17T04:02:03Z
智谱GLM-5.1“Day0”上线华为云,可通过多款产品体验

智谱GLM-5.1于4月8日上线华为云,具备全球领先的开源模型能力,支持长达8小时的自主任务处理,并在编程能力上创下全球最佳成绩。该模型通过华为云提供便捷的API服务,提升企业开发效率与稳定性。

智谱GLM-5.1“Day0”上线华为云,可通过多款产品体验

量子位
量子位 · 2026-04-08T10:17:47Z
持续霸榜!阿里千问3.6Plus问鼎全球大模型调用周榜冠军

阿里千问3.6-Plus在OpenRouter周榜中夺冠,成为全球大模型调用量冠军,单日调用量突破1万亿Token。该模型在编程能力上排名中国第一,阿里位列全球第二。未来将开源更多模型,并发布更强的Qwen3.6-Max。

持续霸榜!阿里千问3.6Plus问鼎全球大模型调用周榜冠军

量子位
量子位 · 2026-04-07T04:00:52Z
日调用量超万亿破纪录!阿里千问3.6Plus登顶全球模型调用量榜首

阿里千问新模型Qwen3.6-Plus发布一天内,日调用量突破1.4万亿Token,成为全球大模型API调用量第一,创下新纪录。该模型在编程能力上表现突出,吸引了众多企业和开发者关注。

日调用量超万亿破纪录!阿里千问3.6Plus登顶全球模型调用量榜首

量子位
量子位 · 2026-04-04T13:38:01Z
GLM-5.1上线,编程表现贴Opus 4.6开大,Coding plan瞬间断货

GLM-5.1模型上线,编程能力较前代提升近10分,接近全球最强模型Opus 4.6。用户反馈积极,支持多平台接入,已售罄。实测显示其在空间理解和动态补全方面表现优异,适合复杂任务。

GLM-5.1上线,编程表现贴Opus 4.6开大,Coding plan瞬间断货

量子位
量子位 · 2026-03-28T06:06:38Z
  • <<
  • <
  • 1 (current)
  • 2
  • 3
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
友情链接: MOGE.AI 九胧科技 模力方舟 Gitee AI 菜鸟教程 Remio.AI DeekSeek连连 53AI 神龙海外代理IP IPIPGO全球代理IP 东波哥的博客 匡优考试在线考试系统 开源服务指南 蓝莺IM Solo 独立开发者社区 AI酷站导航 极客Fun 我爱水煮鱼 周报生成器 He3.app 简单简历 白鲸出海 T沙龙 职友集 TechParty 蟒周刊 Best AI Music Generator

小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码