Meta发布AI模型Muse Spark 1.3,编程能力超越GPT-5.6 Sol,价格低21倍。其“贡献者版”以数据换低价,引发隐私争议。模型在基准测试中登顶,但最强模式未上线,且训练数据来源不明。Meta五个月更新四版,急于证明实力,但开源承诺成疑,开发者成测试对象。
智谱开源发布GLM-5.3-Flash模型,采用MoE架构,总参数320B但激活仅18B,提升响应速度并降低成本。该模型在编程和智能体能力上接近Claude Opus 4.8,支持1M上下文,引入混合注意力机制。此前以ox-alpha代号在OpenRouter测试,现以MIT许可证开放下载。
Qwen 3.8 27B在编程任务中表现惊艳,能一次修复多个bug,并仅凭需求描述自主分析代码关系。尽管思考时间较长,但结果出色,优化速度后可作为主力编程模型,全离线AI编程能力强大。
GLM-5.3发布,基座未变但后训练大幅提升编程能力,代码干净、长任务执行强,Token效率高。但存在死循环耗资源、通用智能弱、无原生视觉等短板。定位为需人类明确指令的强力执行者,适合已理解的任务,不适合探索性工作。
智谱AI发布GLM-5.3,基座与5.2相同,仅靠后训练将编程分数提升六倍,并意外涌现网络安全能力,引发刷榜争议。模型效率高,成本低于闭源对手,但真实水平待开源验证,闭源巨头实力成谜。
阿里巴巴发布新一代基座大模型Qwen3.8,总参数2.4万亿,编程和办公能力大幅提升,在权威榜单中位列全球第一梯队。API已上线,国内价格优惠,国际价格低于竞品。模型支持视觉理解,上下文1M Tokens,在多项评测中创佳绩,能自主完成编程项目和专业任务,展现系统级规划与自适应学习能力。
Kimi K3上线48小时因用户过多导致算力告急,暂停C端新会员订阅。该模型为全球首个开源3万亿参数模型,编程能力领先,引发开发者创作热潮。官方将拆分普通与编程会员权益。市场反响热烈,日销售额增长6倍,公司估值超300亿美元,并筹备赴港IPO。
乔治·霍茨认为AI代理无法真正学会编程,因为它们只是统计模型,模仿而非理解编程过程。AI生成的代码虽然看似正确,但缺乏深思熟虑,导致质量下降,尤其影响大组织,底层员工难以识别错误。霍茨提倡使用世界模型以实现真正的编程能力。
Hy3大模型经过两个月的迭代后正式上线,显著提升了编程和办公能力。用户反馈推动其在3D网页生成、任务规划和多工具调用等方面取得进展。Hy3在各项基准测试中表现优异,接近国内外旗舰模型水平,能够处理复杂任务并生成多种格式文件,成为AI工作的新选择。
智谱GLM-5.2开源模型在编程能力上已追平闭源的Claude Opus 4.8,标志着开源模型的重大进步。该模型在真实任务中表现出色,受到社区热烈反响,可能改变市场格局,推动更多开源模型的发展。
文章讨论了AI编程对编程能力的影响。支持者认为依赖AI会导致动手能力退化,强调理解与实践的重要性;反对者则认为AI可以加速学习,编程技能并未完全丧失。核心争论在于“学会了”的定义,区分动手能力与理解能力。最终,冷漠态度比能力退化更可怕。
华为云与十所高校联合发布“华为云码道高校教学实践计划”,旨在通过AI工具和校企合作提升学生编程能力,推动AI教育与产业需求对接。计划提供产品资源、技术保障、课程内容及师资培训等权益,建立“码道高校AI编程教学实践中心”,促进创新人才培养。
随着Claude Opus 4.7和4.8的推出,关于新模型语言能力下降的讨论增多。Arena AI的数据分析显示,基础模型的编程能力显著提升,几乎是语言能力提升的两倍。厂商将资源重心转向编程能力,因其短期内的变现潜力更明确。尽管语言能力缓慢上升,但整体进展不如编程能力明显。未来大语言模型是否会转变为大编程模型仍需观察。
MiniMax M3模型引发热议,提升了周用量限额并保持老用户设定。M3在长上下文、多模态和编程能力上表现突出,超越了GPT-5.5和Gemini 3.1 Pro,效率显著提高。M3成功复现多篇论文,展示了其强大的自主学习和实验能力。同时推出的MiniMax Code进一步增强了M3的功能。整体来看,M3在开源模型中具备竞争力,性价比高,成为开发者的新选择。
DeepSWE测试显示,GPT-5.5在编程能力上超越Claude Opus 4.8,表现出更高的效率和可靠性。新考试更真实,反映了AI在实际工作中的能力,用户普遍认为GPT-5.5更实用。
阿里推出的Qwen3.7 Max在编程能力评测中获得第二名,仅次于Claude Opus 4.7。该模型在网页设计和小游戏生成方面表现优异,用户体验和自定义功能有显著提升。尽管在某些任务中未必超越GPT-5.5,但整体能力已显著增强。用户可通过阿里云享受优惠的Token使用,进一步测试其性能。
埃隆·马斯克透露,xAI将在未来2~3周发布新模型Grok V9-Medium,参数达到1.5万亿,显著提升编程能力。新模型整合了Cursor AI的开发者数据,改善复杂编码任务表现。SpaceX计划收购Cursor AI,以增强在AI编程市场的竞争力。Grok V9-Medium将优先面向订阅用户,后续逐步开放。
Gemini 3.5 Flash在APEX测试中表现出色,擅长处理长流程和多工具切换的工作流,但不具备编程能力。其优势在于快速执行任务,而非深度推理。未来程序员的能力将侧重于任务拆解和工作流设计,管理代码的能力将变得更加重要。Gemini 3.5 Flash适合处理复杂的实际工作任务,而非仅仅进行算法考试。
在Google I/O大会上,Google CEO宣布Gemini App的月活跃用户超过9亿,AI技术在各行业的应用不断扩展。新模型Gemini Omni和Gemini 3.5 Flash提升了视频生成和编程能力,支持更复杂的任务执行。同时,Google推出了个人AI代理Gemini Spark,能够在用户关机时继续工作。此外,Google计划通过订阅服务转型为AI基础设施公司,探索用户愿意为智能助手付费的可能性。
阿小信分享了作为独立开发者的经历,恢复了AdSense广告收入,日入10美元。他在武汉和岳阳旅行,感受到生活的复杂与挑战,同时面临健康和家庭问题。他强调编程能力的重要性,并探讨了AI编程的影响。尽管收入下降,他依然相信努力可以实现自由。
完成下面两步后,将自动完成登录并继续当前操作。