本期播客回顾科技界重大动态:苹果CEO换帅,John Ternus接任;AI领域Fable 5.1发布,GLM-5.3-Flash以高性价比引发关注;英伟达拟129亿美元收购Hugging Face。此外,OpenAI与Broadcom合作研发芯片,苹果标注AI内容,小米发布玄戒芯片,李飞飞团队推出世界模型Atlas,宇树科技上市等。
GLM 5.3 Flash与DeepSeek V4 Flash在Hermes Agent实测对比:GLM跑分高但落地差,工具调用不稳、不守Agents.md规则;DeepSeek虽参数少、跑分低,但干活稳,被社区推荐为默认模型。文章指出评测与实战脱节,Agent场景更需“听话”模型,便宜非关键,能干活才是王道。
GLM-5.3在AI Gateway上通过DigitalOcean提供50%折扣,有效期至9月8日。使用促销名称zai/glm-5.3-promo可享优惠,但仅限DigitalOcean且结束后失效;标准名称zai/glm-5.3则持续可用,支持多提供商路由。模型支持1M上下文和128K输出,可在playground或编码代理中使用。
GLM-5.3-Flash是Z.AI推出的低成本模型,价格约为旗舰版GLM-5.3的1/16。测试显示两者在编码、逻辑和提取任务中均得满分,准确性无差异,但Flash在困难任务中消耗更多token和时间,其成本优势依赖当前定价,可能变化。建议Flash适合简单任务,复杂任务需权衡时间与成本。
智谱发布GLM-5.3模型,总参数743B,采用MoE架构,激活39B,支持1M窗口,强化编程、智能体及网络安全能力。模型权重免费开源可商用,但非MIT许可证,营收超100亿美元的大型MaaS服务商需先申请审查,个人和普通企业不受影响。
TensorSharp 是纯 .NET LLM 推理引擎,三天内接入 GLM-5.3-Flash 和 Qwen3.8-Flash-Next 新架构。它支持进程内推理,性能上 decode 速度翻倍,prefill 持平,并强调正确性验证和部署便捷性。对 .NET 团队,这标志着前沿模型架构跟进加速,值得纳入 PoC 评估。
中国AI实验室Z.ai发布旗舰模型GLM-5.3,开放权重但采用限制性许可证,要求年收入超100亿美元的公司托管前需安全审查。模型性能接近美国前沿实验室,但许可证比DeepSeek等更严格,此举或为商业化考虑,因Nvidia和Stripe正收购模型平台,开源模型可能成为带条款的分发渠道。
智谱GLM-5.3-Flash的token套餐性价比低,缓存命中率仅8成,实际用量远低于宣传。对比opencode go的15美元额度,智谱lite月费118元仅约4.3亿token,pro约25亿,max约60亿,相当于70元买538元pro套餐,性价比差。目前经济实惠的tokenplan仅gpt、opencode、commandcode可选,作者怀念DeepSeek涨价前的低价,现靠Muse Spark维持。
智谱发布并开源GLM-5.3-Flash多模态模型,性能超GLM-5.2,与Claude Opus 4.8持平。商汤大装置提供国产算力支持,通过异构混推技术提升服务性能3倍,成本与英伟达GPU相当,推动国产算力规模化商用,日均Token服务量达2.42万亿。
智谱发布开源原生多模态模型GLM-5.3-Flash,采用MoE架构,支持文本图像输入及百万Token上下文,性能与Claude Opus 4.8持平,API定价大幅降低。同时,Perplexity推出端侧AI智能体,明基发布专业显示器,Google推出语音转文本模型及视频生成模型,英伟达发布定制高带宽内存,微软Xbox推出光盘数字化功能。
阿里云下调Qwen3.8-Flash调用价格,输入降至0.8元/百万,输出降至2.7元/百万,调整后比智谱GLM-5.3-Flash原价便宜0.1元,但智谱当前限时5折,价格仍具优势。阿里云调价对标智谱原价,两周后或显优势。
智谱开源发布GLM-5.3-Flash模型,采用MoE架构,总参数320B但激活仅18B,提升响应速度并降低成本。该模型在编程和智能体能力上接近Claude Opus 4.8,支持1M上下文,引入混合注意力机制。此前以ox-alpha代号在OpenRouter测试,现以MIT许可证开放下载。
智谱发布GLM-5.3-Flash模型,价格低廉,支持多模态理解,并发率提升至50,速度快,性能可与Opus媲美。相比之下,DeepSeek涨价后优势减弱,作者对其兴趣下降。
智谱发布开源模型GLM-5.3-Flash,匿名测试版Ox Alpha性能宣称追平Claude Opus 4.8,价格仅四十分之一,并跑在10万张国产芯片上。但实际使用中性能参差,价格含促销折扣,芯片效率“相当”而非超越,API条款严苛。开发者评价分化,建议用户实测、算清成本、关注生态。
智谱发布并开源GLM-5.3 Flash模型,即此前海外爆火的神秘模型“牛来”。该模型为320B参数、原生多模态,能力超越更大体量模型,在AA榜单获57分,价格仅为Claude Opus 4.8的1/40。实测中能精准配字幕、制作电影解说和还原设计稿。其采用混合注意力架构,运行于国产芯片,支持1M上下文,并已全面开源。
Z.ai的GLM-5.3-Flash模型(即Ox-alpha)以超低推理成本和高性能引发关注,性能接近Claude Opus 4.8和GPT-5.6 Terra,尤其在AI代理任务中表现优异。该模型支持多模态输入,基于中国AI芯片优化,推理成本远低于竞争对手,凸显中国开源模型在性能与成本上的竞争力。
Z.ai的GLM-5.3 Flash模型已上线AI Gateway,支持文本和视觉输入,拥有100万token上下文窗口,并支持函数调用、结构化输出和流式传输。用户可通过设置模型为zai/glm-5.3-flash来使用,支持图片URL或Base64数据。AI Gateway提供统一API、使用追踪、成本管理、重试和故障转移等功能,且不收取平台费用。
匿名模型“Ox Alpha”(牛来大模型)现身OpenRouter,因技术特征引发身份猜测。网友通过Tokenizer、视频编码和API错误信息比对,认为其可能来自智谱(GLM系列),或谷歌Gemini。该模型支持百万级上下文和多模态输入,在代码任务中表现亮眼,但评测结果分歧大。目前身份未定,社区持续追踪。
GLM-5.3在AI评委的创意写作测试中获全球第二,但人类投票榜未进前十,引发争议。测试由7个LLM评委按16维度打分,GLM-5.3因学会制造冲突而提升,但文笔被指退步。文章质疑AI评AI的可靠性,并指出其编程和安全能力提升显著,但“好故事”标准因AI介入而模糊。
TensorSharp 纯 .NET 推理引擎于8月19日支持GLM-5.2,在3×RTX PRO 6000上长prompt prefill比llama.cpp快约1.5倍,decode快4%。GLM-5.3同基座、后训练提升,预计8月28日开源,现有支持可无缝承接。此进展将前沿模型私有化部署降至工作站级别,.NET推理栈成可用选项。
完成下面两步后,将自动完成登录并继续当前操作。