商汤科技发布SenseNova-U1.5-8B-MoT统一多模态模型,支持图像生成、编辑与理解,提升4K画质和文字渲染。HyperAI官网更新数据集、教程及百科词条,涵盖语音、地震数据及多模态模型部署,并预告9月截稿顶会。
Ling 3.0 Flash Sante是inclusionAI推出的医疗健康专用模型,现已在AI Gateway上线,10月4日前免费使用。该模型为混合专家架构,总参数124B,活跃参数5.1B,支持256K上下文和函数调用,擅长医学推理、专业医疗任务及多步骤医疗流程。用户可通过标准或免费模型ID使用,免费期后标准版开始计费,免费版停止服务。
Google发布Gemini 3.8系列,提升软件工程与多步推理能力,支持多模态输入,API定价优惠至年底。理想汽车推出新一代MEGA,售价50.98万元,配备先进智驾与舒适座舱。World Labs发布多模态世界模型Atlas,实现像素级相机控制与3D重建。阿里千问升级Qwen3.8-Max,编程性能夺冠。艺卓发布OLED显示器,Firefox新增广告拦截,雷蛇推出折叠手柄。
Google发布Gemini 3.8 Flash,六周内第三款Flash模型,主打长程软件工程和Agent任务,跑分接近Claude Opus 5,但实测细节粗糙,能力依赖推理超频。Google因3.5 Pro失败转向快速迭代策略,放弃前沿竞争,以低成本模型服务十亿用户,但Flash在真实任务中仍与旗舰模型有差距。
谷歌发布Gemini 3.8 Flash,六周内迭代三版,DeepSWE跑分73.7%超Claude Opus 5,但Terminal-Bench 4.0仅19.1%,显示基准测试可能被刷。定价低但成本高,Cyber版仅限政府等“可信防御者”。谷歌以快速迭代和低价抢市场,但知识截止混乱,普通用户难用上新版。
谷歌发布Gemini 3.8 Flash模型,强调通过更多推理步骤提升复杂任务性能,但可能增加令牌消耗和成本。该模型在软件工程和自主AI代理基准测试中表现优异,超越前代及竞品。同时推出面向政府及可信伙伴的3.8 Flash Cyber版本及Fairwind计划,用于网络安全防护。
谷歌发布Gemini Flash 3.8及Cyber模型,性能显著提升,尤其在编程和智能体任务上,价格优惠至2026年底。Cyber版专供网络安全防御者,通过Fairwind项目向650家伙伴开放。模型在多个基准上超越竞品,但成本较高,且仍落后于Anthropic旗舰模型。谷歌计划持续快速迭代Flash系列。
谷歌发布Gemini 3.8 Flash及3.8 Flash Cyber模型,提升推理与编码能力,价格与3.7 Flash相同。Flash版擅长软件工程和智能体任务,Cyber版专攻漏洞检测与自动修复,已在谷歌内部应用,如Chrome安全团队效率提升2.6倍。模型注重安全防护,Cyber版仅限可信防御者使用。
谷歌发布Gemini 3.8系列,包含Flash和Cyber两个版本,重点提升推理与编码能力,性能增强且价格与3.7 Flash持平。Flash在软件工程和代理任务上表现优异,Cyber专攻网络安全,具备突出的漏洞发现与自动修补能力,已用于保护谷歌代码,并通过Fairwind项目向可信防御者开放。
GLM 5.3 Flash与DeepSeek V4 Flash在Hermes Agent实测对比:GLM跑分高但落地差,工具调用不稳、不守Agents.md规则;DeepSeek虽参数少、跑分低,但干活稳,被社区推荐为默认模型。文章指出评测与实战脱节,Agent场景更需“听话”模型,便宜非关键,能干活才是王道。
Google的Gemini 3.8 Flash模型已在AI Gateway上线,年底前享五折优惠。该模型支持1M token上下文,可处理文本、图像、PDF和视频,输出文本,支持工具调用和网络搜索,最大输出65,536 tokens。它在软件工程、代理工作和多步推理上优于前代,速度成本不变,默认开启思考功能。用户可通过AI SDK等工具使用。
GLM-5.3-Flash是Z.AI推出的低成本模型,价格约为旗舰版GLM-5.3的1/16。测试显示两者在编码、逻辑和提取任务中均得满分,准确性无差异,但Flash在困难任务中消耗更多token和时间,其成本优势依赖当前定价,可能变化。建议Flash适合简单任务,复杂任务需权衡时间与成本。
阿里通义千问发布Qwen3.8-Flash-Next,作为Qwen4架构预览,采用多模态MoE设计,通过混合注意力、门控残差和N-gram嵌入提升效率,主模型125B参数,激活仅6B,训练成本降至1/9,支持262K上下文,可扩展至百万Token,并已上线HyperAI教程供一键部署体验。
Google Antigravity 推出Teamwork框架更新,结合Gemini 3.5 Flash实现多智能体协作,解决复杂长期挑战。在数学和理论计算机科学领域,解决了七个开放问题,包括Knuth猜想等;在系统工程中,从零构建了精确的RISC-V CPU模拟器;在开源软件中,优化了Eigen和ParlayHash等核心库性能。
DeepSeek发布V4 Flash Vision Exp,支持图像输入,价格低于Gemini 3.7 Flash。测试显示两者在图表、发票和日志分析中准确率相当,均能识别陷阱。DeepSeek成本约为Gemini三分之一,但速度慢一倍多,且高峰期价格翻倍。建议批量处理选DeepSeek,实时任务用Gemini。
单台懒猫AI算力舱优化Qwen 3.8 Flash Next,Decode达100-102 TPS,Prefill 2070-2609 TPS,TTFT 5K 1.9s。通过YaRN技术将KV Cache调至16GB,上下文从265K扩展至320K,性能几乎不变,Edit Decode反升。72小时调优后,将部署图形化程序供用户使用。相比两台DGX GB10,算力舱因FP4算力翻倍、显存直连更快,单台即可实现100+ TPS。
Qwen 3.8 Flash Next经优化后,单台算力舱解码速度从23 TPS提升至102 TPS,创世界纪录。18K预填充达2588 TPS,30K首字延迟11.43秒。其T5000芯片FP4算力2070T,远超DGX G10的1000T,单台性能相当于两台DGX G10组合,性价比极高。
TensorSharp 是纯 .NET LLM 推理引擎,三天内接入 GLM-5.3-Flash 和 Qwen3.8-Flash-Next 新架构。它支持进程内推理,性能上 decode 速度翻倍,prefill 持平,并强调正确性验证和部署便捷性。对 .NET 团队,这标志着前沿模型架构跟进加速,值得纳入 PoC 评估。
阿里巴巴发布Qwen3.8-Flash,一款1250亿参数的开源多模态MoE模型,作为Qwen4的架构预览。该模型在编码和办公任务上性能优越,训练资源仅需同类模型的九分之一,成本更低。它支持26万token上下文,可扩展至百万,并已在Hugging Face和ModelScope开放。开发者反应不一,有人称赞其能在消费级硬件运行,也有人认为本地模型尚不足以替代远程服务。
智谱GLM-5.3-Flash的token套餐性价比低,缓存命中率仅8成,实际用量远低于宣传。对比opencode go的15美元额度,智谱lite月费118元仅约4.3亿token,pro约25亿,max约60亿,相当于70元买538元pro套餐,性价比差。目前经济实惠的tokenplan仅gpt、opencode、commandcode可选,作者怀念DeepSeek涨价前的低价,现靠Muse Spark维持。
完成下面两步后,将自动完成登录并继续当前操作。