GLM 5.3 Flash与DeepSeek V4 Flash在Hermes Agent实测对比:GLM跑分高但落地差,工具调用不稳、不守Agents.md规则;DeepSeek虽参数少、跑分低,但干活稳,被社区推荐为默认模型。文章指出评测与实战脱节,Agent场景更需“听话”模型,便宜非关键,能干活才是王道。
物理AI模型评测显示,Claude Fable以0.889分居首但成本最高;GPT Sol性价比优但方向易错。换模型仅影响排名,换工具决定物理正确性,专用工具比普通助手分数高0.366分。选模型需权衡预算与责任,工具选对是关键。
本文评测了7个模型在Apache SeaTunnel AI CLI中的ETL任务表现,采用L1静态验证、L2 CLI校验和L3真实执行三层框架。结果显示,静态通过率不能预测真实执行成功率:GPT-5.6 Terra静态最高(93%)但执行仅74%,Claude Opus 4.8执行最佳(85%)。建议根据任务复杂度、修复预算和成本选择模型,并加强connector知识注入和规则覆盖。
澳鹏数据连续八届参加世界人工智能大会,本届展示六大核心能力,包括模型评测、具身智能数据支撑和平台升级。推出Elite评测及难例数据集,覆盖多领域;RoboGo平台提供全栈式数据方案,支持多种采集方式。同时发布AI原生标注平台和专家难题工具,国内外平台协同支持全球业务。
WBench是一个评测基准,专注于交互式视频世界模型,旨在提高模型在动作、反馈和场景变化中的稳定性。通过多轮交互评测,WBench帮助开发者识别模型弱点,推动AI系统的可靠性工程。开源的WBench促进团队间的比较与协作,强调在产品上线前建立评测闭环,以确保系统的稳定性和可操作性。
上海AI实验室发布新基准RISEBench,评测图像编辑模型的理解能力。GPT-4o-Image仅完成28.9%的任务,开源模型BAGEL仅5.8%。新基准考察时间、因果、空间和逻辑推理,显示当前模型在复杂指令理解上存在显著不足。
腾讯AI Lab与中科大发布了一份关于类SORA视频生成模型的评测报告,评估了13个主流模型的能力。报告指出视频生成在画质、动作自然度和视觉-语言对齐方面的进步,并通过多维度测试生成了8000多个视频案例。研究展示了模型在不同应用场景中的表现,鼓励社区深入研究。报告认为视频生成领域正快速发展,未来将有更多创新。
完成下面两步后,将自动完成登录并继续当前操作。