Anthropic发布Claude Fable 5.1,宣称在编码和知识工作上有重大进步,基准测试得分翻倍。但作者用四个真实任务测试新旧模型,发现两者准确率均为满分,仅在速度和成本上略有差异。在复杂任务中,旧模型甚至更快更便宜。作者认为,对日常任务升级意义不大,改进可能仅体现在长时研究型任务上。
本文讨论了在生产环境前评估大型语言模型(LLM)的关键经验,重点聚焦于实际应用场景(如秘密扫描)。作者强调需通过真实任务测试模型性能,而非仅依赖基准数据,并指出评估应涵盖准确性、效率及成本效益,以确保模型在部署后能可靠运行。
RoboDojo是一个新的机器人操作评测基准,包含42个仿真任务和18个真实任务,旨在评估机器人在真实世界中的能力。目前最强模型在仿真中的成功率为8.80%,在真实世界中为12.8%,远低于人类专家的表现。RoboDojo揭示了机器人模型在稳定性和泛化能力上的短板,强调通用机器人面临的挑战。
Spider2-V是首个专注于数据科学和工程工作流程的多模态代理基准,包含494个真实任务,评估多模态代理在数据相关任务中的能力。文章还介绍了WebVoyager等多模态模型,展示了它们在实际应用中的成功率和评估方法,强调了多模态代理在自动化数据科学中的潜力与挑战。
完成下面两步后,将自动完成登录并继续当前操作。