全球大厂押注AI科研,但缺乏统一评价标准。8月19日,深度原理联合微软、斯坦福等发布论文,提出“发现回合”评估体系,全程记录AI科研决策,综合评分,并重视失败数据价值。深度原理的MIRA平台已实现科研闭环,在基准测试中领先。该标准标志AI科研从“应试”转向“真实发现”,行业下半场比拼“谁能真做出东西”。
本文介绍了主动代理研究环境(Pare),旨在模拟用户以评估主动助手。Pare将应用建模为有限状态机,支持主动用户模拟,并推出了Pare-Bench基准,涵盖143个任务,测试上下文观察和目标推断等能力,为数字助手的发展提供了新的框架和评估标准。
本文讨论了AI应用的优劣,Ryan与Fireworks AI联合创始人Benny Chen探讨了在评估AI时如何平衡定性与定量指标,以及开源评估协议和社区努力如何为AI评估设定标准。Fireworks AI是一个为开发者和企业提供的云平台,旨在运行、定制和扩展开源生成AI模型。
人类最后考试(HLE)是评估现代AI系统推理和知识能力的基准,包含2500多个专家级问题,涵盖多个学科。尽管HLE被认为有用,但专家意见分歧,部分人认为其过于学术化,无法真实反映AI在实际生活中的表现。HLE旨在克服以往测试的局限性,尽管一些问题存在错误。总体来看,HLE被视为识别最佳AI模型的重要工具。
随着人工智能模型能力的提升,需建立技术和治理机构以确保安全和信任。OpenAI参与创立Appia基金会,旨在制定开放的评估标准,促进国际合作,确保AI系统的安全性和合规性,推动AI治理的民主化。
Linux 基金会成立了 Appia 基金会,旨在制定开放的模块化规范,以确保 AI 系统的可信性和合规性。成员包括谷歌、微软和 OpenAI 等行业巨头。Appia 将开发符合国际标准的评估标准,帮助验证 AI 系统的安全性和公正性,填补当前缺乏统一验证机制的空白。
代理人工智能系统在生命科学研究中的能力日益增强,但其有效性依赖于处理复杂研究的能力。现有评估标准未能全面反映这些能力,因此LifeSciBench应运而生。该平台包含750个专家任务,涵盖七个工作流程和生物领域,旨在评估AI系统在实际生命科学研究中的支持能力,任务设计基于生命科学专家的判断,评估AI在处理证据、分析和实验设计等方面的表现。
独立的第三方评估在安全生态系统中至关重要,需针对前沿模型设计验证其能力和安全性。有效评估报告应明确测试目标、提供有效证据,并考虑环境对模型表现的影响。选择合适的评估环境对结果至关重要,评估应避免奖励黑客、拒绝、污染等问题,以确保结果有效性。未来评估标准应详细说明测试内容、预算和有效性检查,以提高透明度和可信度。
元脑企智EPAI平台为企业提供从智能体研发到上线的量化评估标准,支持数据集管理和评测,确保AI应用与业务逻辑的快速迭代。平台采用“模型+提示词”对比模式,帮助企业选择最佳配置,并引入自动化评分体系,生成深度测评报告,提高智能体性能评估效率。
普林斯顿大学的研究探讨了使用大型语言模型(LLM)评估LLM的可靠性。研究发现,尽管整体传递性违规率较低,但有33-67%的文档存在不一致性。论文提出通过分裂共形预测集来量化评估可靠性,并指出评估标准的选择对可靠性影响大于裁判模型,选择相关性强的评估标准可以提升评估质量。
新研究提出“人类最后考试”(HLE),由近1000名专家设计2500道难题,以评估AI的深度理解能力。结果显示,当前AI表现不佳,预计到2025年可达到50%的准确率。HLE重新定义了AI评估标准,强调人类专业知识的独特性。
中国团队在《npj Digital Medicine》上发布了医疗AI评估标准CSEDB,首次引入安全性与有效性双轨评价。未来的MedGPT在全球评测中表现优异,成为医疗AI领域的领先者,推动医疗AI从能力展示转向责任定义。
安全运营中心(SOC)面临巨大压力,传统模式难以维持。AI技术逐渐应用于SOC,88%的企业计划评估AI平台。现代SOC需转变思维,分析师角色转变为系统指导者,以缓解告警疲劳并提升效率。新兴市场的AI-SOC架构需关注自动化、交付方式、集成模式和运行环境的风险与评估标准。
语言模型的幻觉源于训练和评估程序奖励猜测而非承认不确定性。即使训练数据完美,模型仍可能出现错误,评估标准的偏差使幻觉持续存在,统计不确定性和任意事实是预训练错误的关键因素。
Kaggle与Google DeepMind合作推出Kaggle Game Arena,旨在评估AI模型在策略游戏中的表现。该平台提供公平的全对全比赛环境,确保结果的可靠性。初期包括八个领先的AI模型,未来将扩展到多种游戏,以测试战略推理能力,为AI评估设定新标准。
工信部等八部门发布《汽车数据出境安全指引(2025版)(征求意见稿)》,旨在整合法规,明确汽车数据出境的安全要求,规范实施流程,提高合规性和便利性。但仍需完善数据出境安全评估标准和报备要求,以减轻数据处理者的负担。
本文介绍了如何制作一段年终项目视频,内容需涵盖项目问题、合作、技术流程、结果及局限性。视频应结构清晰,时长不超过20分钟,格式为MP4,并附上相关资源链接和总结。评估标准包括吸引力、清晰度、技术问题和结果分析等。
本研究针对日夜雨滴去除的挑战,填补了现有数据集的不足。引入Raindrop Clarity数据集,建立新基准,32个团队在此数据集上取得了先进性能,为雨滴去除任务提供了评估标准和进步方向。
当前的AI安全评估无法有效防止偏见、错误信息和潜在危害。随着大型语言模型(如GPT-4)的能力提升,现有测试显得不足,亟需改进。评估方法缺乏适应性,无法应对不断演变的攻击手段,导致AI可能被滥用。为确保AI安全,需加强评估标准,采用动态和持续的测试方法,并引入多方利益相关者的意见。
OpenAI推出“先锋计划”,旨在推动AI的实际应用。该计划将制定行业特定的评估标准,帮助公司优化模型性能。参与公司将与OpenAI研究团队合作,开发定制模型和评估,以提高AI系统的信任度和效率。首批参与者为专注于高价值应用的初创企业。
完成下面两步后,将自动完成登录并继续当前操作。