DeepSeek V4 Flash 0731以极低成本在ARC-AGI评测中获高准确率,引发AI应用扩展讨论。文章反驳“编程容易”观点,强调编程需深厚技能。Oracle禁止OpenJDK使用AI代码却自身推广,遭双重标准质疑。Nixpkgs核心团队因治理问题解散。DeepMind WeatherNext提升气旋预测精度。NASA延长旅行者2号运行。美国能源部启动Genesis开放模型计划。苹果App Store审核错误拒绝天文应用。部分x86 CPU存在硬件后门。
深度求索V4闪速版以极低价格提供高推理能力,在ARC-AGI测试中得分高,成本仅为同类模型的几十分之一。其通过键值缓存和混合架构优化,大幅降低使用费用,使AI智力变得像自来水般廉价。这引发行业竞争逻辑转变,从追求最强模型转向追求性价比,可能重塑软件工程范式,并冲击美国AI实验室的商业模式。
中杯o3在ARC-AGI测试中得分57%,成本仅1.5美元/任务,成为OpenAI模型的性价比之王。尽管成绩较之前的o3模型有所下降,但在推理能力和成本优化方面表现优于94%的专业病毒学家。ARC-AGI测试旨在评估AI智力,o3首次挑战即取得佳绩。
OpenAI的新模型o3在ARC-AGI基准测试中表现优异,最低准确率为75.7%,最高可达87.5%。尽管在多个任务上取得进展,但仍有34个任务未能解决,显示出与人类智能的差距,尤其在空间思维能力方面存在局限。
OpenAI展示了O3及其基准,讨论了AGI的定义和ARC-AGI的重要性。ARC-AGI旨在评估AI在新任务中运用先前知识的能力。尽管O3表现优异,但尚未达到AGI标准,未来基准可能带来挑战。文章质疑AGI的实际进展,认为基准测试更像是营销工具,而非真实衡量AI能力的标准。
OpenAI的o3系统在ARC-AGI基准测试中获得85%的分数,显示其适应新情况的能力显著提升。这一进展使AI系统能在更少数据下处理更多任务,提升开发效率和应用范围,但仍需关注其局限性和伦理问题。
o3在ARC-AGI挑战中的表现不佳,主要是因为题目规模过大。英国工程师米哥指出,网格越大,大模型的推理能力越差,尤其在1024个像素时表现明显下降。这表明ARC挑战未能准确反映大模型的真实能力,且大模型的信息处理方式与人类存在差异。
人工通用智能(AGI)是现代科技的重要概念。ARC-AGI基准用于评估AI系统的推理和概括能力,区别于传统基准。尽管OpenAI的o3模型在ARC-AGI上获得87.5%的高分,但这并不意味着AGI的实现。AGI需要更广泛的能力,如情感智能和适应性。公众对AGI的误解主要源于媒体的夸大宣传,强调了清晰沟通的重要性。
OpenAI发布了新推理模型o3和o3-mini。o3在ARC-AGI基准上取得突破,具备博士级问题解决能力;o3-mini则注重高效低成本,适合编程。两者尚未公开,需进行安全测试,预计一月底推出。
本研究提出了一种潜在程序网络(LPN)算法,旨在解决程序合成中的单次训练问题。LPN在ARC-AGI基准测试中表现出色,能够适应未见任务,展现出强大潜力。
文章讨论了通用人工智能(AGI)所需的新思路和基准,强调现有大型语言模型(LLMs)的局限性。ARC-AGI基准旨在抵抗记忆化,要求系统从少量数据中学习新任务。成功的AGI需要灵活的学习架构和可靠性,而不仅仅依赖数据和计算能力的扩展。Knoop和Chollet希望通过开放解决方案促进研究合作,以推动AGI的进步。
完成下面两步后,将自动完成登录并继续当前操作。