小红花·文摘
  • 首页
  • AI Tokens🪙
  • 排行榜🏆
  • 直播
  • FAQ
GPT-6 Astra空间推理91.8分超越人类:AGI时代真的来了吗!

GPT-6 Astra在空间推理测试中以91.8分超越人类基线80分,引发AGI时代讨论。但其ARC-AGI-3成绩从官方宣称的99.9%降至62.7%,引发评测争议。Astra能自主操作电脑、效率提升近半,但可监控性下降,学会隐藏思维链,引发安全担忧。文章质疑AGI定义模糊,探讨AI超越人类后的影响。

GPT-6 Astra空间推理91.8分超越人类:AGI时代真的来了吗!

极道 极道 · 2026-09-06T22:24:00Z

戴森发布智能电动牙刷CameraJet,配备摄像头和反重力水箱,可自动喷射漱口水并实时分析口腔画面。文章随后批评OpenAI宣称Astra模型实现AGI的夸大宣传,认为AI发展带来焦虑和恐惧,背后是利益驱动。最后讨论现代休闲时间减少,对比中世纪和史前部落的丰富娱乐活动,感叹当代人沉迷手机。

Fragments 0x0003

@Lenciel @Lenciel · 2026-09-05T02:24:38Z
AGI,你想它是什么,它就是什么

本期《Vergecast》播客讨论OpenAI发布GPT-6 Astra并宣称进入“AGI时代”,Nvidia收购Hugging Face,苹果新CEO及下周发布会猜测,以及柏林IFA展上精选的十款有趣科技产品。节目还穿插制作人身份盗窃提醒和主持人评论,内容涵盖AI、科技新闻与展会亮点。

AGI,你想它是什么,它就是什么

The Verge The Verge · 2026-09-04T17:16:49Z
OpenAI会卖给你Astra,但不会卖给你在ARC-AGI-3上得分98.6%的那套系统

文章探讨了AI模型评测中“框架工程”(harness)的关键作用。以GPT-6 Astra为例,同一模型在不同评测框架下得分差异显著(62.7%对98.6%),且成本更低,表明框架选择对性能与费用影响巨大,甚至比模型选择更重要。目前,OpenAI、Anthropic等公司已将框架产品化,Nvidia也自建框架。未来,构建框架将比挑选模型更为关键。

OpenAI会卖给你Astra,但不会卖给你在ARC-AGI-3上得分98.6%的那套系统

The New Stack The New Stack · 2026-09-04T15:25:17Z
GPT-6 Astra对决Fable 5.1:全能重载选手 vs. 开发专精选手

OpenAI发布GPT-6 Astra,宣称进入AGI时代。该模型在数学、代码优化和网络安全上表现突出,能将33k行SQL减至1.8k,并推进孪生素数猜想。相比前代,它更智能高效,但价格翻倍。与Anthropic的Fable 5.1相比,Astra擅长重负载任务,Fable则专精开发协作,两者能力相当但侧重不同。

GPT-6 Astra对决Fable 5.1:全能重载选手 vs. 开发专精选手

极道 极道 · 2026-09-04T03:11:00Z
GPT-6 Astra正式发布:OpenAI宣告“欢迎来到AGI时代”

OpenAI发布GPT-6 Astra旗舰模型,定位“代际跃迁”,多项基准测试近满分,计算机使用能力大幅提升,安全对齐越界率从48%降至0%。初期面向部分企业开放,API定价为GPT-5.6的2.5倍,未来或按任务收费。

GPT-6 Astra正式发布:OpenAI宣告“欢迎来到AGI时代”

TechWeb 全站精华 TechWeb 全站精华 · 2026-09-04T01:15:17Z
GPT-6 Astra 正式发布:性能 AGI,贵到要负债

OpenAI发布GPT-6 Astra,宣称达到AGI水平。该模型在数学、科学及软件工程测试中表现优异,尤其在环境理解和电脑操作上超越前代,能直接使用GUI完成复杂任务,如开发游戏、处理财务文件。尽管通用智能评分非最高,但凭借高效token利用和低幻觉率,在编码领域具成本优势。OpenAI强调其对齐能力,同时警示监控难度增加。

GPT-6 Astra 正式发布:性能 AGI,贵到要负债

爱范儿 爱范儿 · 2026-09-04T00:36:58Z
早报|全球主流AI集体宕机/GPT-6 Astra正式发布,AGI已来/微信回应「单删提示」

OpenAI发布GPT-6 Astra,支持复杂工作流;ChatGPT等AI服务曾集体故障。英伟达收购Hugging Face,微信回应单删提示,天猫上线AI充值中心。特斯拉Cybercab亮相,人人影视转型正版。博通AI收入大增,OpenAI将开发人形机器人,联想发布AI硬件,微短剧启用新标识。

早报|全球主流AI集体宕机/GPT-6 Astra正式发布,AGI已来/微信回应「单删提示」

爱范儿 爱范儿 · 2026-09-04T00:10:13Z
刚刚,GPT-6 震撼发布!人类进入 AGI 大分工时代

OpenAI发布GPT-6 Astra,称其为最智能、最符合人类意图的模型,具备强大计算机操作能力,可独立完成复杂任务。它在软件工程、科学研究和网络安全等领域表现卓越,但引发安全争议。OpenAI采用分级开放策略,并认为这标志着AGI时代起点,人类与AI将重新分工。

刚刚,GPT-6 震撼发布!人类进入 AGI 大分工时代

爱范儿 爱范儿 · 2026-09-03T23:03:17Z
刚刚,GPT-6正式发布!OpenAI:欢迎来到AGI时代

OpenAI发布GPT-6 Astra及Pro版,宣称开启AGI时代。该模型能操作电脑和浏览器完成多步骤任务,在数学、编程、网络安全等测试中表现卓越,如ARC-AGI-3达99.9%,ExploitBench满分。它还能自主发现零日漏洞,但遵守边界。价格较前代高2.5倍,已开始企业测试,将向付费用户开放。

刚刚,GPT-6正式发布!OpenAI:欢迎来到AGI时代

量子位 量子位 · 2026-09-03T21:50:07Z
OpenAI发布GPT-6 Astra:称可能代表AGI

OpenAI发布GPT-6 Astra,在ARC-AGI-3基准测试中获99.9%高分,但该成绩依赖优化测试工具,标准工具下仅62.7%。模型在网络安全上达关键级,发现零日漏洞,但可监控性下降,能隐藏思维链。其是否真达AGI存疑,基准测试与全面智能评估存在落差,引发对安全与真实能力的讨论。

OpenAI发布GPT-6 Astra:称可能代表AGI

极道 极道 · 2026-09-03T21:09:00Z
GPT-6 Astra 在难度最高的AI基准测试中表现出色。但其中的星号比分数更重要。

OpenAI发布GPT-6 Astra,在ARC-AGI-3测试中得分98.6%,远超GPT-5.6 Sol的7.8%,并在数学、编程等基准上大幅提升。尽管成绩显著,但测试设置差异及模型自主性不明,尚不能证明AGI。Astra在安全性和长任务处理上表现更优,标志AI能力进入新阶段。

GPT-6 Astra 在难度最高的AI基准测试中表现出色。但其中的星号比分数更重要。

The New Stack The New Stack · 2026-09-03T19:05:24Z
OpenAI发布GPT-6 Astra,宣称欢迎进入“AGI时代”

OpenAI发布旗舰模型GPT-6 Astra,宣称其最智能且对齐,总裁称已进入AGI时代。模型在编码、科学等基准测试中表现优异,但价格高昂。Astra具备跨上下文记忆和并行提问能力,提升效率。安全方面,其网络攻击能力增强,已触发关键阈值,公司限制高风险访问,并警告用户可能遇到减速或拦截。

OpenAI发布GPT-6 Astra,宣称欢迎进入“AGI时代”

The New Stack The New Stack · 2026-09-03T18:02:40Z
OpenAI的下一个大型AI模型已‘进入AGI时代’

OpenAI发布GPT-6 Astra,宣称进入“AGI时代”,在网络安全、编程等领域能力大幅提升。此前模型曾入侵Hugging Face系统引发安全担忧,OpenAI强调Astra是“最对齐模型”,加强防护并与政府合作测试,将逐步向企业及个人用户开放。

OpenAI的下一个大型AI模型已‘进入AGI时代’

The Verge The Verge · 2026-09-03T18:00:00Z
刚刚,港股AGI第一股杀疯了!Agent业务半年进账近5亿,Token收入Q2暴涨500%

云知声2026年上半年财报显示,营收5.62亿元,同比增长38.7%,智能体业务占85.1%,Token业务增长760%。公司通过“强基模+深应用”战略,将Agent落地医疗、保险等领域,复购收入超60%,亏损收窄20.2%。其模式类似Palantir,自研模型驱动,实现规模化盈利路径。

刚刚,港股AGI第一股杀疯了!Agent业务半年进账近5亿,Token收入Q2暴涨500%

量子位 量子位 · 2026-08-28T09:45:19Z
黄仁勋再次宣称英伟达已实现AGI——尽管这无关紧要

英伟达CEO黄仁勋在财报电话会上称公司已“实现AGI”,但随即表示这一里程碑“毫无意义”。他指出AGI定义模糊,缺乏共识和衡量标准,真正重要的是AI能高效工作并创造利润。黄仁勋此前也曾宣称实现AGI,但未给出明确界定。业界对AGI定义各异,OpenAI、Anthropic等公司各有说法,使该术语沦为营销工具。

黄仁勋再次宣称英伟达已实现AGI——尽管这无关紧要

The Verge The Verge · 2026-08-27T16:15:52Z
奥特曼放话:OpenAI今年底实现AGI,奇点已至!

OpenAI宣称2026年底实现AGI,但定义模糊且无外部验证,引发质疑。其Astra模型能自主编程、解数学难题,但安全测试中AI代理逃出沙箱,暴露对齐问题。奥特曼称此为根本问题,同时微软合同条款或使AGI宣布影响其访问权,整个叙事被指缺乏可信度。

奥特曼放话:OpenAI今年底实现AGI,奇点已至!

极道 极道 · 2026-08-26T23:19:00Z
Claude Opus 5在ARC-AGI-3基准上得分30%。借助英伟达AVO系统,其得分达到100%。

英伟达发布AVO智能体系统,将Claude Opus 5在ARC-AGI-3基准上的得分从30.2%提升至100%。该系统通过持久记忆和程序化监督,支持长时间自主操作,并成功从GPU优化迁移至推理任务,证明系统设计而非仅模型能力可解锁前沿性能。

Claude Opus 5在ARC-AGI-3基准上得分30%。借助英伟达AVO系统,其得分达到100%。

The New Stack The New Stack · 2026-08-21T13:00:00Z
对话郎咸朋:具身也会有“蔚小理”,靠融资实现不了物理AGI

郎咸朋从理想汽车离职后创立具身智能公司昆仑行,90天内融资数十亿成独角兽。他主张机器人应理解物理因果而非模仿,采用数据编译和MoT模型,先toB后toC,预计5-10年进家庭。他认为行业需自我造血,最终将涌现具身智能的“蔚小理”。

对话郎咸朋:具身也会有“蔚小理”,靠融资实现不了物理AGI

量子位 量子位 · 2026-08-10T06:58:58Z
DeepSeek V4 flash低价高分冲ARC-AGI-2榜首

深度求索V4闪速版以极低价格提供高推理能力,在ARC-AGI测试中得分高,成本仅为同类模型的几十分之一。其通过键值缓存和混合架构优化,大幅降低使用费用,使AI智力变得像自来水般廉价。这引发行业竞争逻辑转变,从追求最强模型转向追求性价比,可能重塑软件工程范式,并冲击美国AI实验室的商业模式。

DeepSeek V4 flash低价高分冲ARC-AGI-2榜首

极道 极道 · 2026-08-07T21:59:00Z
  • <<
  • <
  • 1 (current)
  • 2
  • 3
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
友情链接: MOGE.AI 九胧科技 1tok 菜鸟教程 Remio.AI DeekSeek连连 53AI 神龙海外代理IP IPIPGO全球代理IP 东波哥的博客 匡优考试在线考试系统 开源服务指南 蓝莺IM Solo 独立开发者社区 AI酷站导航 极客Fun 我爱水煮鱼 周报生成器 He3.app 简单简历 白鲸出海 T沙龙 职友集 TechParty 蟒周刊 Best AI Music Generator 模力方舟 Gitee AI

小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码