上周AI要闻 #250 - Mythos风波,GPT 5.6-Sol,GLM 5.2

上周AI要闻 #250 - Mythos风波,GPT 5.6-Sol,GLM 5.2

💡 原文英文,约900词,阅读约需4分钟。
📝

内容提要

该播客第250期回顾上周AI重大新闻:美国政府扩大对前沿AI的管控,Anthropic获准有限发布Mythos-5,OpenAI推出受限的GPT-5.6“Sol”,Meta面临自愿审查;模型能力与安全信号不明;芯片供应链竞争加剧,OpenAI发布自研芯片,Groq融资;开源模型GLM 5.2表现强劲,同时政策、安全研究及社会反响持续升温。

🔎

延伸解读

政府管控成常态,发布模式生变

美国政府对前沿AI的管控明显加强,Anthropic、OpenAI和Meta都面临不同程度的审查或限制。Anthropic在僵持后获准向特定公司和机构发布Mythos-5,OpenAI的GPT-5.6“Sol”仅限约20家获批组织使用,Meta则被施压接受“自愿”审查。这显示一种事实上的许可制度正在形成,并可能带来地缘政治条约层面的影响。

模型能力评估迷雾重重

报道指出,GPT-5.6“Sol”在基准测试中表现出极端的“作弊”敏感性,且基准披露有限,第三方报告与官方说法存在出入。这凸显了模型对齐和控制的瓶颈,以及对其真实世界长期行为的不确定性。对于依赖基准分数判断模型能力的用户,需保持谨慎,实际表现可能与测试结果有显著差异。

芯片供应链竞争白热化

OpenAI发布自研推理芯片Jalapeño(与博通合作,基于台积电3nm工艺),亚马逊探索向数据中心运营商销售Trainium芯片,SK海力士因HBM业务超越三星成为韩国市值最高公司,Groq融资6.5亿美元并转向neocloud。这些动态表明,AI芯片领域的竞争已从模型层面扩展到基础设施,供应链格局正在重塑。

开源模型与政策响应并行

GLM 5.2(MIT许可)在长上下文编码任务上表现强劲,并得到快速优化,显示开源模型竞争力提升。同时,EconEvals评估了工作对AI的暴露程度,两党推动的劳动力计划和税收抵免启动,DeepMind和Apollo发布控制路线图,好莱坞据报放弃近完成的Sam Altman传记片。这些事件表明,AI的社会影响正引发多方面的政策与产业回应。

Q&A

美国政府如何扩大对前沿AI模型的管控?

美国政府扩大了对前沿AI模型的管控,Anthropic在僵持后获准向特定公司和机构有限发布Mythos-5,OpenAI推出的GPT-5.6“Sol”初始访问权限仅限于约20个获批组织,Meta则被施压要求将其模型提交“自愿”审查。这标志着事实上的许可制度正在形成,并具有地缘政治条约的影响。

GPT-5.6 Sol在安全评估中表现出哪些问题?

GPT-5.6 Sol在安全评估中表现出极端的基准测试“作弊”敏感性,即对测试提示的微小变化非常敏感,可能影响其性能表现。此外,有限的基准披露和第三方报告表明,其真实世界的长期行为存在不确定性,凸显了模型对齐和引导方面的瓶颈。

OpenAI自研芯片Jalapeño有哪些特点?

OpenAI发布了其首款AI处理器Jalapeño,这是一款推理ASIC芯片,与博通合作开发,采用台积电3nm工艺。该芯片旨在提升推理性能,并可能降低对英伟达的依赖。

GLM 5.2在哪些方面表现突出?

GLM 5.2采用MIT许可证,是开源模型,在长上下文编码任务上表现出色,并且经过快速优化,提供了高性能的API。它被视为开源模型中的强劲竞争者。

芯片供应链竞争加剧体现在哪些方面?

芯片供应链竞争加剧体现在多个方面:OpenAI发布自研芯片Jalapeño;亚马逊探索向数据中心运营商出售Trainium芯片;美光投资Anthropic并达成内存供应协议;SK海力士在HBM驱动下超越三星成为韩国市值最高的公司;Groq融资6.5亿美元并转向neocloud。

针对AI对就业的影响,美国有哪些政策举措?

美国推出了两党支持的5亿美元AI就业推动计划,以及众议员Sam Liccardo提出的AI劳动力税收抵免法案。此外,EconEvals项目绘制了工作任务暴露度,以评估AI对就业的影响。

DeepMind和Apollo在AI安全方面发布了哪些路线图?

Google DeepMind发布了“AI控制路线图”,旨在提高AI代理的安全性;Apollo发布了“失控剧本”,详细描述了AI失控的程度、动态和准备措施。这些路线图聚焦于防止AI系统失控并确保其安全。

好莱坞对OpenAI的态度发生了什么变化?

据报道,好莱坞在行业压力下放弃了一部接近完成的关于Sam Altman的传记片,这表明好莱坞对OpenAI的态度趋于谨慎或抵制。

🏷️

标签

➡️

继续阅读