刚刚!Ilya首个模型曝光了

刚刚!Ilya首个模型曝光了

💡 原文中文,约3400字,阅读约需9分钟。
📝

内容提要

SSI正探索基于TTT的小型推理引擎,模型通过专门数据学习“如何学习”,并在推理中更新权重,规模虽小但性能强大。爆料称当前版本8月可能发布,下一代规模将扩大10倍。Ilya此前强调持续学习,英伟达投资SSI并提升算力,TTT路线或成其秘密武器,但真实性待确认。

🔎

延伸解读

TTT与现有范式的本质区别

爆料中提到的TTT(测试时训练)与当前流行的Agent Harness、Context Engineering有本质不同。后者通过外部上下文搭建脚手架,让模型看到更多信息、调用更多工具,但模型本身并未改变。TTT则让模型在解决问题时直接更新自身权重,将上下文视为学习材料,而非临时小抄。这种范式若实现,可能改变AI的学习方式,但尚处探索阶段。

持续学习的安全挑战

模型在部署后能自我更新,也意味着可能学错、学偏甚至遗忘原有能力。2016年微软聊天机器人Tay上线不到24小时便因被诱导输出攻击性内容而下线,虽与TTT技术不同,但暴露了持续学习的安全难题。爆料称Ilya已解决此问题,但缺乏实证。SSI名称中的“Safe”暗示安全是其核心目标,但如何确保模型“知道什么不能学”仍是关键挑战。

英伟达投资与算力提升的暗示

今年7月,英伟达与SSI宣布长期战略合作并投资,提供下一代Vera Rubin系统,算力将增加约10倍。英伟达在公告中称,SSI过去两年一直在推进一条新研究路线,且英伟达接触后决定推动其进入下一阶段。这暗示英伟达对SSI的研究路线有一定认可,但具体内容未披露。算力提升与爆料中“下一代规模扩大10倍”相呼应,但真实性待确认。

Q&A

Ilya Sutskever的创业公司SSI最近被曝在研究什么技术?

根据爆料,SSI正在探索一种基于TTT(测试时训练)的小型推理引擎,该模型通过专门整理的数据学习“如何学习”,并在推理过程中更新部分权重,从而在较小规模下达到较强性能。

什么是测试时训练(TTT)?它与传统训练方式有何不同?

测试时训练(TTT)是一种让模型在推理阶段继续训练的方法,它打破了传统训练和推理的界限。在解决问题时,模型会利用当前数据更新内部状态或参数,从而适应新任务。这与传统方法(如扩展上下文窗口)不同,后者只是让模型看到更多信息,而模型本身并未改变。

Ilya Sutskever对AGI和预训练的看法是什么?

Ilya认为“AGI”和“预训练”这两个词把行业带偏了,因为人并不是生来就掌握所有工作的通用智能,而是依靠持续学习。他设想中的超级智能更像一个极其聪明、求知欲旺盛的15岁少年,能在部署后通过学习编程、医学等技能不断成长。SSI的目标是造一个能够学会任何工作的心智,而不是一台出厂时便无所不知的机器。

英伟达与SSI的合作内容是什么?这对SSI有何影响?

英伟达与SSI宣布长期战略合作,并投资SSI,向其提供下一代Vera Rubin系统,使SSI的算力增加约10倍。据路透社爆料,投资金额高达50亿美元。英伟达还表示,SSI过去两年一直在推进一条新的研究路线,英伟达接触后决定推动其进入下一阶段。这为SSI提供了强大的算力支持,并验证了其研究路线的潜力。

TTT路线面临的主要挑战是什么?

TTT路线面临的主要挑战是安全性。因为模型在部署后能修改自己,就可能学错、学偏,甚至忘掉原有能力。例如,2016年微软的聊天机器人Tay在不到24小时内就被诱导输出攻击性内容,暴露了持续学习的安全风险。因此,如何确保模型在持续学习过程中保持安全,是TTT需要解决的关键问题。

爆料中提到的SSI模型发布时间和规模扩展计划是什么?

据爆料,SSI当前版本已经准备就绪,最快可能在今年8月发布,早期将向少数用户开放。同时,团队正在将下一代版本的规模直接扩展10倍。不过,也有消息称这个月可能不会发布,因此真实性待确认。

为什么Ilya的动向备受关注?

Ilya是OpenAI联合创始人、前首席科学家,也是深度学习领域最有影响力的研究者之一,曾参与AlexNet、Sequence-to-Sequence、AlphaGo和GPT系列等关键工作。他多次在技术路线成为共识之前就提前布局,因此他离开OpenAI后的动向一直是AI圈的焦点。此次爆料涉及他创办的SSI的新技术,自然引发广泛关注。

🏷️

标签

➡️

继续阅读