Jev估值100亿美元!创始人Diogo Almeida回答一切

Jev估值100亿美元!创始人Diogo Almeida回答一切

💡 原文中文,约13300字,阅读约需32分钟。
📝

内容提要

TypeSafe AI CEO Diogo Almeida批评公开基准易被操纵,主张以真实工作流评估模型。其公司推出决策模型Jev,日处理量破万亿token,强调可靠性、可编程与低成本,反对盲目预训练和传统安全对齐,认为AI应退居幕后,拉动全要素生产率增长。

🔎

延伸解读

可靠性优先:被忽视的AI落地瓶颈

Diogo Almeida在访谈中反复强调,当前行业过度关注速度和成本,却牺牲了可靠性。他认为可靠性是产品信任的基石,包括输出稳定、符合预期以及服务可用性。Jev的设计目标就是让开发者无需反复试错,就能确信模型能可靠完成任务。这提醒我们,在追求AI性能的同时,不应忽视其在真实工作流中的稳定表现。

反对公开基准:真实工作流才是试金石

Diogo批评公开基准易被操纵,即使无心作弊也会导致模型被动拟合数据集。他主张将模型放入用户自己的工作流中评估,才能判断其在实际重要流程中的表现。TypeSafe甚至融资阶段就坚持不提供基准,尽管可能影响投资。这提示开发者,选择模型时应更关注自身业务场景的实测效果,而非盲目相信榜单分数。

System-One与可编程AI:让AI退居幕后

Jev被定义为机器原生、可编程的System-One模型,专为代码调用设计,输出直接交给程序处理。Diogo认为,未来绝大多数AI调用将来自代码而非人类聊天,AI应像数据库一样嵌入软件底层,默默提供辅助。这种思路强调AI作为基础设施的可靠性和可组合性,而非追求拟人化交互,可能为AI在业务自动化中的大规模应用开辟新路径。

数据策略与RLCD:瞄准未来通用性

TypeSafe自称为数据实验室,采用RLCD(程序闭环验证强化学习)训练模型,刻意不使用用户数据以避免过拟合当下。Diogo指出,用户提问服从幂律分布,用真实数据训练会损害模型通用能力。他们更注重修复模型毛刺,优先处理通用场景。这反映了对模型长期适应性的考量,也解释了为何Jev在多跳推理上会随步数增加而性能下降。

❓

Q&A

Jev是什么?它和ChatGPT这类聊天模型有什么本质区别?

Jev是TypeSafe AI推出的System-One模型,核心定义是“机器原生、大型可编程模型”。它不做文本补全或陪人聊天,而是给代码用的,输出结果直接交给程序读取和处理,目标是嵌入软件系统,成为可编程的决策内核。

Diogo Almeida为什么反对公开benchmark?

他认为公开benchmark极其容易被操纵,即便开发者没有主动作弊,也可能被榜单牵着走。建立信任应该把模型放进自己的工作流,针对那个工作流去评估和测量,才能判断它在真正重要的流程中表现如何。

Jev目前取得了哪些实际成绩?

Jev发布视频6天浏览量突破3870万;在第三方JevBench v1.2.1综合榜中,Jev 1.13.0以75.3分排名第一;日处理量已突破一万亿token,且夜间流量持续走高,说明大量调用来自机器自动化。

Diogo Almeida为什么反对传统的安全对齐?

他不反对安全本身,但认为传统安全对齐与开发者实际需求不匹配。如果模型作为后台依赖,随机拒绝就是一个严重Bug,业务软件不能因为一条奇怪输入就崩溃。开发者需要的是Capability Alignment,让模型按工程师意图完成任务,输出可预测。

Diogo Almeida对预训练大模型持什么态度?

他明确表示,就算给十亿美元也不会从零开始预训练大模型,因为预训练实在太烧钱。他认为AI工程师可以把现成能力拿来裁剪、拼接,做组合式创新,不必什么都从零训起,照样能解决现实问题。

Jev的三大技术支柱是什么?

Diogo Almeida提到Jev追求可靠、可编程、可组合和低成本,其中三大技术支柱是可靠性、可编程性和低成本。所有新增能力都必须服务于这三大支柱,不漫无目的地堆砌功能。

Diogo Almeida认为AI行业当前最大的问题是什么?

他认为整个行业都在卷速度和成本,反而把可靠性弄丢了,而可靠性才是产品真正的灵魂。同时,AI明明能力很强,但实际落地使用率极低,这是对技术潜力的巨大浪费。

Diogo Almeida提出的TFP目标是什么?

他提出五年内拉动TFP(全要素生产率)增长3%,认为这才是衡量AI经济革命真正的标尺。他从未见过哪家实验室把TFP当成目标,并指出目前几乎所有模型真正创造的商业价值还接近于零。

🏷️

标签

➡️

继续阅读