百曜科技发布了全球首个基于LLM-JEPA架构的AI虚拟细胞模型AURA CellOS,覆盖40余种人体组织和260余种细胞类型。该模型在细胞状态预测和扰动响应方面表现优异,显著提升细胞研究效率,可能改变新药研发方式。尽管面临数据稀缺和模型可解释性挑战,AURA CellOS的商业化潜力巨大,未来将成为新药研发的重要基础设施。
本文介绍了一种视觉自监督学习方法——文本条件JEPA(TC-JEPA),该方法通过图像标题减少特征预测的不确定性。TC-JEPA利用细粒度文本调节器,使图像特征更具语义意义,从而提升下游任务的表现和训练稳定性。该方法在视觉理解和推理任务中优于对比学习,展示了新的基于特征预测的视觉-语言预训练范式。
LeCun的LeWorldModel模型在单GPU上快速训练,规划仅需1秒。该模型简化了JEPA架构,使用编码器和预测器实现高效预测,参数仅1500万。实验表明,其在多项任务中表现优异,规划速度比大模型快48倍,并能识别物理异常。
杨乐坤在访谈中批评大语言模型,认为其智能水平不及狗,因缺乏与物理世界的关联。他提出的抽象世界模型(JEPA)强调抽象、分层、预测和最小消耗,以解决AI的局限性。杨乐坤计划创办AMI公司,专注于开源研究,支持自动驾驶和机器人技术。
李飞飞的Marble、Lecun的JEPA和谷歌的Genie 3三种世界模型各具特色。Marble专注于生成可编辑的3D环境,JEPA关注机器人训练的因果结构,而Genie 3则生成可交互的视频环境。这三者在技术路径和应用上存在显著差异,形成了一个世界模型金字塔。
LeCun团队的新论文指出,自监督模型JEPA不仅能提取特征,还能感知数据密度。研究表明,反坍缩机制使JEPA在训练中自动学习数据的常见程度,提出的JEPA-SCORE工具可量化样本的典型性,适用于多种数据集,并验证了其在数据筛选和异常检测中的有效性。
本文介绍了一种新的视频表示学习方法SALT(静态教师不对称潜在训练),通过冻结教师模型提高计算效率。该方法分为两个阶段:首先训练目标编码器进行像素重建,然后训练学生模型预测教师的潜在表示。SALT在多个基准测试中表现优于现有方法,并在计算资源分配上更为优化,显示出学生模型对教师质量的鲁棒性,成为EMA自蒸馏的高效替代方案。
Meta推出V-JEPA 2,这是一种新型视频世界模型,旨在提升机器对物理环境的理解和预测能力。该模型经过两阶段训练,首先自监督预训练超过一百万小时的视频,然后在62小时的机器人数据上微调。V-JEPA 2在机器人操作任务中表现优异,成功率达65%至80%。
本研究提出了seq-JEPA模型,旨在解决自监督算法在视觉表征学习中的局限性,特别是二视图范式下的不变性与不等变性之间的权衡。该模型能够同时学习这两种表示,显著提升图像分类等任务的性能。
本研究针对现有联合嵌入预测架构(JEPA)模型的可解释性不足和效率低下的问题,提出了一种名为稀疏JEPA的新方法。该方法通过引入稀疏表示学习,优化了嵌入表示的质量,并在CIFAR-100数据集上进行验证,显示出在图像分类及低级任务中的高效表现,标志着在表示学习中嵌入稀疏性的重要性。
本研究解决了模仿学习中有效决策政策表示学习的挑战,尤其是在缺乏专家示范的情况下。提出的ACT-JEPA架构将模仿学习与自监督学习相结合,通过预测动作序列和抽象观察序列来提升表示的质量。实验结果表明,该模型在多种决策任务中表现优越,显示了更强的泛化能力和世界模型的鲁棒性。
本研究提出了一种自监督预训练框架AD-L-JEPA,利用激光雷达数据减少自主驾驶系统对标注数据的依赖,显著提升了嵌入质量和标签效率,实验结果优于现有方法。
LeCun在演讲中表示,纯语言模型无法达到人类智能水平,Meta已基本放弃此方向。他认为实现人类级别的AI需要具备推理、规划和理解物理世界的能力,这可能需要数年甚至十年。LeCun强调开源AI的重要性,提出目标驱动的AI架构和联合嵌入预测架构(JEPA)的新方法。
TabTransformer是一种基于自注意力变换器的深度表格数据建模架构,适用于监督和半监督学习,表现优越且具备良好的鲁棒性和可解释性。SubTab框架通过特征子集提升学习效果,I-JEPA框架引入自我监督学习增强图像表示,MTR数据增广方法提高模型性能。此外,研究探讨了生成性AI在表格数据增强中的应用,提升数据质量与多样性。
Appsmith是一个用于构建管理面板、内部工具和仪表板的平台,集成了25个数据库和任何API。Librespot是一个开源的Spotify客户端库,充当Spotify Connect接收器。LLM4Decompile是用于反向工程二进制代码的解编译工具。SoraWebui是一个开源的Sora网页客户端,利用OpenAI的Sora模型创建视频。Jepa是用于自监督学习的V-JEPA模型的PyTorch代码和模型。
介绍了UI-JEPA框架,用于学习未标记数据中的用户界面嵌入和预测用户意图。提出了两个新的UI相关数据集,用于少样本和零样本的UI理解任务。实验证明UI-JEPA在计算成本和延迟方面具有优势,并能达到大型MLLM的预测性能。突出了UI-JEPA的有效性和潜力。
本研究针对生成用户界面(UI)操作序列中用户意图的挑战,提出了一种新框架UI-JEPA,通过掩码策略和自监督学习从未标记数据中学习抽象UI嵌入,并结合经过微调的LLM解码器进行用户意图预测。同时,引入两个全新的UI基础的多模态数据集,提供高效的用户意图理解解决方案。研究表明,与现有的多模态大型语言模型相比,UI-JEPA在计算成本和延迟方面具有显著优势,展示其在轻量级高性能UI理解中的巨大潜力。
本研究提出了CNN-JEPA,一种新颖的自监督学习方法,适用于卷积神经网络。实验结果表明,CNN-JEPA在ImageNet-100上表现优于I-JEPA,训练时间减少17-35%。该方法简化了卷积神经网络的训练过程,同时保持了准确性。
本文探讨了自监督音频表示学习中的联合嵌入预测架构(JEPA),通过对音频频谱图进行上下文和目标分割,训练神经网络进行预测。研究表明,上下文选择对模型质量有显著影响,并提出了多种基于JEPA的框架(如A-JEPA、T-JEPA等),在音频分类和轨迹相似性计算中表现优异,展示了其在不同任务中的有效性和可扩展性。
该研究提出了多种自我监督学习方法,如 I-JEPA、PointJEM 和 A-JEPA,旨在提升图像、音频和脑电信号的表示学习性能。实验结果显示,这些方法在分类和分割任务中表现优异,具备良好的可扩展性和竞争力。特别是,Graph-JEPA 和 MC-JEPA 在图领域和光流估计中也取得了显著成果。
完成下面两步后,将自动完成登录并继续当前操作。