BriefGPT - AI 论文速递 ·

EVE: 基于掩码预测和模态感知的高效视觉 - 语言预训练

💡 原文中文，约300字，阅读约需1分钟。

📝

内容提要

本文介绍了一种高效的视觉-语言基础模型EVE，通过统一的预训练任务，在共享的Transformer网络中编码了视觉和语言，并利用稀疏的Mixture-of-Experts模块捕捉模态特定信息。EVE通过遮蔽信号建模实现了图像像素和文本标记的信号重构，从而实现了快速训练和更好的下游性能。

🎯

关键要点

介绍了一种高效的视觉-语言基础模型EVE。
EVE通过统一的预训练任务编码视觉和语言。
使用共享的Transformer网络。
利用稀疏的Mixture-of-Experts模块捕捉模态特定信息。
通过遮蔽信号建模实现图像像素和文本标记的信号重构。
EVE实现了快速训练和更好的下游性能。

🏷️

继续阅读

ResULIC：语义残差编码与压缩感知扩散的超低码率图像压缩 | ICML 2025
图像压缩的核心目标是在尽可能低的码率下保留尽可能高的视觉质量。近年来，学习式图像压缩方法在客观指标和主观感知质量上取得了显著进展，但在极低码率场景下仍面临...
法院批准A社与作者和出版社的15亿美元和解协议初步解决A社使用盗版图书训练模型问题
#人工智能法院批准 A 社与作者和出版社的 15 亿美元和解协议，初步解决 A 社使用盗版书籍训练模型的集体诉讼案件。法庭文件显示，A 社建立拥有 70...
RoboTTT——面向机器人策略的上下文扩展：将TTT集成至VLA中以推理时建立记忆信息，从而将视觉-运动上下文扩展到 8K 个时间步
摘要：本文提出RoboTTT方法，通过将测试时训练（TTT）机制整合到机器人基础模型中，实现了8K时间步的长视觉-运动上下文建模。该方法采用快速权重机制，...
维特根斯坦语言游戏：彻底击碎本质主义思维陷阱
语言游戏揭穿本质主义骗局，你还在找事物的唯一答案吗？你还在追问本质吗？维特根斯坦的哲学颠覆了传统本质主义，他通过语言游戏和家族相似性概念指出，事物没有固...
AI 成本战的隐性成本与降本五层：从"成功率悖论"到"系统复杂度"（中） - 张善友
今天很多 AI 降本，表面上看是在压 token，本质上是在压复杂度
10 Newsletters Keeping You Ahead in AI
Cut through AI noise with 10 curated newsletters covering daily news, technic...

内容提要

关键要点

标签

继续阅读