该文介绍首个指令式超高分辨率图像编辑数据集VINS-120K,含12万组4K三元组,并配套评测基准VINS-4KEval。提出高频感知后适应策略,通过注意力重缩放和频域监督,将低分辨率模型扩展至4K编辑,显著提升细节保真度,优于现有方法。
PixelDiT提出单阶段端到端像素空间扩散Transformer,无需VAE,采用补丁级和像素级双层架构,结合像素级AdaLN与Token压缩,高效建模全局语义和局部纹理。在ImageNet 256×256达1.61 FID,文生图GenEval 0.74,逼近潜空间模型,并避免VAE重建伪影,利于细节保留。
DirectFisheye-GS框架由京东零售与清华大学联合提出,将鱼眼模型原生嵌入3D高斯泼溅管线,实现鱼眼图像直接无损处理,并引入跨视角联合优化,解决形状畸变和视角不一致问题。实验在多个数据集上达到或超越SOTA,兼容现有工具链,兼顾渲染效率与重建质量,论文已被CVPR 26接收。
DirectFisheye-GS框架由Oxygen XR团队与清华大学联合提出,将鱼眼模型原生嵌入3D高斯泼溅管线,实现鱼眼图像直接无损处理,并引入跨视角联合优化,解决高斯形状畸变和视角不一致问题。实验在多个数据集上达到或超越SOTA,兼容现有工具链,兼顾渲染效率与重建质量,论文被CVPR 26接收。
本文介绍了DGAF-VSR,一种基于扩散模型的视频超分辨率方法。该方法通过光流引导变形模块和特征级时序条件模块,显著提升了视频的感知质量、重建保真度和时序一致性。实验结果表明,DGAF-VSR在多个数据集上表现优异,为短视频和直播等应用提供了重要突破。
Om AI发布全球首个端侧流式多模态模型VLX,旨在实现持续感知、精准定位和行动决策。VLX包含三款模型:Flow负责实时感知,Seek进行精确定位,Go实现行动。该系统专为物理世界设计,能够在手机、无人机等设备上高效运行,满足实时响应需求。
ICRA与CVPR大会刚结束,机器人和具身智能领域的研究者们探讨新方向。量子位与Lumina社区在北京举办沙龙,邀请技术专家分享大会观察与经验,促进交流,欢迎具身智能领域的研究者参与。
NTIRE 2026挑战赛专注于UGC短视频的复杂降质修复,面向全球研究者开放。比赛基于KwaiVIR数据集,涵盖合成与真实降质视频,旨在推动生成模型在视频修复中的应用。共95支队伍参赛,最终12支提交有效结果,展示了UGC短视频修复的进展。
CVPR 2026在丹佛举行,收到16092篇投稿,华人研究者表现突出。最佳论文D4RT实现动态场景的高效重建,最佳学生论文ChordEdit由广东工业大学等团队完成,展现了本科生的实力。华人在计算机视觉领域的贡献持续增加。
小鹏在CVPR 2026展示了其物理AI技术,首次完整展示世界模型技术图谱。该模型具备主动思考、可控生成和长时序推演能力,结合第二代VLA,提升了自动驾驶的安全性与可控性。小鹏通过密集预测和数据驱动,在自动驾驶领域取得显著进展,成为全球物理AI的领先者。
苹果将在2026年IEEE/CVF计算机视觉与模式识别会议(CVPR)上展示新研究,会议定于6月3日至7日在丹佛举行。苹果将设立展位,展示实时视觉流助手模型评估和视频生成建模等项目。此外,苹果还将参与2024年神经信息处理系统会议(NeurIPS)和自然语言处理经验方法会议(EMNLP)。
小米在CVPR 2026 NTIRE赛事中获得三项大奖,包括高效超分辨率赛道和人像修复赛道的冠军。其SPANV2算法在推理速度和重建质量上表现出色,显著提升图像处理效率。人像修复采用双阶段框架,确保细节真实自然。反光消除技术通过升级骨干网络和知识蒸馏提升反射抑制能力。小米将继续推动影像算法技术的发展。
联邦学习中,平衡模型性能、数据隐私和通信开销是一大挑战。清华大学等研究团队提出了基于表征纠缠的框架FedRE,能够有效保护隐私并降低通信成本,同时适应模型异构场景。FedRE通过融合不同类别的表征生成纠缠表征,上传至服务器训练全局分类器,从而显著提升模型性能和隐私保护能力。
浙大城市学院等团队构建了首个专用超声图像-文本数据集US-365K,解决了超声影像领域的数据缺口和语义模糊问题。提出的Ultrasound-CLIP框架通过结构化推理和双目标优化,提升了超声诊断的准确性和模型的泛化能力,相关成果已开源,为超声AI研究奠定基础。
ReCALL框架通过“诊断-生成-校准”闭环解决了多模态大模型在检索中的范式冲突,提升了细粒度推理能力,显著提高了组合图像检索的性能,标志着大模型向下游任务迁移的新阶段。
浙江大学与阿里巴巴等团队研究发现,多模态大模型在视觉推理中存在“盲目自信”现象,即在图像质量下降时仍保持高置信度。为解决此问题,提出CA-TTS框架,通过置信度校准和资源分配优化推理效果。实验表明,该方法在多个视觉推理基准上显著提升准确率,强调了先感知后推理的重要性。
Luma AI推出的Uni-1模型在图像理解与生成方面表现优异,超越谷歌的Nano Banana Pro和GPT Image 1.5。该模型由不到15人的华人团队开发,具备角色姿态迁移和草稿转漫画等功能,展现出强大的竞争力,预示着视觉AI的未来发展方向。
本文介绍了OmniZip,一种轻量化的多模态无损压缩框架,能够高效压缩自然图像、医疗影像和文本等七种模态数据。OmniZip通过统一分词策略和动态路由机制,在保持小参数量的同时显著提升压缩效率,超越传统工具,适用于资源受限的移动设备,实现近实时推理。
百度在CVPR 2026会议上成功入选12篇论文,涉及多模态理解、人脸识别和自动驾驶等领域,展示了其技术实力与创新能力。此次会议吸引了全球顶尖投稿,录用率为25.42%。
抱歉,提供的文本内容不足以进行总结。请提供更详细的文章内容。
完成下面两步后,将自动完成登录并继续当前操作。