小红花·文摘
  • 首页
  • AI Tokens🪙
  • 排行榜🏆
  • 直播
  • FAQ
VINS-120K: 基于大规模4K数据集的超高清图像编辑 | CVPR 2026

该文介绍首个指令式超高分辨率图像编辑数据集VINS-120K,含12万组4K三元组,并配套评测基准VINS-4KEval。提出高频感知后适应策略,通过注意力重缩放和频域监督,将低分辨率模型扩展至4K编辑,显著提升细节保真度,优于现有方法。

VINS-120K: 基于大规模4K数据集的超高清图像编辑 | CVPR 2026

实时互动网 实时互动网 · 2026-08-27T03:09:38Z
CVPR 2026 | PixelDiT:用于图像生成的像素扩散变换器

PixelDiT提出单阶段端到端像素空间扩散Transformer,无需VAE,采用补丁级和像素级双层架构,结合像素级AdaLN与Token压缩,高效建模全局语义和局部纹理。在ImageNet 256×256达1.61 FID,文生图GenEval 0.74,逼近潜空间模型,并避免VAE重建伪影,利于细节保留。

CVPR 2026 | PixelDiT:用于图像生成的像素扩散变换器

实时互动网 实时互动网 · 2026-07-30T07:20:10Z
CVPR 2026|Oxygen XR 团队在原生鱼眼高斯泼溅技术上带来新突破

DirectFisheye-GS框架由京东零售与清华大学联合提出,将鱼眼模型原生嵌入3D高斯泼溅管线,实现鱼眼图像直接无损处理,并引入跨视角联合优化,解决形状畸变和视角不一致问题。实验在多个数据集上达到或超越SOTA,兼容现有工具链,兼顾渲染效率与重建质量,论文已被CVPR 26接收。

CVPR 2026|Oxygen XR 团队在原生鱼眼高斯泼溅技术上带来新突破

实时互动网 实时互动网 · 2026-07-29T03:53:28Z
CVPR 2026|Oxygen XR 团队在原生鱼眼高斯泼溅技术上带来新突破

DirectFisheye-GS框架由Oxygen XR团队与清华大学联合提出,将鱼眼模型原生嵌入3D高斯泼溅管线,实现鱼眼图像直接无损处理,并引入跨视角联合优化,解决高斯形状畸变和视角不一致问题。实验在多个数据集上达到或超越SOTA,兼容现有工具链,兼顾渲染效率与重建质量,论文被CVPR 26接收。

CVPR 2026|Oxygen XR 团队在原生鱼眼高斯泼溅技术上带来新突破

京东科技开发者 京东科技开发者 · 2026-07-29T02:36:21Z
CVPR 2026 | 重思基于扩散模型的视频超分辨率:利用对齐特征的稠密引导 DGAF-VSR

本文介绍了DGAF-VSR,一种基于扩散模型的视频超分辨率方法。该方法通过光流引导变形模块和特征级时序条件模块,显著提升了视频的感知质量、重建保真度和时序一致性。实验结果表明,DGAF-VSR在多个数据集上表现优异,为短视频和直播等应用提供了重要突破。

CVPR 2026 | 重思基于扩散模型的视频超分辨率:利用对齐特征的稠密引导 DGAF-VSR

实时互动网 实时互动网 · 2026-07-10T06:47:32Z
CVPR 2026最热方向,被一家杭州团队率先跑进了端侧!

Om AI发布全球首个端侧流式多模态模型VLX,旨在实现持续感知、精准定位和行动决策。VLX包含三款模型:Flow负责实时感知,Seek进行精确定位,Go实现行动。该系统专为物理世界设计,能够在手机、无人机等设备上高效运行,满足实时响应需求。

CVPR 2026最热方向,被一家杭州团队率先跑进了端侧!

量子位 量子位 · 2026-06-27T12:19:42Z
从ICRA到CVPR,机器人圈最近到底在聊什么?|北京·周三晚

ICRA与CVPR大会刚结束,机器人和具身智能领域的研究者们探讨新方向。量子位与Lumina社区在北京举办沙龙,邀请技术专家分享大会观察与经验,促进交流,欢迎具身智能领域的研究者参与。

从ICRA到CVPR,机器人圈最近到底在聊什么?|北京·周三晚

量子位 量子位 · 2026-06-15T09:37:40Z
CVPR NTIRE 2026|UGC短视频智能修复挑战赛结果出炉!

NTIRE 2026挑战赛专注于UGC短视频的复杂降质修复,面向全球研究者开放。比赛基于KwaiVIR数据集,涵盖合成与真实降质视频,旨在推动生成模型在视频修复中的应用。共95支队伍参赛,最终12支提交有效结果,展示了UGC短视频修复的进展。

CVPR NTIRE 2026|UGC短视频智能修复挑战赛结果出炉!

实时互动网 实时互动网 · 2026-06-09T06:44:23Z
今年CVPR看点是广东:何恺明再获至高大奖,广工大打破大厂名校垄断

CVPR 2026在丹佛举行,收到16092篇投稿,华人研究者表现突出。最佳论文D4RT实现动态场景的高效重建,最佳学生论文ChordEdit由广东工业大学等团队完成,展现了本科生的实力。华人在计算机视觉领域的贡献持续增加。

今年CVPR看点是广东:何恺明再获至高大奖,广工大打破大厂名校垄断

量子位 量子位 · 2026-06-06T07:00:06Z
CVPR 2026,英伟达特斯拉Waymo一块听中国公司讲物理AI

小鹏在CVPR 2026展示了其物理AI技术,首次完整展示世界模型技术图谱。该模型具备主动思考、可控生成和长时序推演能力,结合第二代VLA,提升了自动驾驶的安全性与可控性。小鹏通过密集预测和数据驱动,在自动驾驶领域取得显著进展,成为全球物理AI的领先者。

CVPR 2026,英伟达特斯拉Waymo一块听中国公司讲物理AI

量子位 量子位 · 2026-06-04T11:56:35Z
2026年IEEE/CVF计算机视觉与模式识别会议(CVPR)

苹果将在2026年IEEE/CVF计算机视觉与模式识别会议(CVPR)上展示新研究,会议定于6月3日至7日在丹佛举行。苹果将设立展位,展示实时视觉流助手模型评估和视频生成建模等项目。此外,苹果还将参与2024年神经信息处理系统会议(NeurIPS)和自然语言处理经验方法会议(EMNLP)。

2026年IEEE/CVF计算机视觉与模式识别会议(CVPR)

Apple Machine Learning Research Apple Machine Learning Research · 2026-05-28T00:00:00Z
CVPR 2026 NTIRE:小米影像算法的技术突破

小米在CVPR 2026 NTIRE赛事中获得三项大奖,包括高效超分辨率赛道和人像修复赛道的冠军。其SPANV2算法在推理速度和重建质量上表现出色,显著提升图像处理效率。人像修复采用双阶段框架,确保细节真实自然。反光消除技术通过升级骨干网络和知识蒸馏提升反射抑制能力。小米将继续推动影像算法技术的发展。

CVPR 2026 NTIRE:小米影像算法的技术突破

小米云技术 小米云技术 · 2026-05-18T11:40:31Z
信通院&清华提出FedRE:用「纠缠」搞定联邦学习三难困境 | CVPR 26

联邦学习中,平衡模型性能、数据隐私和通信开销是一大挑战。清华大学等研究团队提出了基于表征纠缠的框架FedRE,能够有效保护隐私并降低通信成本,同时适应模型异构场景。FedRE通过融合不同类别的表征生成纠缠表征,上传至服务器训练全局分类器,从而显著提升模型性能和隐私保护能力。

信通院&清华提出FedRE:用「纠缠」搞定联邦学习三难困境 | CVPR 26

量子位 量子位 · 2026-05-18T06:44:04Z
36.4万超声图文对!中国团队构建首个大规模超声专属数据集,让AI真正读懂临床诊断语义丨CVPR’26

浙大城市学院等团队构建了首个专用超声图像-文本数据集US-365K,解决了超声影像领域的数据缺口和语义模糊问题。提出的Ultrasound-CLIP框架通过结构化推理和双目标优化,提升了超声诊断的准确性和模型的泛化能力,相关成果已开源,为超声AI研究奠定基础。

36.4万超声图文对!中国团队构建首个大规模超声专属数据集,让AI真正读懂临床诊断语义丨CVPR’26

量子位 量子位 · 2026-04-12T07:21:17Z
让大模型多模态检索全面超越SOTA!ReCALL框架化解生成式与判别式的范式冲突|CVPR’26

ReCALL框架通过“诊断-生成-校准”闭环解决了多模态大模型在检索中的范式冲突,提升了细粒度推理能力,显著提高了组合图像检索的性能,标志着大模型向下游任务迁移的新阶段。

让大模型多模态检索全面超越SOTA!ReCALL框架化解生成式与判别式的范式冲突|CVPR’26

量子位 量子位 · 2026-04-06T15:30:59Z
浙大团队破解多模态模型「盲目自信」:先校准置信度,再分配算力丨CVPR’26

浙江大学与阿里巴巴等团队研究发现,多模态大模型在视觉推理中存在“盲目自信”现象,即在图像质量下降时仍保持高置信度。为解决此问题,提出CA-TTS框架,通过置信度校准和资源分配优化推理效果。实验表明,该方法在多个视觉推理基准上显著提升准确率,强调了先感知后推理的重要性。

浙大团队破解多模态模型「盲目自信」:先校准置信度,再分配算力丨CVPR’26

量子位 量子位 · 2026-03-22T07:17:19Z
黑马图像模型被Nano Banana技术负责人点赞!15人华人小队,DDIM之父&CVPR最佳论文作者带队

Luma AI推出的Uni-1模型在图像理解与生成方面表现优异,超越谷歌的Nano Banana Pro和GPT Image 1.5。该模型由不到15人的华人团队开发,具备角色姿态迁移和草稿转漫画等功能,展现出强大的竞争力,预示着视觉AI的未来发展方向。

黑马图像模型被Nano Banana技术负责人点赞!15人华人小队,DDIM之父&CVPR最佳论文作者带队

量子位 量子位 · 2026-03-06T14:39:17Z
CVPR 2026 | 多模态通用的轻量化无损压缩方法

本文介绍了OmniZip,一种轻量化的多模态无损压缩框架,能够高效压缩自然图像、医疗影像和文本等七种模态数据。OmniZip通过统一分词策略和动态路由机制,在保持小参数量的同时显著提升压缩效率,超越传统工具,适用于资源受限的移动设备,实现近实时推理。

CVPR 2026 | 多模态通用的轻量化无损压缩方法

实时互动网 实时互动网 · 2026-03-04T07:26:25Z
12篇成果入选CVPR 2026!百度实现视觉与多模态技术多点突破

百度在CVPR 2026会议上成功入选12篇论文,涉及多模态理解、人脸识别和自动驾驶等领域,展示了其技术实力与创新能力。此次会议吸引了全球顶尖投稿,录用率为25.42%。

12篇成果入选CVPR 2026!百度实现视觉与多模态技术多点突破

百度大脑 百度大脑 · 2026-02-25T11:15:50Z
刚刚,CVPR 2026放榜!朋友圈刷屏

抱歉,提供的文本内容不足以进行总结。请提供更详细的文章内容。

刚刚,CVPR 2026放榜!朋友圈刷屏

机器之心 机器之心 · 2026-02-21T14:03:32Z
  • <<
  • <
  • 1 (current)
  • 2
  • 3
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
友情链接: MOGE.AI 九胧科技 1tok 菜鸟教程 Remio.AI DeekSeek连连 53AI 神龙海外代理IP IPIPGO全球代理IP 东波哥的博客 匡优考试在线考试系统 开源服务指南 蓝莺IM Solo 独立开发者社区 AI酷站导航 极客Fun 我爱水煮鱼 周报生成器 He3.app 简单简历 白鲸出海 T沙龙 职友集 TechParty 蟒周刊 Best AI Music Generator 模力方舟 Gitee AI

小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码