小红花·文摘
  • 首页
  • AI Tokens🪙
  • 排行榜🏆
  • 直播
  • FAQ

本文探讨视觉Transformer(ViT)的核心设计:将图像切分为patch作为token,并分析其代价。关键点包括:patch大小与分辨率决定序列长度,影响注意力机制的二次方计算成本;CNN的归纳偏置在小数据上更优,而ViT需大数据;DeiT通过数据增强和蒸馏提升训练效率;Swin通过窗口注意力降低复杂度。文章还讨论了位置编码失效、层级结构及未来高分辨率挑战。

【Transformer 与注意力机制】45|ViT:patch size 和分辨率如何锁死序列长度,归纳偏置去哪了

土法炼钢兴趣小组的博客 土法炼钢兴趣小组的博客 · 2026-08-06T00:00:00Z
Loop-ViT:让AI学会「反复思考」,3.8M参数小模型追平人类平均水平

抱歉,您提供的文本内容过于简短,无法进行有效的总结。请提供更详细的文章内容。

Loop-ViT:让AI学会「反复思考」,3.8M参数小模型追平人类平均水平

机器之心 机器之心 · 2026-02-12T12:15:07Z

Qwen—Image—Layered模型被认为优于Nano Banana,具备图像分层编辑能力,支持细节修改和透明度处理,适合海报制作。其核心技术为扩散模型,能够将图片拆分为多个可编辑图层,提高图像处理的灵活性和效率。

ViT一作盛赞:这个中国开源“PS模型”强过Nano Banana

量子位 量子位 · 2025-12-29T05:05:54Z
NeurIPS 2025 Spotlight | 香港大学提出无需数据标记的ViT密集表征增强方法

抱歉,文本内容过于简短,无法进行有效总结。请提供更详细的文章内容。

NeurIPS 2025 Spotlight | 香港大学提出无需数据标记的ViT密集表征增强方法

机器之心 机器之心 · 2025-11-19T05:16:26Z

ViT(视觉变换器)通过将图像分割为小块并利用自注意力机制,成为计算机视觉领域的重要模型。尽管缺乏先验知识,但在大数据集上表现优越。Swin Transformer在此基础上进一步改进,适应多尺度特征,提升检测和分割效果。

一文通透ViT:把图片划分成一个个patch块后再做注意力计算,打破CNN在CV领域的统治地位(含Swin Transformer的详解)

结构之法 算法之道 结构之法 算法之道 · 2025-08-22T14:37:43Z

机器之心数据服务现已上线,提供高效稳定的数据获取,简化数据爬取流程。

刚刚,OpenAI苏黎世办公室被Meta一锅端,三名ViT作者被挖走

机器之心 机器之心 · 2025-06-26T05:06:47Z

本研究提出了一种新的八次对称ViT架构,有效提升了计算机视觉模型的性能与效率。实验结果显示,该方法在分类和分割任务中显著提高了性能,同时将ViT-H的计算复杂度降低约40%。

更强的八次对称ViT

BriefGPT - AI 论文速递 BriefGPT - AI 论文速递 · 2025-05-21T00:00:00Z

本文探讨了英伟达的视觉语言模型Eagle 2,强调数据策略在模型开发中的关键作用。作者详细介绍了数据收集、过滤和选择的方法,提出多样化数据可提升模型性能。Eagle 2在多模态基准测试中表现出色,展示了开源视觉语言模型的潜力与发展方向。

多模态LLaVA系列与Eagle 2——从组合CLIP ViT和Vicuna的LLaVA,到英伟达开源的VLM Eagle 2(用于人形VLA GR00T N1中)

结构之法 算法之道 结构之法 算法之道 · 2025-05-05T05:02:24Z

本研究分析了不同深度学习分类器在物联网生态系统中对高维数据的降维效果。结果表明,变分自动编码器(VAE)在准确率等指标上优于视觉转换器(ViT),为物联网安全提供了更有效的僵尸网络检测方法。

潜在空间维度对物联网僵尸网络检测性能的影响:VAE编码器与ViT编码器的比较

BriefGPT - AI 论文速递 BriefGPT - AI 论文速递 · 2025-04-21T00:00:00Z
多模态大模型应用实践(二)- 基于 ViT 和 Pairwise 的智能酒店首图选择

本文介绍了如何利用Amazon SageMaker构建学习排序模型,以智能选择酒店首图。通过对比学习,模型有效排序图片,提升用户体验和转化率。训练数据包括有效首图和非首图,最终实现高准确率和低成本推理,未来将继续优化模型和推荐策略。

多模态大模型应用实践(二)- 基于 ViT 和 Pairwise 的智能酒店首图选择

亚马逊AWS官方博客 亚马逊AWS官方博客 · 2025-02-28T03:30:22Z

谷歌推出了史上最大规模的视觉语言数据集WebLI-100B,包含1000亿图像-文本对,增强了多样性和多语言能力。研究表明,数据规模越大,模型对细节的理解越好,但CLIP模型的过滤可能影响文化多元性。研究团队包括ViT核心作者翟晓华,他将于2024年加入OpenAI。

谷歌全网扒1000亿图像文本对,ViT大佬坐镇:数据Scaling潜力依旧

量子位 量子位 · 2025-02-13T09:13:47Z

本文介绍了Diffusion Transformer(DiT),一种用Transformer架构替代U-Net的神经网络,结合了视觉Transformer和扩散模型的优点。DiT在视频生成中调整模型结构以支持不同分辨率,并引入时间维度以保持一致性。研究者还探讨了类似的U-ViT架构,强调了Transformer在扩散模型中的潜力。

Diffusion Transformer(DiT)——将扩散过程中的U-Net换成ViT:近频繁用于视频生成与机器人动作预测(含清华PAD详解)

结构之法 算法之道 结构之法 算法之道 · 2024-12-28T16:20:05Z

本文探讨了如何使用Hugging Face的transformer库生成图像描述。通过ViT-GPT2模型,输入图像后,模型能够生成相应的文本描述。文章介绍了模型架构、环境设置及推理过程,强调了Hugging Face的灵活性和可用性,用户可以轻松生成图像标题并尝试不同模型以优化效果。

如何使用视觉变换器(ViT)和Hugging Face Transformers 实现图像描述生成

KDnuggets KDnuggets · 2024-12-26T19:10:10Z

DINO是一种自监督学习方法,通过知识蒸馏提升视觉Transformer的特征质量。它动态构建教师网络,利用学生网络输出进行训练,优化图像特征学习。DINO采用多裁剪策略和温度softmax,提升模型性能。

从DINO、Grounding Dino到DINOv2、DINO-X——自监督视觉Transformer的升级改进之路(基于ViT)

结构之法 算法之道 结构之法 算法之道 · 2024-12-21T15:49:35Z

本研究提出了一种名为FCL-ViT的反馈持续学习视觉变换器,旨在解决持续学习中在适应新任务的同时保留旧知识的问题。该方法通过实时动态注意力特征生成,针对当前任务进行调节,表现出优于现有基准的持续学习性能,并且可训练参数较少。

FCL-ViT: Task-Aware Attention Tuning for Continual Learning

BriefGPT - AI 论文速递 BriefGPT - AI 论文速递 · 2024-12-03T00:00:00Z

本研究提出了多种基于Vision Transformer(ViT)的模型优化方法,如NViT、UP-ViTs和Edge-MoE,旨在提高模型准确性、降低计算成本,并实现高效的边缘设备部署。这些方法通过结构裁剪、知识蒸馏和协同推理等技术,显著提升了模型性能和运行速度,适应资源受限的环境。

ED-ViT:针对边缘设备的分布式推理视觉变换器

BriefGPT - AI 论文速递 BriefGPT - AI 论文速递 · 2024-10-15T00:00:00Z

本文介绍了多种视觉变换器(ViTs)的优化方法,如PSViT、AdaViT、EdgeViTs和RepViT,旨在提升推理效率和准确性。研究表明,这些轻量级模型在移动设备上表现优异,RepViT在iPhone 12上实现了超过80%的准确率,延迟接近1毫秒,展示了其在计算机视觉任务中的潜力。

HydraViT:堆叠头部以实现可扩展的ViT

BriefGPT - AI 论文速递 BriefGPT - AI 论文速递 · 2024-09-26T00:00:00Z

DeepSeeNet是一种基于深度学习的系统,能够自动分类年龄相关性黄斑变性(AMD),其分类精度优于人类专家。该系统结合多模态输入和卷积神经网络,优化了AMD的检测和分类,显示出在临床应用中的潜力,尤其是在生物标志物发现和治疗靶点识别方面。

基因信息分析与年龄相关的黄斑变性患者的多模态选择性ViT

BriefGPT - AI 论文速递 BriefGPT - AI 论文速递 · 2024-09-17T00:00:00Z

该文章介绍了一种新的视觉Transformer(ViT)架构,使用超像素非规则标记化策略提取图像特征。该方法在提升归因真实性和零样本无监督密集预测任务中有显著改进。实验结果表明,该方法在分类任务中表现出色,并提供了更丰富的Transformer空间。

SPiT:超像素驱动的非规则ViT标记化,实现更真实的图像理解 | ECCV 2024 - 晓飞的算法工程笔记

晓飞的算法工程笔记 晓飞的算法工程笔记 · 2024-09-12T04:11:00Z

本文介绍了标记补偿器(ToCom)的方法,解决了标记压缩在训练和推理阶段压缩程度不匹配导致的性能下降问题。ToCom通过自蒸馏训练在预训练模型上描述不同压缩程度下模型之间的差距。在推理过程中,ToCom可以直接插入到下游现成模型中,提高模型性能。实验结果表明,ToCom能够有效解耦训练和推理过程中的标记压缩程度,并提高标记压缩性能。

ToCom:一次训练随意使用,华为提出通用的ViT标记压缩器 | ECCV 2024 - 晓飞的算法工程笔记

晓飞的算法工程笔记 晓飞的算法工程笔记 · 2024-09-11T06:59:00Z
  • <<
  • <
  • 1 (current)
  • 2
  • 3
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码