小红花·文摘
  • 首页
  • 广场
  • 排行榜🏆
  • 直播
  • FAQ
Dify.AI
利用人工智能帮助机器理解视觉内容

Coactive公司利用人工智能平台分析视觉数据,帮助企业快速决策。创始人Coleman和Gaviria Rojas指出,未来企业将面临大量非结构化数据,AI将是关键。Coactive已与多家媒体和零售公司合作,提升内容管理效率和人机互动。

利用人工智能帮助机器理解视觉内容

MIT News - Artificial intelligence
MIT News - Artificial intelligence · 2025-06-09T19:45:00Z
人工智能无需人类干预即可学习视觉与声音的关联

麻省理工学院的研究人员开发了一种新型机器学习模型,能够同时处理音频和视觉数据,提升机器人与现实世界的互动能力。该模型通过优化视频帧与音频的对应关系,提高了视频检索和音视频场景分类的准确性,未来有望应用于新闻和电影制作等领域。

人工智能无需人类干预即可学习视觉与声音的关联

MIT News - Artificial intelligence
MIT News - Artificial intelligence · 2025-05-22T04:00:00Z

本研究提出EAGLE方法,旨在解决多模态模型在处理视觉数据时的幻觉问题。通过增强视觉组件能力,EAGLE显著减少了多个基准测试中的幻觉现象,展现出重要的应用潜力。

EAGLE: Enhanced Visual Grounding Minimizes Hallucinations in Instructional Multimodal Models

BriefGPT - AI 论文速递
BriefGPT - AI 论文速递 · 2025-01-06T00:00:00Z

本研究提出了CodeV方法,解决大型语言模型在处理GitHub问题时忽视视觉数据的问题。实验结果表明,CodeV显著提升了问题解决能力,促进了视觉数据的应用。

CodeV:利用视觉数据解决问题

BriefGPT - AI 论文速递
BriefGPT - AI 论文速递 · 2024-12-23T00:00:00Z

本研究提出GaussianProperty框架,结合SAM的分割能力与GPT-4V的识别能力,解决视觉数据中物理属性估计不足的问题,具有重要应用价值。

GaussianProperty: A Low-Rank Markov Model Integrating Physical Properties with 3D Gaussian Distributions

BriefGPT - AI 论文速递
BriefGPT - AI 论文速递 · 2024-12-15T00:00:00Z

本文提出了一种利用视觉数据上下文信息优化深度模型训练的方法。研究引入上下文多样性,提出数据修复算法以减少模型偏差,并建议类基注释应对领域转移。优化数据策略和融入人类反馈可显著提升模型在复杂环境下的表现。

Enhancing Efficient Training of Deep Models by Exploiting Contextual Uncertainty of Visual Data

BriefGPT - AI 论文速递
BriefGPT - AI 论文速递 · 2024-11-04T00:00:00Z

本文介绍了一种结合视觉和文本数据的跨模态检索模型,针对餐品及食谱进行建模,并在Recipe1M数据集上验证了其优越性能。此外,研究提出了逆向烹饪系统和多模态API等新方法,以提升食谱生成和个性化,展示了食品计算领域的广泛应用潜力。

ChefFusion:集成食谱和食品图像生成的多模态基础模型

BriefGPT - AI 论文速递
BriefGPT - AI 论文速递 · 2024-09-18T00:00:00Z

该研究探讨了生成式AI在故事创作中的应用,提出了多智能体框架和新方法,显著提升了故事生成的连贯性与质量。同时,研究分析了视觉数据生成叙事的技术,并介绍了增强用户互动体验的工具ImageTeller。

讲故事的艺术:多智能体生成AI用于动态多模态叙事

BriefGPT - AI 论文速递
BriefGPT - AI 论文速递 · 2024-09-17T00:00:00Z

本文介绍了卷积神经网络(CNN)的基本原理和工作流程,它是一种用于处理和分类视觉数据的人工神经网络。通过卷积层、ReLU激活层、池化层和全连接层等组成,CNN能够逐步提取图像特征并进行分类。滤波器用于检测图像中的特定模式,ReLU层清除不重要的模式并引入非线性,池化层减小特征图尺寸,全连接层进行最终的分类决策。通过这些层的组合,CNN能够以更丰富、更详细的方式处理图像。

卷积神经网络:计算机如何理解图像?

DEV Community
DEV Community · 2024-09-14T11:29:40Z

该研究提出了一种多模态基础模型,结合视觉和文本数据以提升个性化推荐性能。模型通过多种提示策略和用户历史数据,动态捕捉用户偏好,实验验证了其有效性,强调了多模态技术在推荐系统中的重要性。

X-Reflect:用于多模态推荐的交叉反射提示

BriefGPT - AI 论文速递
BriefGPT - AI 论文速递 · 2024-08-27T00:00:00Z

该文章介绍了一种创新的无参考图像质量评估方法,结合视觉和语言数据,通过多模式提示提升鲁棒性和准确性。研究表明,该方法在多个数据集上优于传统模型,尤其在医学成像中表现突出,能够生成文本报告。

CLIP 引导属性感知预训练用于可泛化图像质量评估

BriefGPT - AI 论文速递
BriefGPT - AI 论文速递 · 2024-06-03T00:00:00Z
超越视觉:Living Optics首席执行官王睿谈高光谱成像的普及化

Living Optics的首席执行官Robin Wang在NVIDIA AI播客的一集中讨论了高光谱成像的强大功能。他们的相机可以捕捉96种颜色的视觉数据,揭示隐藏的细节。该初创公司旨在通过更丰富的数据集为各行业的用户赋能。Living Optics是NVIDIA Inception计划的成员。

超越视觉:Living Optics首席执行官王睿谈高光谱成像的普及化

NVIDIA Blog
NVIDIA Blog · 2024-04-17T19:06:52Z

本文探讨了多语言机器翻译模型的进展,强调视觉数据在提升翻译性能中的重要性。研究表明,多模式机器翻译系统在视觉上下文中表现优于纯文本系统,未来数据集的构建需更为细致。多模态数据在翻译和图像描述生成中的有效性得到了验证。

一幅图千言万语,但是否人人听得懂?关于进行图像翻译以便符合文化相关性的研究

BriefGPT - AI 论文速递
BriefGPT - AI 论文速递 · 2024-04-01T00:00:00Z
世界模拟器中的视频生成模型

这篇技术报告介绍了将各种视觉数据转化为统一表示的方法,用于大规模生成模型的训练,并对Sora的能力和限制进行了评估。Sora是一种通用模型,可以生成不同持续时间、宽高比和分辨率的视频和图像。

世界模拟器中的视频生成模型

OpenAI
OpenAI · 2024-02-15T08:00:00Z

该综述回顾了文本生成视觉数据的研究,比较了不同方法,发现论文数量显著增加,提出了研究空白和潜在方向。这是首个系统审视文本到图像生成的综述。

视觉文本与低层次视觉:关于视觉文本处理的综合调查

BriefGPT - AI 论文速递
BriefGPT - AI 论文速递 · 2024-02-05T00:00:00Z

N'UWA是一种多模态预训练模型,用于生成和调节视觉数据,表现出色。它在文本到图像生成、文本到视频生成和视频预测等任务上取得了最先进的结果。此外,N'UWA还展示了在文本引导的图像和视频操作任务上的惊人零成本能力。

StrokeNUWA: 笔画分词用于矢量图形合成

BriefGPT - AI 论文速递
BriefGPT - AI 论文速递 · 2024-01-30T00:00:00Z

通过对深度学习在视觉数据上应用的研究文献的系统回顾,本研究讨论了独居老人安全的两个主要任务:摔倒检测和人体活动识别,以及相关数据集和硬件设备的使用情况,并对现有方法的优势和劣势进行了讨论,提出了未来工作的建议。

基于深度学习的计算机视觉活动识别和老年人跌倒检测:系统性综述

BriefGPT - AI 论文速递
BriefGPT - AI 论文速递 · 2024-01-22T00:00:00Z

该综述回顾了文本生成视觉数据的研究,比较了不同方法,发现论文数量增加,指出研究空白和潜在方向。这是首个从“跨模态生成”视角审视文本到图像生成的综述。

文本到图像跨模态生成:系统综述

BriefGPT - AI 论文速递
BriefGPT - AI 论文速递 · 2024-01-21T00:00:00Z

本文提出了一种弱监督的三维物体检测框架,通过三种视角的视觉数据建立二维和三维领域之间的关联,无需使用三维标签。在KITTI数据集上实验证明,该方法性能与最先进方法相媲美。

多层次视觉引导的弱监督 3D 目标检测

BriefGPT - AI 论文速递
BriefGPT - AI 论文速递 · 2023-12-12T00:00:00Z

该文介绍了一种新型网络架构,能够通过修剪学习到的网络来捕捉数据依赖的不变性。在视觉和表格数据集上,该网络架构的效率和效果都比密集神经网络更好。

通过神经网络修剪揭示不变性

BriefGPT - AI 论文速递
BriefGPT - AI 论文速递 · 2023-09-15T00:00:00Z
  • <<
  • <
  • 1 (current)
  • 2
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
友情链接: MOGE.AI 九胧科技 模力方舟 Gitee AI 菜鸟教程 Remio.AI DeekSeek连连 53AI 神龙海外代理IP IPIPGO全球代理IP 东波哥的博客 匡优考试在线考试系统 开源服务指南 蓝莺IM Solo 独立开发者社区 AI酷站导航 极客Fun 我爱水煮鱼 周报生成器 He3.app 简单简历 白鲸出海 T沙龙 职友集 TechParty 蟒周刊 Best AI Music Generator

小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码