小红花·文摘
  • 首页
  • AI Tokens🪙
  • 排行榜🏆
  • 直播
  • FAQ
Dify.AI
给DeepSeek-V4-Flash借一双眼睛:ZCode视觉子Agent方案

ZCode用户使用纯文本模型deepseek-v4-flash无法识别图片。通过安装zcode-deepseek-eye技能,配置视觉子Agent(如mimo-v2.5)作为“眼睛”,主模型遇到图片时自动转交处理,无感提升功能。安装需重启并配置,选错模型可重配,密钥自持,旧会话需新开。方案保留性价比,解决识图需求。

给DeepSeek-V4-Flash借一双眼睛:ZCode视觉子Agent方案

张洪Heo 张洪Heo · 2026-08-14T09:46:33Z
图像识别300毫秒!OpenCode视觉插件本地免费不用API

OpenCode Senses是一款本地运行的视觉插件,无需API密钥,通过Moondream2模型实现图像识别、OCR和对象检测等13种工具,所有分析在本地GPU完成,300毫秒内返回结果。它采用自动注入证据机制,将图像内容标记为不可信观测数据,防止提示注入攻击。该插件免费、开源、跨平台,适合代码截图和UI测试,但性能上限低于云端大模型。

图像识别300毫秒!OpenCode视觉插件本地免费不用API

极道 极道 · 2026-08-14T06:40:00Z
Liquid AI 发布 LFM2.5-VL-3B:一款 3B 视觉语言模型,可读取屏幕、识别物体并调用设备端工具

Liquid AI发布LFM2.5-VL-3B,31亿参数视觉语言模型,专为设备端设计,支持屏幕理解、函数调用、锚定和多图像输入。在28项基准测试中平均得分69.4,与4.7B模型相当。内存占用约3GB,解码速度228 tok/s。许可证对年收入低于1000万美元的公司免费,高收入需商业许可。

Liquid AI 发布 LFM2.5-VL-3B:一款 3B 视觉语言模型,可读取屏幕、识别物体并调用设备端工具

实时互动网 实时互动网 · 2026-08-14T02:56:23Z
如何构建和设计你的视觉设计系统 [第三部分]

本文是设计系统构建指南的第三部分,聚焦实操。首先进行视觉审计,评估现有元素。然后选择主色、中性色、语义色和强调色,并确保对比度符合无障碍标准。接着挑选字体、字重和字号,建立排版层级。还需确定信息密度、间距尺度和响应式布局原则。最后,制定图像和文案风格指南,以统一品牌形象。

如何构建和设计你的视觉设计系统 [第三部分]

Blog Awesome Blog Awesome · 2026-08-13T20:41:46Z
摩尔线程完成开源库CV-CUDA在MUSA上的兼容支持 助力国产GPU视觉计算生态升级

摩尔线程完成开源库CV-CUDA在MUSA上的兼容支持,使视觉处理任务可从CPU迁移至国产GPU,提升图像预处理与数据流水线效率。实测中几何变换、缩放等算子加速明显,适用于多模态训练、视频理解、智能制造等场景,并持续优化生态。

摩尔线程完成开源库CV-CUDA在MUSA上的兼容支持 助力国产GPU视觉计算生态升级

实时互动网 实时互动网 · 2026-08-11T07:38:28Z
Qt Toolkit 将推出边缘 AI 子模块,最初用于基于 Qt 的视觉 AI

Qt团队正开发新模块Qt EdgeAI,用于边缘AI推理,支持NVIDIA Jetson、Qualcomm IQ和NXP i.MX95等嵌入式平台。初始版本聚焦视觉AI,提供C++ API构建推理流水线,实现目标检测和分类,依赖QtMultimedia处理视频帧。后续将添加NXP NNStreamer后端和人脸检测示例。

Qt Toolkit 将推出边缘 AI 子模块,最初用于基于 Qt 的视觉 AI

实时互动网 实时互动网 · 2026-08-11T02:08:39Z

作者介绍了一种解决AI模型不支持多模态图片识别的方法:通过skill调用外部多模态模型API,将识别结果返回给当前会话模型。整个流程对用户无感,代码包含SKILL.md和analyze_image.py两个文件,兼容OpenAI和Anthropic格式,搭配阿里百炼qwen3.7-plus效果良好,并已开源在GitHub上。

我用一个 skill 把视觉活外包了(模型看不了图)

子舒的博客 子舒的博客 · 2026-08-10T08:32:00Z
ω-0——用于人形行走-操作的隐空间预测世界动作模型(全身VLA没有的未来视镜):抛弃像素级视频生成,以轻量“未来视觉latent预测”驱动全身动作扩散生成,实现边走边干活

ω-0是一种用于人形机器人并行行走与操作的世界动作模型,通过潜在预测而非视频生成来学习全身协同控制。它联合训练未来视觉潜变量与全身动作潜变量,避免依赖大型视频生成器。模型利用人类数据预训练,并构建ω-HOME数据集,在11个家庭任务上实现统一模型控制,展现平滑的全身协调能力。

ω-0——用于人形行走-操作的隐空间预测世界动作模型(全身VLA没有的未来视镜):抛弃像素级视频生成,以轻量“未来视觉latent预测”驱动全身动作扩散生成,实现边走边干活

结构之法 算法之道 结构之法 算法之道 · 2026-08-10T03:44:48Z
Hexo主题功能测试-交互视觉篇

本文介绍Hexo主题功能测试,涵盖交互视觉篇与内容标签篇。交互篇包括代码块增强、图片灯箱、打字机及页面特效配置;内容篇涉及note、timeline、tabs、label、button等插件用法。每项均提供配置说明与效果展示,供自动化测试断言使用。

Hexo主题功能测试-交互视觉篇

夜法之书 夜法之书 · 2026-08-07T02:00:00Z
视觉驱动进化:灵长类大脑变大是为了看见,不是为了思考!

杜克大学团队通过化石颅内模研究发现,灵长类大脑增大主要由视觉驱动,而非思考。额叶比例从未爆发式增长,而视觉处理区域与视神经孔大小同步扩张,推翻了“额叶造就智慧”的传统观点,提出视觉输入是大脑新皮层模块化进化的首要动力。

视觉驱动进化:灵长类大脑变大是为了看见,不是为了思考!

极道 极道 · 2026-08-06T22:27:00Z
一分钟读论文:《Beacon:通过强化学习实现智能视觉推理》

该研究提出Beacon框架,通过MA-TE双维度和强化学习训练,解决多模态模型视觉推理中工具滥用问题。实验显示,Beacon显著降低工具调用频率,保持推理准确性,并验证了模式切换与工具效果的正相关性及模型泛化能力。

一分钟读论文:《Beacon:通过强化学习实现智能视觉推理》

Micropaper Micropaper · 2026-08-02T00:00:00Z
商汤视觉AI荣膺全球三料第一,海外业务成增长引擎

商汤科技凭借视觉AI技术积累,首次登顶亚太及全球市场份额冠军,并蝉联中国市场第一,成为全球首个三大市场冠军企业。其通过本地化生态和“AI共创”战略拓展海外市场,融合大模型技术提升产品竞争力,获国际权威机构认可。

商汤视觉AI荣膺全球三料第一,海外业务成增长引擎

实时互动网 实时互动网 · 2026-07-28T06:06:53Z
GH-ESD:面向实例级视觉任务的基于假设驱动的错误切片发现

GH-ESD提出一种基于假设驱动与验证的框架,用于发现实例级视觉任务(如检测和分割)中的错误切片。它利用大语言模型生成关系性失败假设,并通过视觉语言模型和统计验证进行确认。研究还引入GESD基准数据集,实验显示该方法在检测任务上显著优于现有方法,并能提供可解释的改进建议。

GH-ESD:面向实例级视觉任务的基于假设驱动的错误切片发现

Apple Machine Learning Research Apple Machine Learning Research · 2026-07-27T00:00:00Z
一分钟读论文:《Agentic Real2Sim:用视觉语言代理实现物理世界建模》

UCLA、MIT和UCSD团队提出Agentic Real2Sim框架,利用视觉语言代理自动将真实物体-机器人交互转换为可仿真环境,无需人工干预。该框架通过视觉重建、物理参数推断等步骤,处理刚性、可变形物体及人形运动场景,使用开源VLM后端降低成本,提升机器人策略学习的可扩展性和效率。

一分钟读论文:《Agentic Real2Sim:用视觉语言代理实现物理世界建模》

Micropaper Micropaper · 2026-07-27T00:00:00Z
视觉设计系统的构建模块 [第二部分]

设计系统组件是品牌一致性的核心,涵盖色彩、图标等元素,能降低用户认知负担、提升品牌识别度和忠诚度。跨设备适配确保体验统一,视觉叙事则通过颜色和符号传达品牌价值,增强情感连接。系统需在真实场景中测试,以维持长期稳定。

视觉设计系统的构建模块 [第二部分]

Blog Awesome Blog Awesome · 2026-07-23T15:52:06Z
《松弛及其在视觉中的作用》:塑造现代人工智能研究的1977年博士论文

杰弗里·辛顿1977年的博士论文《松弛及其在视觉中的作用》奠定了其AI研究哲学基础。论文提出视觉是推理而非模式匹配,通过并行分布式计算、约束传播和连续置信度更新,在竞争假设中寻找全局一致解释。这些思想预示了优化、不确定性推理和层次表征等现代AI核心概念,贯穿其五十年研究历程。

《松弛及其在视觉中的作用》:塑造现代人工智能研究的1977年博士论文

freeCodeCamp.org freeCodeCamp.org · 2026-07-21T17:39:01Z
RoboTTT——面向机器人策略的上下文扩展:将TTT集成至VLA中形成序列模型(记忆信息被压缩至快速权重中,训练和推理时皆可更新),如此将视觉-运动上下文扩展到 8K 个时间步

RoboTTT将机器人基础模型的视觉-运动上下文扩展至8K时间步,通过测试时训练更新快速权重,在不增加推理延迟下提升性能。相比单步基线,任务性能提高87%,能完成五分钟十阶段装配任务,并支持一次性模仿和即时策略改进,表明上下文长度是机器人模型的新扩展维度。

RoboTTT——面向机器人策略的上下文扩展:将TTT集成至VLA中形成序列模型(记忆信息被压缩至快速权重中,训练和推理时皆可更新),如此将视觉-运动上下文扩展到 8K 个时间步

结构之法 算法之道 结构之法 算法之道 · 2026-07-21T15:49:12Z
光鉴科技发布具身智能视觉感知方案,为物理AI提供视觉感知基础

光鉴科技发布具身智能视觉感知方案,以AI双目视觉为核心,解决复杂场景深度感知难题,支持精细操作与空间导航,推出Libra 1000和3000模组,降低算力需求,助力机器人理解物理世界,推动产业化应用。

光鉴科技发布具身智能视觉感知方案,为物理AI提供视觉感知基础

量子位 量子位 · 2026-07-20T05:52:15Z
给我看示例:从图像集合中推断视觉概念

本文介绍视觉概念推断任务(VICIS),要求模型从少量示例图像中提取共享概念,并应用于新查询图像生成。现有视觉语言模型在此任务上表现不佳,常忽略视觉上下文或产生偏见输出。作者提出训练框架和架构,学习从图像集合推断概念并提取查询特定嵌入。实验表明,该方法在合成数据和ImageNet/WordNet数据上生成更准确多样,且能泛化至未见概念和草图等模态。

给我看示例:从图像集合中推断视觉概念

Apple Machine Learning Research Apple Machine Learning Research · 2026-07-17T00:00:00Z

谷歌图像庆祝25周年,推出动态画廊和AI图像生成等新功能,用户可根据兴趣浏览和创建图像。自2001年起,谷歌图像逐步引入相似图像、图像搜索和谷歌镜头等功能,提升了搜索体验,未来将继续推动视觉搜索的创新。

庆祝视觉搜索创新25周年

The Keyword The Keyword · 2026-07-14T16:00:00Z
  • <<
  • <
  • 1 (current)
  • 2
  • 3
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码