小红花·文摘
  • 首页
  • AI Tokens🪙
  • 排行榜🏆
  • 直播
  • FAQ
刚刚,阿里Qwen3.8-Max来了!冲进全球第一梯队,模型表现直逼Claude

阿里巴巴发布新一代基座大模型Qwen3.8-Max,总参数2.4万亿,在编程、专业工作、长程任务、多模态智能体等场景表现突出,权威榜单中位列全球第一梯队。该模型价格低廉,国内每百万Tokens输入12元、输出36元,仅为Opus 5的40%和24%。实测中,它能从零开发完整项目、交叉分析复杂文档、处理长视频,能力与性价比兼备。

刚刚,阿里Qwen3.8-Max来了!冲进全球第一梯队,模型表现直逼Claude

量子位 量子位 · 2026-08-03T05:41:02Z
世界杯冠军刚出炉,我让商汤 U1 Pro 做了一份全景赛况图

商汤发布日日新SenseNova U1 Pro,这是业内首个原生统一“理解·生成·行动”的多模态智能体基座模型,支持原生8K输出,面向复杂中文、信息图、商业海报、学术设计和工业图解等高密度专业场景。实测显示,U1 Pro能准确渲染中文小字、处理超宽比例和复杂排版,直接生成可交付的高精度设计成品,如世界杯长图、城市避险指南、咖啡菜单等,旨在让AI从“画图”升级为“完成设计任务”。

世界杯冠军刚出炉,我让商汤 U1 Pro 做了一份全景赛况图

爱范儿 爱范儿 · 2026-07-20T10:29:28Z
在线教程丨英伟达开源LocateAnything,3B模型可实现图像+视频的目标指向/开放词汇目标检测/指代表达定位/OCR文本定位等功能

NVIDIA 最近推出了视觉语言定位模型LocateAnything-3B,拥有30亿参数,支持多种视觉定位任务。其核心创新为并行框解码(PBD),显著提升了定位精度和解码速度,尤其在复杂场景下表现优异,推动了视觉定位技术的发展。

在线教程丨英伟达开源LocateAnything,3B模型可实现图像+视频的目标指向/开放词汇目标检测/指代表达定位/OCR文本定位等功能

HyperAI超神经 HyperAI超神经 · 2026-06-02T09:55:40Z
【最新认知】2026 | 深度学习工业缺陷检测三种技术路线分析与趋势

文章讨论了工业缺陷检测的三个阶段:第一阶段为CNN分类与分割,主要解决缺陷识别,但在复杂环境中效果不佳;第二阶段为异常检测与小样本学习,强调理解正常状态以识别未知缺陷;第三阶段为多模态零样本质检智能体,旨在实现零漏检和低误检,通过大模型和工艺知识库提升检测能力。未来工业检测需向第三阶段演进。

【最新认知】2026 | 深度学习工业缺陷检测三种技术路线分析与趋势

gloomyfish gloomyfish · 2026-03-26T03:53:32Z

字节Seed推出的M3-Agent多模态智能体具备长期记忆和实时感知能力,通过强化学习提升推理效果,优于现有模型。M3-Bench基准评估其在长视频理解中的表现,展现出卓越的跨模态推理能力。

字节Seed开源长线记忆多模态Agent,像人一样能听会看

量子位 量子位 · 2025-08-18T08:04:41Z

美国东北大学与波士顿动力RAI联合提出的HEP框架,通过坐标系转移接口实现机器人高效学习。该框架的分层结构提升了灵活性,自动适应空间变化,显著降低了数据依赖。实验结果显示,HEP在复杂任务中的成功率提升了60%,为未来多模态智能体集成提供了新路径。

机器人高层指挥低层做,“坐标系转移接口”一次演示实现泛化学习 | ICML2025

量子位 量子位 · 2025-07-22T09:28:14Z

MetaAgentX团队推出了Open CaptchaWorld平台,旨在评估多模态智能体在解验证码方面的能力。研究表明,尽管人类的成功率高达93.3%,但最先进的模型如GPT-4o的成功率仅为40%,显示出当前智能体在高交互场景中的不足。该平台旨在促进智能体在真实网页任务中的应用与发展。

GPT-4o连验证码都解不了??SOTA模型成功率仅40%

量子位 量子位 · 2025-06-04T09:04:02Z

本文探讨了多模态智能体在设计生成和用户界面代码自动化方面的研究进展。研究表明,GPT-4V在视觉设计转代码任务中表现优异,但多模态模型在真实环境中完成复杂任务仍面临挑战。提出的Sketch2Prototype框架有效提升设计探索,UGround模型显著改善了GUI代理的环境感知能力。

Sketch2Code:评估视觉语言模型在互动网页设计原型制作中的应用

BriefGPT - AI 论文速递 BriefGPT - AI 论文速递 · 2024-10-21T00:00:00Z
同时操控手机和电脑,100项任务,跨系统智能体评测基准有了

CRAB是一个跨平台多模态智能体基准测试框架,由CAMEL AI社区开发。它评估多模态语言模型智能体在跨环境任务中的表现,并提供了高效的任务和评估器构建工具。研究团队还开发了一个包含100个任务的跨平台测试数据集CRAB Benchmark-v0。实验结果显示,使用GPT-4o作为推理引擎的单智能体结构具有最高的测试点完成率。该框架为智能体评估提供了全面、灵活和贴近实际的基准测试平台。

同时操控手机和电脑,100项任务,跨系统智能体评测基准有了

机器之心 机器之心 · 2024-08-14T06:27:17Z
现场Live震撼!OmAgent框架强势开源!行业应用已全面开花

联汇科技发布了第二代多模态智能体OmAgent,感知模块升级,速度提高20倍以上。思考决策能力提升,发布了第二代思考大模型OmChat V2,支持多种复杂输入。OmAgent框架全面开源,构建开放、丰富的智能体生态。发布了空间运营智能体和知识服务智能体,为行业用户提供助手。

现场Live震撼!OmAgent框架强势开源!行业应用已全面开花

机器之心 机器之心 · 2024-07-06T03:02:42Z
  • <<
  • <
  • 1 (current)
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码