小红花·文摘
  • 首页
  • 广场
  • 排行榜🏆
  • 直播
  • FAQ
Dify.AI
Kimi K3在Arena编码排行榜上名列前茅——并且是开源模型

Moonshot AI推出的Kimi K3是一款开源模型,首次亮相即在Arena前端编码排行榜上名列前茅,超越了OpenAI和Anthropic的模型。K3具有2.8万亿参数和多模态支持,强调性能,开发者期待在本地运行K3,以灵活选择不同模型进行编码工作。K3的发布可能促使AI编码平台更加重视开源模型。

Kimi K3在Arena编码排行榜上名列前茅——并且是开源模型

The New Stack
The New Stack · 2026-07-17T16:07:39Z
ABot-AgentOS——具备多模态记忆的通用智能体操作系统:Agent Harness层(含上下文管理和验证系统)、LLM、记忆作为大脑,自主调用下层导航、操作、运控相关的技能

ABot-AgentOS是一种通用机器人智能体操作系统,旨在解决具身智能中的推理与执行、泛化和持久记忆等挑战。该系统结合多模态感知、记忆和推理,支持机器人在物理世界中的长期交互。通过边缘-云协同架构,ABot-AgentOS能够高效执行任务并优化技能,其多模态记忆系统确保机器人持续学习和利用经验,提升智能体整体能力。

ABot-AgentOS——具备多模态记忆的通用智能体操作系统:Agent Harness层(含上下文管理和验证系统)、LLM、记忆作为大脑,自主调用下层导航、操作、运控相关的技能

结构之法 算法之道
结构之法 算法之道 · 2026-07-17T07:56:33Z
OpenAI前CTO发布开源模型Inkling:可低成本微调的六边形战士

OpenAI前CTO推出的开源模型Inkling,拥有9750亿参数,支持多模态输入,具备强大的微调能力,能够高效处理文本、音频和图像,并在安全性上表现优异。Inkling的灵活性和低成本使其成为开发者的理想工具,推动开源AI的发展。

OpenAI前CTO发布开源模型Inkling:可低成本微调的六边形战士

极道
极道 · 2026-07-17T00:16:00Z
刚刚,一个免费AI Coding选手杀入全球第一梯队

Agnes AI推出了新一代文本模型Agnes-2.5-Flash,具备强大的编码能力,且永久免费。与Claude等工具相比,Agnes-2.5-Flash在代码理解、Bug修复和复杂任务执行上表现优异。同时,桌面端Agnes Code也上线,支持多模态内容处理,旨在降低开发者的使用门槛。Agnes AI的使命是让世界级AI普及到每个人,提供高性价比的服务。

刚刚,一个免费AI Coding选手杀入全球第一梯队

量子位
量子位 · 2026-07-14T12:36:48Z
OCR 教程汇总丨覆盖长文档/端到端/多语言,百度/小红书/华中科大等面向不同场景开源高性能模型,实现多模态文档精准解析

随着大模型的发展,OCR技术成为连接视觉数据与智能应用的重要工具。新一代多模态模型整合了文字识别和信息抽取等功能,推动了OCR在科研、金融和医疗等领域的应用。本文介绍了五款开源OCR模型,包括Unlimited-OCR、Chandra-ocr-2、dots.mocr、Qianfan-OCR和FireRed-OCR,适用于文档解析和手写文字处理等场景,帮助开发者选择合适的解决方案。

OCR 教程汇总丨覆盖长文档/端到端/多语言,百度/小红书/华中科大等面向不同场景开源高性能模型,实现多模态文档精准解析

HyperAI超神经
HyperAI超神经 · 2026-07-13T09:31:26Z
字节跳动发布多模态图像创作模型Seedream 5.0 Pro 生图更懂设计

字节跳动于7月9日发布了多模态图像创作模型Seedream 5.0 Pro,该版本在图文匹配和结构合理性等方面有显著提升,具备复杂信息可视化、交互式精准编辑、真实影像质感和多语种支持等核心能力。Seedream 5.0 Pro已上线火山方舟体验中心,后续将在豆包和即梦平台推出。

字节跳动发布多模态图像创作模型Seedream 5.0 Pro 生图更懂设计

TechWeb 全站精华
TechWeb 全站精华 · 2026-07-09T02:49:54Z
让Skill“有图可依”:openJiuwen首发多模态Skill范式Skill-Omni

openJiuwen发布了Skill-Omni,这是首个多模态Skill范式,旨在提升Agent的任务执行能力。该系统通过提取网页和视频中的视觉信息,生成可复用的多模态Skill,克服了传统文本Skill在视觉任务中的局限性。用户只需提供链接,系统便能自动生成包含关键截图和操作步骤的Skill,帮助Agent更好地理解和执行任务。Skill-Omni标志着从文本到多模态经验的转变,推动了Agent技术的发展。

让Skill“有图可依”:openJiuwen首发多模态Skill范式Skill-Omni

量子位
量子位 · 2026-07-07T05:03:09Z
科大讯飞举办智能交互生态发布会,三大平台同步升级

2026年7月2日,科大讯飞在深圳发布了智能交互生态,AIUI平台升级为多模态交互,支持40余种语言,助力智能硬件出海。同时,机器人超脑平台也完成升级,增强了多模态感知和复杂任务执行能力,推动机器人产业发展。

科大讯飞举办智能交互生态发布会,三大平台同步升级

量子位
量子位 · 2026-07-02T10:45:31Z
OceanBase湖库一体,重新定义AI数据库

OceanBase的CTO杨传辉指出,AI时代需要重新定义数据库架构,以支持自主运行的AI代理。传统数据库无法满足AI的实时性和多模态数据管理需求。OceanBase推出的湖库一体AI数据库,融合在线和离线计算,支持多种数据类型和计算引擎,确保数据一致性和实时性,提升企业的AI应用能力。

OceanBase湖库一体,重新定义AI数据库

量子位
量子位 · 2026-07-01T09:05:10Z
24小时直播,只靠一张照片?虎牙实时多模态数字人VAM 1.0率先突围行业三堵墙

虎牙推出的VAM 1.0 AI数字人具备实时互动能力,能够与用户聊天、唱歌、跳舞和玩游戏。该技术通过三阶段训练解决了面部漂移和交互问题,实现了高效、稳定的实时表现。虎牙利用直播平台优势,推动AI数字人从概念走向实际应用,未来可能改变内容生态。

24小时直播,只靠一张照片?虎牙实时多模态数字人VAM 1.0率先突围行业三堵墙

量子位
量子位 · 2026-06-30T05:53:21Z
MiMo Auto 免费 API 使用指南:从 MiMo Code 中提取免费的 MiMo Auto 模型

小米推出了基于OpenCode的MiMo Code终端工具,并限免MiMo-V2.5模型。用户可以通过MiMo Code提取数据并在其他工具上使用。MiMo Auto提供免费API,支持多模态输入和推理,使用JWT进行身份验证,响应格式兼容OpenAI。

MiMo Auto 免费 API 使用指南:从 MiMo Code 中提取免费的 MiMo Auto 模型

小众软件
小众软件 · 2026-06-11T13:03:59Z
MiniMax M3在AI Gateway上

MiniMax M3已在Vercel AI Gateway上线,具备1M-token上下文窗口和多模态功能,专注于软件工程、终端工具使用和多轮协作。用户可通过AI SDK使用M3,支持文本和图像输入,AI Gateway提供统一API,便于模型调用和性能优化。

MiniMax M3在AI Gateway上

Vercel News
Vercel News · 2026-05-31T07:00:00Z
将DSA注意力引入多模态,快手Keye2.0开启强化推理新范式

快手发布了多模态大模型Keye-VL-2.0-30B-A3B,具备深度视频理解能力,采用DSA机制处理超长视频上下文,提升推理效率和准确性。该模型能够精准识别视频细节,提供高情商建议,并在复杂任务中展现强大的逻辑推理能力,标志着快手在多模态理解和自动化调度方面的重大进展,推动内容生产智能化。

将DSA注意力引入多模态,快手Keye2.0开启强化推理新范式

量子位
量子位 · 2026-05-26T10:17:39Z
被市场低估的,不止Google ?

谷歌在I/O大会前发布了Gemini Omni,具备生成教学视频和统一多模态功能,用户可通过一个对话框完成写作、图像生成和视频剪辑等任务,标志着AI Agent向全模态智能转型。国内公司Minimax在多模态领域表现突出,预计将迎来快速增长,全模态智能的应用将逐步融入日常生活,提升工作效率。

被市场低估的,不止Google ?

TechWeb 全站精华
TechWeb 全站精华 · 2026-05-20T03:34:33Z
BalCapRL:一种基于强化学习的多模态大语言模型图像描述的平衡框架

本文介绍了一种名为BalCapRL的平衡强化学习框架,旨在优化多模态大语言模型的图像描述。该框架通过奖励解耦归一化和长度条件奖励掩蔽,显著提升了描述的实用性、覆盖率和语言质量,克服了现有方法在描述质量上的局限性,多个模型的性能均有显著提高。

BalCapRL:一种基于强化学习的多模态大语言模型图像描述的平衡框架

Apple Machine Learning Research
Apple Machine Learning Research · 2026-05-11T00:00:00Z

谷歌扩展了Gemini API的文件搜索工具,支持多模态数据和自定义元数据,提升了检索增强生成系统的能力。新功能包括图像与文本的联合处理和页面引用,帮助用户更准确地找到信息并验证来源,使应用程序在处理大量数据时更高效、可靠。

Gemini API 文件搜索现已支持多模态:构建高效、可验证的检索增强生成系统

The Keyword
The Keyword · 2026-05-05T18:00:00Z

graphify-dotnet 是一款专注于代码分析的多模态知识图谱构建工具。它通过多阶段流水线处理文件,提取概念与关系,构建知识图谱,帮助开发者更好地理解项目架构,并为 AI 编程助手提供结构化上下文,从而提升代码生成的质量与可靠性。

Graphify-DotNet:AI 驱动的 .NET 代码知识图谱构建工具

dotNET跨平台
dotNET跨平台 · 2026-05-03T00:10:47Z
小米正式开源 MiMo 系列模型,顺手送100万亿Token

小米开源了MiMo-V2.5系列大模型,包括MiMo-V2.5-Pro和MiMo-V2.5,支持复杂任务和多模态处理,采用MIT协议,允许自由商用和微调。同时启动“Orbit百万亿Token计划”,向全球开发者赠送100万亿Token,促进模型应用。首日已适配多种AI芯片,方便开发者使用。

小米正式开源 MiMo 系列模型,顺手送100万亿Token

dotNET跨平台
dotNET跨平台 · 2026-04-29T00:01:32Z
打工人五一自救指南:把活全甩给AI,准备免打扰出门

DuMate是百度智能云开发的AI助手,支持多模态理解与生成,能够高效处理复杂任务,如整理报告、生成简报和视频总结。用户可通过IM平台远程指挥,节省时间,适合假期应急办公。新用户输入邀请码可获得积分福利。

打工人五一自救指南:把活全甩给AI,准备免打扰出门

量子位
量子位 · 2026-04-27T12:19:37Z
【效果逆天】零样本工业缺陷改变工业质检,颠覆YOLO系列模型效果

最近的零样本测试表明,利用多模态和Transformer大模型可以高效检测工业缺陷,如裂纹和污垢。这项技术实现了零样本检测,显著提高了项目交付速度,适用于多种样品和行业转换。

【效果逆天】零样本工业缺陷改变工业质检,颠覆YOLO系列模型效果

gloomyfish
gloomyfish · 2026-04-27T03:16:11Z
  • <<
  • <
  • 1 (current)
  • 2
  • 3
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码