小红花·文摘
  • 首页
  • 广场
  • 排行榜🏆
  • 直播
  • FAQ
Dify.AI
Kimi K3在Arena编码排行榜上名列前茅——并且是开源模型

Moonshot AI推出的Kimi K3是一款开源模型,首次亮相即在Arena前端编码排行榜上名列前茅,超越了OpenAI和Anthropic的模型。K3具有2.8万亿参数和多模态支持,强调性能,开发者期待在本地运行K3,以灵活选择不同模型进行编码工作。K3的发布可能促使AI编码平台更加重视开源模型。

Kimi K3在Arena编码排行榜上名列前茅——并且是开源模型

The New Stack
The New Stack · 2026-07-17T16:07:39Z
ABot-AgentOS——具备多模态记忆的通用智能体操作系统:Agent Harness层(含上下文管理和验证系统)、LLM、记忆作为大脑,自主调用下层导航、操作、运控相关的技能

ABot-AgentOS是一种通用机器人智能体操作系统,旨在解决具身智能中的推理与执行、泛化和持久记忆等挑战。该系统结合多模态感知、记忆和推理,支持机器人在物理世界中的长期交互。通过边缘-云协同架构,ABot-AgentOS能够高效执行任务并优化技能,其多模态记忆系统确保机器人持续学习和利用经验,提升智能体整体能力。

ABot-AgentOS——具备多模态记忆的通用智能体操作系统:Agent Harness层(含上下文管理和验证系统)、LLM、记忆作为大脑,自主调用下层导航、操作、运控相关的技能

结构之法 算法之道
结构之法 算法之道 · 2026-07-17T07:56:33Z
OpenAI前CTO发布开源模型Inkling:可低成本微调的六边形战士

OpenAI前CTO推出的开源模型Inkling,拥有9750亿参数,支持多模态输入,具备强大的微调能力,能够高效处理文本、音频和图像,并在安全性上表现优异。Inkling的灵活性和低成本使其成为开发者的理想工具,推动开源AI的发展。

OpenAI前CTO发布开源模型Inkling:可低成本微调的六边形战士

极道
极道 · 2026-07-17T00:16:00Z
刚刚,一个免费AI Coding选手杀入全球第一梯队

Agnes AI推出了新一代文本模型Agnes-2.5-Flash,具备强大的编码能力,且永久免费。与Claude等工具相比,Agnes-2.5-Flash在代码理解、Bug修复和复杂任务执行上表现优异。同时,桌面端Agnes Code也上线,支持多模态内容处理,旨在降低开发者的使用门槛。Agnes AI的使命是让世界级AI普及到每个人,提供高性价比的服务。

刚刚,一个免费AI Coding选手杀入全球第一梯队

量子位
量子位 · 2026-07-14T12:36:48Z
OCR 教程汇总丨覆盖长文档/端到端/多语言,百度/小红书/华中科大等面向不同场景开源高性能模型,实现多模态文档精准解析

随着大模型的发展,OCR技术成为连接视觉数据与智能应用的重要工具。新一代多模态模型整合了文字识别和信息抽取等功能,推动了OCR在科研、金融和医疗等领域的应用。本文介绍了五款开源OCR模型,包括Unlimited-OCR、Chandra-ocr-2、dots.mocr、Qianfan-OCR和FireRed-OCR,适用于文档解析和手写文字处理等场景,帮助开发者选择合适的解决方案。

OCR 教程汇总丨覆盖长文档/端到端/多语言,百度/小红书/华中科大等面向不同场景开源高性能模型,实现多模态文档精准解析

HyperAI超神经
HyperAI超神经 · 2026-07-13T09:31:26Z
字节跳动发布多模态图像创作模型Seedream 5.0 Pro 生图更懂设计

字节跳动于7月9日发布了多模态图像创作模型Seedream 5.0 Pro,该版本在图文匹配和结构合理性等方面有显著提升,具备复杂信息可视化、交互式精准编辑、真实影像质感和多语种支持等核心能力。Seedream 5.0 Pro已上线火山方舟体验中心,后续将在豆包和即梦平台推出。

字节跳动发布多模态图像创作模型Seedream 5.0 Pro 生图更懂设计

TechWeb 全站精华
TechWeb 全站精华 · 2026-07-09T02:49:54Z
让Skill“有图可依”:openJiuwen首发多模态Skill范式Skill-Omni

openJiuwen发布了Skill-Omni,这是首个多模态Skill范式,旨在提升Agent的任务执行能力。该系统通过提取网页和视频中的视觉信息,生成可复用的多模态Skill,克服了传统文本Skill在视觉任务中的局限性。用户只需提供链接,系统便能自动生成包含关键截图和操作步骤的Skill,帮助Agent更好地理解和执行任务。Skill-Omni标志着从文本到多模态经验的转变,推动了Agent技术的发展。

让Skill“有图可依”:openJiuwen首发多模态Skill范式Skill-Omni

量子位
量子位 · 2026-07-07T05:03:09Z
科大讯飞举办智能交互生态发布会,三大平台同步升级

2026年7月2日,科大讯飞在深圳发布了智能交互生态,AIUI平台升级为多模态交互,支持40余种语言,助力智能硬件出海。同时,机器人超脑平台也完成升级,增强了多模态感知和复杂任务执行能力,推动机器人产业发展。

科大讯飞举办智能交互生态发布会,三大平台同步升级

量子位
量子位 · 2026-07-02T10:45:31Z
OceanBase湖库一体,重新定义AI数据库

OceanBase的CTO杨传辉指出,AI时代需要重新定义数据库架构,以支持自主运行的AI代理。传统数据库无法满足AI的实时性和多模态数据管理需求。OceanBase推出的湖库一体AI数据库,融合在线和离线计算,支持多种数据类型和计算引擎,确保数据一致性和实时性,提升企业的AI应用能力。

OceanBase湖库一体,重新定义AI数据库

量子位
量子位 · 2026-07-01T09:05:10Z
24小时直播,只靠一张照片?虎牙实时多模态数字人VAM 1.0率先突围行业三堵墙

虎牙推出的VAM 1.0 AI数字人具备实时互动能力,能够与用户聊天、唱歌、跳舞和玩游戏。该技术通过三阶段训练解决了面部漂移和交互问题,实现了高效、稳定的实时表现。虎牙利用直播平台优势,推动AI数字人从概念走向实际应用,未来可能改变内容生态。

24小时直播,只靠一张照片?虎牙实时多模态数字人VAM 1.0率先突围行业三堵墙

量子位
量子位 · 2026-06-30T05:53:21Z
MiMo Auto 免费 API 使用指南:从 MiMo Code 中提取免费的 MiMo Auto 模型

小米推出了基于OpenCode的MiMo Code终端工具,并限免MiMo-V2.5模型。用户可以通过MiMo Code提取数据并在其他工具上使用。MiMo Auto提供免费API,支持多模态输入和推理,使用JWT进行身份验证,响应格式兼容OpenAI。

MiMo Auto 免费 API 使用指南:从 MiMo Code 中提取免费的 MiMo Auto 模型

小众软件
小众软件 · 2026-06-11T13:03:59Z
MiniMax M3在AI Gateway上

MiniMax M3已在Vercel AI Gateway上线,具备1M-token上下文窗口和多模态功能,专注于软件工程、终端工具使用和多轮协作。用户可通过AI SDK使用M3,支持文本和图像输入,AI Gateway提供统一API,便于模型调用和性能优化。

MiniMax M3在AI Gateway上

Vercel News
Vercel News · 2026-05-31T07:00:00Z
将DSA注意力引入多模态,快手Keye2.0开启强化推理新范式

快手发布了多模态大模型Keye-VL-2.0-30B-A3B,具备深度视频理解能力,采用DSA机制处理超长视频上下文,提升推理效率和准确性。该模型能够精准识别视频细节,提供高情商建议,并在复杂任务中展现强大的逻辑推理能力,标志着快手在多模态理解和自动化调度方面的重大进展,推动内容生产智能化。

将DSA注意力引入多模态,快手Keye2.0开启强化推理新范式

量子位
量子位 · 2026-05-26T10:17:39Z
被市场低估的,不止Google ?

谷歌在I/O大会前发布了Gemini Omni,具备生成教学视频和统一多模态功能,用户可通过一个对话框完成写作、图像生成和视频剪辑等任务,标志着AI Agent向全模态智能转型。国内公司Minimax在多模态领域表现突出,预计将迎来快速增长,全模态智能的应用将逐步融入日常生活,提升工作效率。

被市场低估的,不止Google ?

TechWeb 全站精华
TechWeb 全站精华 · 2026-05-20T03:34:33Z
BalCapRL:一种基于强化学习的多模态大语言模型图像描述的平衡框架

本文介绍了一种名为BalCapRL的平衡强化学习框架,旨在优化多模态大语言模型的图像描述。该框架通过奖励解耦归一化和长度条件奖励掩蔽,显著提升了描述的实用性、覆盖率和语言质量,克服了现有方法在描述质量上的局限性,多个模型的性能均有显著提高。

BalCapRL:一种基于强化学习的多模态大语言模型图像描述的平衡框架

Apple Machine Learning Research
Apple Machine Learning Research · 2026-05-11T00:00:00Z

谷歌扩展了Gemini API的文件搜索工具,支持多模态数据和自定义元数据,提升了检索增强生成系统的能力。新功能包括图像与文本的联合处理和页面引用,帮助用户更准确地找到信息并验证来源,使应用程序在处理大量数据时更高效、可靠。

Gemini API 文件搜索现已支持多模态:构建高效、可验证的检索增强生成系统

The Keyword
The Keyword · 2026-05-05T18:00:00Z

graphify-dotnet 是一款专注于代码分析的多模态知识图谱构建工具。它通过多阶段流水线处理文件,提取概念与关系,构建知识图谱,帮助开发者更好地理解项目架构,并为 AI 编程助手提供结构化上下文,从而提升代码生成的质量与可靠性。

Graphify-DotNet:AI 驱动的 .NET 代码知识图谱构建工具

dotNET跨平台
dotNET跨平台 · 2026-05-03T00:10:47Z
小米正式开源 MiMo 系列模型,顺手送100万亿Token

小米开源了MiMo-V2.5系列大模型,包括MiMo-V2.5-Pro和MiMo-V2.5,支持复杂任务和多模态处理,采用MIT协议,允许自由商用和微调。同时启动“Orbit百万亿Token计划”,向全球开发者赠送100万亿Token,促进模型应用。首日已适配多种AI芯片,方便开发者使用。

小米正式开源 MiMo 系列模型,顺手送100万亿Token

dotNET跨平台
dotNET跨平台 · 2026-04-29T00:01:32Z
打工人五一自救指南:把活全甩给AI,准备免打扰出门

DuMate是百度智能云开发的AI助手,支持多模态理解与生成,能够高效处理复杂任务,如整理报告、生成简报和视频总结。用户可通过IM平台远程指挥,节省时间,适合假期应急办公。新用户输入邀请码可获得积分福利。

打工人五一自救指南:把活全甩给AI,准备免打扰出门

量子位
量子位 · 2026-04-27T12:19:37Z
【效果逆天】零样本工业缺陷改变工业质检,颠覆YOLO系列模型效果

最近的零样本测试表明,利用多模态和Transformer大模型可以高效检测工业缺陷,如裂纹和污垢。这项技术实现了零样本检测,显著提高了项目交付速度,适用于多种样品和行业转换。

【效果逆天】零样本工业缺陷改变工业质检,颠覆YOLO系列模型效果

gloomyfish
gloomyfish · 2026-04-27T03:16:11Z
  • <<
  • <
  • 1 (current)
  • 2
  • 3
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
友情链接: MOGE.AI 九胧科技 模力方舟 Gitee AI 菜鸟教程 Remio.AI DeekSeek连连 53AI 神龙海外代理IP IPIPGO全球代理IP 东波哥的博客 匡优考试在线考试系统 开源服务指南 蓝莺IM Solo 独立开发者社区 AI酷站导航 极客Fun 我爱水煮鱼 周报生成器 He3.app 简单简历 白鲸出海 T沙龙 职友集 TechParty 蟒周刊 Best AI Music Generator

小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码