小红花·文摘
  • 首页
  • AI Tokens🪙
  • 排行榜🏆
  • 直播
  • FAQ
Cohere 发布 Parse 5:一款把企业文档转成 Markdown 的 2.3B 视觉语言模型

Cohere发布文档解析模型Parse(parse-v5.0),为2.3B参数视觉语言模型,可将PDF、PPT等转为带HTML表格和边界框的Markdown。API定价每千页1.5美元,Model Vault月费2500美元起。ParseBench得分79.2为自报子集分数,未含图表和视觉定位维度。专用容量月处理超167万页才划算。

Cohere 发布 Parse 5:一款把企业文档转成 Markdown 的 2.3B 视觉语言模型

实时互动网 实时互动网 · 2026-08-28T02:31:27Z
firecrawl/anydoc:开源毫秒级文档解析引擎 读取即转换

该文介绍开源文档解析引擎anydoc,由Firecrawl团队用Rust开发,能将PDF、Word等13种格式快速转换为统一Markdown,毫秒级处理,速度提升百倍。它解决AI读取本地文件结构混乱的问题,提升数据质量和AI响应效率,适用于AI Agent和RAG系统,简化企业知识库建设。

firecrawl/anydoc:开源毫秒级文档解析引擎 读取即转换

极道 极道 · 2026-08-06T02:37:00Z
文本/LaTeX/HTML表格一步搞定!OvisOCR2实现端到端文档智能解析;1.4 万+ 元素标注、万条语言指令!Voxel51 发布 SceneFun3D 室内场景微观交互数据集

OvisOCR2是2026年7月推出的0.8B参数端到端文档解析模型,基于Qwen3.5-0.8B构建,能将文档图像转为结构化Markdown,精准解析文本、公式、表格等。在OmniDocBench v1.6评测中获96.58分,超越传统流水线方法,实现低部署成本与高性能统一。HyperAI官网已上线该模型,并提供在线使用。

文本/LaTeX/HTML表格一步搞定!OvisOCR2实现端到端文档智能解析;1.4 万+ 元素标注、万条语言指令!Voxel51 发布 SceneFun3D 室内场景微观交互数据集

HyperAI超神经 HyperAI超神经 · 2026-07-27T06:58:36Z

Gemma 4是谷歌DeepMind推出的文档解析工具,能够处理扫描和数字PDF,提取发票信息。它通过将PDF页面渲染为高分辨率图像,利用视觉语言模型读取内容,克服传统文本提取工具的局限性。该工具支持灵活的视觉令牌预算,以适应不同文档的复杂性,确保高效准确的提取。

使用Gemma 4进行零样本本地文档解析:将PDF视为图像

KDnuggets KDnuggets · 2026-07-07T14:00:04Z
金融AI武道大会开赛!四道业务真题,出题人:猜不到最优解

AFAC2026金融智能创新大赛聚焦真实金融场景,设定四个挑战,旨在推动AI在金融领域的应用。比赛强调基础研究,要求参赛者设计高效的文档解析系统,识别交易行为,优化上下文管理,促进产业与学术结合,展现AI在金融领域的潜力与挑战。

金融AI武道大会开赛!四道业务真题,出题人:猜不到最优解

量子位 量子位 · 2026-07-01T07:41:42Z
Claude Sonnet 5现已在Vercel AI Gateway上线

Claude Sonnet 5已在AI Gateway上线,相较于Sonnet 4.6在编码和代理工作上有显著提升,能够完成许多以前需要Opus模型的任务。该模型具有更强的指令遵循性、文档解析能力和长时记忆能力。启动定价为每百万输入令牌2美元,输出令牌10美元,有效期至2026年8月31日。使用时需在AI SDK中设置模型为anthropic/claude-sonnet-5。

Claude Sonnet 5现已在Vercel AI Gateway上线

Vercel News Vercel News · 2026-06-30T00:00:00Z
96.33% 新SOTA!PaddleOCR-VL-1.6 发布,大模型时代的数据基座再升级

PaddleOCR-VL-1.6正式发布,基于1.5版本进行了优化,文档解析性能显著提升,OmniDocBench v1.6指标突破96.3%。新版本支持异形框定位,增强了表格、古籍及生僻字的识别能力,模型结构保持一致,用户可快速适配。此外,PaddleOCR-VL系列与多家硬件及云平台合作,推动文档智能化转型。

96.33% 新SOTA!PaddleOCR-VL-1.6 发布,大模型时代的数据基座再升级

百度大脑 百度大脑 · 2026-05-28T12:31:56Z
CVHub x PaddleOCR:X-AnyLabeling 升级 OCR 实战工作流,服务开发者数据闭环

PaddleOCR与CVHub合作推出X-AnyLabeling工具,支持PaddleOCR-VL-1.5模型,提升复杂文档的解析、复核和结构化导出能力。该工具简化了OCR数据准备流程,支持多任务解析,降低人工标注成本,助力开发者高效完成文档处理和数据沉淀。X-AnyLabeling被指定为PaddleOCR全球衍生模型挑战赛的官方标注平台。

CVHub x PaddleOCR:X-AnyLabeling 升级 OCR 实战工作流,服务开发者数据闭环

百度大脑 百度大脑 · 2026-05-13T11:54:39Z
文心飞桨 x OceanBase深圳站:携手硬件伙伴打通Agent生产落地链路

4月25日,百度文心飞桨与OceanBase等企业在深圳举办技术活动,探讨AI Agent的演进及其在企业环境中的应用。专家分享了数据底座、文档资产化与智能硬件的结合。百度飞桨发布PaddleOCR 3.5,提升文档解析能力,助力企业将文档转化为知识资产,推动AI技术在真实场景中的落地。

文心飞桨 x OceanBase深圳站:携手硬件伙伴打通Agent生产落地链路

百度大脑 百度大脑 · 2026-04-29T12:07:19Z
PaddleOCR 3.5 发布:Web 端直用、文档一键转 Markdown,生态交互新体验

PaddleOCR 3.5正式发布,新增PaddleOCR.js,支持浏览器端OCR功能,简化开发者体验。可将文档解析结果导出为Word和Markdown格式,并支持多种文档类型。此版本整合了Transformers推理引擎,提升了OCR能力的灵活性和兼容性,旨在降低AI应用开发门槛,推动OCR技术发展。

PaddleOCR 3.5 发布:Web 端直用、文档一键转 Markdown,生态交互新体验

百度大脑 百度大脑 · 2026-04-21T12:39:26Z
技术深度揭秘|云知声U1-OCR架构升级 + API 开放,重构 OCR 3.0 时代

云知声发布了工业级文档智能基础大模型Unisound U1-OCR,标志着OCR 3.0时代的到来。该模型具备高效部署和强适配能力,支持金融、医疗等行业的复杂文档解析,提升了文档结构理解和阅读顺序恢复能力,解决了传统OCR的局限性,推动行业数字化转型。

技术深度揭秘|云知声U1-OCR架构升级 + API 开放,重构 OCR 3.0 时代

量子位 量子位 · 2026-04-21T04:50:16Z
飞桨星河社区月度报告(2026年3月)

PaddleOCR及其社区进行了多项功能和资源更新,包括提升文档解析体验、新增模型、丰富项目和数据集资源。推出了技术实战专栏,帮助开发者解决实际问题。同时,PaddleOCR OCEAN生态联盟成立,促进了社区的生态共建与技术发展。

飞桨星河社区月度报告(2026年3月)

百度大脑 百度大脑 · 2026-04-07T11:36:35Z
在线教程丨华中科大与小红书 hi lab开源dots.mocr,SOTA级OCR模型完美还原文档结构,图形也能转 SVG

华中科技大学与小红书hi lab联合开源了dots.mocr,旨在解决传统OCR在复杂文档解析中的不足。该工具能够将文字、图表等视觉元素解析为结构化数据,并转换为可编辑的SVG代码,提升文档理解和自动化处理能力。HyperAI官网已上线相关教程,用户可在线体验。

在线教程丨华中科大与小红书 hi lab开源dots.mocr,SOTA级OCR模型完美还原文档结构,图形也能转 SVG

HyperAI超神经 HyperAI超神经 · 2026-04-01T11:28:09Z
手把手部署教学+官方skills,在星河社区免费玩转小龙虾!

OpenClaw在开发者中越来越受欢迎,但许多人在使用时遇到问题。星河社区提供免费的CPU云端环境,帮助用户快速部署OpenClaw。文章介绍了如何配置和安装三个核心技能,使OpenClaw从“玩具”转变为“工具”,以解决文档解析和文字识别等实际问题。

手把手部署教学+官方skills,在星河社区免费玩转小龙虾!

百度大脑 百度大脑 · 2026-03-23T12:31:10Z
01Agent×百度AI:终结“AI生图无法修改”的难题,让每张图都真正可编辑!

01Agent是一款智能内容创作工具,结合PaddleOCR-VL-1.5和ERNIE-5.0,支持高效解析文档和二次创作。用户可上传图片和PDF,系统自动提取结构化信息,提升创作效率。通过识别与编辑图像元素,用户可以灵活修改内容,实现持续生产与复用。

01Agent×百度AI:终结“AI生图无法修改”的难题,让每张图都真正可编辑!

百度大脑 百度大脑 · 2026-02-12T12:35:54Z
OpenClaw × PaddleOCR:开箱即用!将文档解析 Skill 能力注入你的 Agent 工具

OpenClaw推出了PaddleOCR文档解析技能,支持多种文档格式和语言,自动分析文档结构并输出结构化数据,降低集成成本,提高开发效率。PaddleOCR从独立服务转变为可组合的标准化节点,助力知识库构建和自动化处理。

OpenClaw × PaddleOCR:开箱即用!将文档解析 Skill 能力注入你的 Agent 工具

百度大脑 百度大脑 · 2026-02-10T10:55:58Z
RAGFlow x PaddleOCR:联动知名开源伙伴,打造端到端高精度文档解析新范式

RAGFlow是一款开源RAG引擎,集成了PaddleOCR-VL-1.5,提升了文档解析能力。新版本增强了复杂文档的结构化转换,支持多边形元素定位和跨页识别,确保高质量的语义切分和引用追溯,提高了文档型RAG的可用性与可信度,助力企业级知识管理。

RAGFlow x PaddleOCR:联动知名开源伙伴,打造端到端高精度文档解析新范式

百度大脑 百度大脑 · 2026-02-09T09:40:52Z
Pathway × PaddleOCR:握手知名开源框架,打通“动态文档”到实时 RAG 的数据入口

PaddleOCR与Pathway深度集成,实现实时文档解析。通过PaddleOCRParser,Pathway高效处理动态文档,提供结构化数据,支持实时更新与索引,降低运维成本,提升系统可靠性,满足企业文档数字化需求。

Pathway × PaddleOCR:握手知名开源框架,打通“动态文档”到实时 RAG 的数据入口

百度大脑 百度大脑 · 2026-02-06T13:25:55Z
Haystack × PaddleOCR:海外开源伙伴+1!构建面向 RAG 与 Agent 的统一文档解析入口

PaddleOCR与Haystack深度集成,提升了文档解析能力,支持复杂文档的结构化处理。PaddleOCR-VL-1.5可直接接入Haystack Pipeline,实现高精度解析,优化RAG和Agent工作流,满足企业级应用需求。此集成简化了文档入库流程,提高了数据可追溯性和检索准确性,推动了AI在文档密集场景中的应用。

Haystack × PaddleOCR:海外开源伙伴+1!构建面向 RAG 与 Agent 的统一文档解析入口

百度大脑 百度大脑 · 2026-02-04T13:10:46Z

百度开源新一代OCR模型PaddleOCR-VL-1.5,实现全球首个“异形框定位”能力,精度达到94.5%。该模型在复杂文档解析中表现优异,支持多语种识别,推动OCR技术应用落地。

性能超越DeepSeek-OCR2,百度发布并开源新一代SOTA OCR模型

量子位 量子位 · 2026-01-30T06:10:24Z
  • <<
  • <
  • 1 (current)
  • 2
  • 3
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
友情链接: MOGE.AI 九胧科技 1tok 菜鸟教程 Remio.AI DeekSeek连连 53AI 神龙海外代理IP IPIPGO全球代理IP 东波哥的博客 匡优考试在线考试系统 开源服务指南 蓝莺IM Solo 独立开发者社区 AI酷站导航 极客Fun 我爱水煮鱼 周报生成器 He3.app 简单简历 白鲸出海 T沙龙 职友集 TechParty 蟒周刊 Best AI Music Generator 模力方舟 Gitee AI

小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码