Cohere发布文档解析模型Parse(parse-v5.0),为2.3B参数视觉语言模型,可将PDF、PPT等转为带HTML表格和边界框的Markdown。API定价每千页1.5美元,Model Vault月费2500美元起。ParseBench得分79.2为自报子集分数,未含图表和视觉定位维度。专用容量月处理超167万页才划算。
该文介绍开源文档解析引擎anydoc,由Firecrawl团队用Rust开发,能将PDF、Word等13种格式快速转换为统一Markdown,毫秒级处理,速度提升百倍。它解决AI读取本地文件结构混乱的问题,提升数据质量和AI响应效率,适用于AI Agent和RAG系统,简化企业知识库建设。
OvisOCR2是2026年7月推出的0.8B参数端到端文档解析模型,基于Qwen3.5-0.8B构建,能将文档图像转为结构化Markdown,精准解析文本、公式、表格等。在OmniDocBench v1.6评测中获96.58分,超越传统流水线方法,实现低部署成本与高性能统一。HyperAI官网已上线该模型,并提供在线使用。
Gemma 4是谷歌DeepMind推出的文档解析工具,能够处理扫描和数字PDF,提取发票信息。它通过将PDF页面渲染为高分辨率图像,利用视觉语言模型读取内容,克服传统文本提取工具的局限性。该工具支持灵活的视觉令牌预算,以适应不同文档的复杂性,确保高效准确的提取。
AFAC2026金融智能创新大赛聚焦真实金融场景,设定四个挑战,旨在推动AI在金融领域的应用。比赛强调基础研究,要求参赛者设计高效的文档解析系统,识别交易行为,优化上下文管理,促进产业与学术结合,展现AI在金融领域的潜力与挑战。
Claude Sonnet 5已在AI Gateway上线,相较于Sonnet 4.6在编码和代理工作上有显著提升,能够完成许多以前需要Opus模型的任务。该模型具有更强的指令遵循性、文档解析能力和长时记忆能力。启动定价为每百万输入令牌2美元,输出令牌10美元,有效期至2026年8月31日。使用时需在AI SDK中设置模型为anthropic/claude-sonnet-5。
PaddleOCR-VL-1.6正式发布,基于1.5版本进行了优化,文档解析性能显著提升,OmniDocBench v1.6指标突破96.3%。新版本支持异形框定位,增强了表格、古籍及生僻字的识别能力,模型结构保持一致,用户可快速适配。此外,PaddleOCR-VL系列与多家硬件及云平台合作,推动文档智能化转型。
PaddleOCR与CVHub合作推出X-AnyLabeling工具,支持PaddleOCR-VL-1.5模型,提升复杂文档的解析、复核和结构化导出能力。该工具简化了OCR数据准备流程,支持多任务解析,降低人工标注成本,助力开发者高效完成文档处理和数据沉淀。X-AnyLabeling被指定为PaddleOCR全球衍生模型挑战赛的官方标注平台。
4月25日,百度文心飞桨与OceanBase等企业在深圳举办技术活动,探讨AI Agent的演进及其在企业环境中的应用。专家分享了数据底座、文档资产化与智能硬件的结合。百度飞桨发布PaddleOCR 3.5,提升文档解析能力,助力企业将文档转化为知识资产,推动AI技术在真实场景中的落地。
PaddleOCR 3.5正式发布,新增PaddleOCR.js,支持浏览器端OCR功能,简化开发者体验。可将文档解析结果导出为Word和Markdown格式,并支持多种文档类型。此版本整合了Transformers推理引擎,提升了OCR能力的灵活性和兼容性,旨在降低AI应用开发门槛,推动OCR技术发展。
云知声发布了工业级文档智能基础大模型Unisound U1-OCR,标志着OCR 3.0时代的到来。该模型具备高效部署和强适配能力,支持金融、医疗等行业的复杂文档解析,提升了文档结构理解和阅读顺序恢复能力,解决了传统OCR的局限性,推动行业数字化转型。
PaddleOCR及其社区进行了多项功能和资源更新,包括提升文档解析体验、新增模型、丰富项目和数据集资源。推出了技术实战专栏,帮助开发者解决实际问题。同时,PaddleOCR OCEAN生态联盟成立,促进了社区的生态共建与技术发展。
华中科技大学与小红书hi lab联合开源了dots.mocr,旨在解决传统OCR在复杂文档解析中的不足。该工具能够将文字、图表等视觉元素解析为结构化数据,并转换为可编辑的SVG代码,提升文档理解和自动化处理能力。HyperAI官网已上线相关教程,用户可在线体验。
OpenClaw在开发者中越来越受欢迎,但许多人在使用时遇到问题。星河社区提供免费的CPU云端环境,帮助用户快速部署OpenClaw。文章介绍了如何配置和安装三个核心技能,使OpenClaw从“玩具”转变为“工具”,以解决文档解析和文字识别等实际问题。
01Agent是一款智能内容创作工具,结合PaddleOCR-VL-1.5和ERNIE-5.0,支持高效解析文档和二次创作。用户可上传图片和PDF,系统自动提取结构化信息,提升创作效率。通过识别与编辑图像元素,用户可以灵活修改内容,实现持续生产与复用。
OpenClaw推出了PaddleOCR文档解析技能,支持多种文档格式和语言,自动分析文档结构并输出结构化数据,降低集成成本,提高开发效率。PaddleOCR从独立服务转变为可组合的标准化节点,助力知识库构建和自动化处理。
RAGFlow是一款开源RAG引擎,集成了PaddleOCR-VL-1.5,提升了文档解析能力。新版本增强了复杂文档的结构化转换,支持多边形元素定位和跨页识别,确保高质量的语义切分和引用追溯,提高了文档型RAG的可用性与可信度,助力企业级知识管理。
PaddleOCR与Pathway深度集成,实现实时文档解析。通过PaddleOCRParser,Pathway高效处理动态文档,提供结构化数据,支持实时更新与索引,降低运维成本,提升系统可靠性,满足企业文档数字化需求。
PaddleOCR与Haystack深度集成,提升了文档解析能力,支持复杂文档的结构化处理。PaddleOCR-VL-1.5可直接接入Haystack Pipeline,实现高精度解析,优化RAG和Agent工作流,满足企业级应用需求。此集成简化了文档入库流程,提高了数据可追溯性和检索准确性,推动了AI在文档密集场景中的应用。
百度开源新一代OCR模型PaddleOCR-VL-1.5,实现全球首个“异形框定位”能力,精度达到94.5%。该模型在复杂文档解析中表现优异,支持多语种识别,推动OCR技术应用落地。
完成下面两步后,将自动完成登录并继续当前操作。