小红花·文摘
  • 首页
  • AI Tokens🪙
  • 排行榜🏆
  • 直播
  • FAQ
20ms把PDF变成Markdown!开源OCR神器快了近300倍

Y Combinator孵化的Firecrawl团队发布开源OCR工具OCR It,可在20毫秒内将PDF文字转为Markdown,速度比Docling快300倍,支持离线使用。作为浏览器插件,用户可框选区域后手动或自动识别整份文档。但复杂版式(如表格、公式)处理能力有限,仍有提升空间。

20ms把PDF变成Markdown!开源OCR神器快了近300倍

量子位 量子位 · 2026-08-29T12:26:49Z
一张图最多384个Token:DeepSeek多模态模型背后的“极限压缩”艺术 - 蝈蝈俊

DeepSeek推出多模态模型DeepSeek-V4-Flash-Vision-Exp,图片最多占384个Token,通过三级压缩技术大幅降低成本。模型侧重OCR和图像描述,非人脸识别,故认错人属设计初衷问题。API成本可预测,推理快,多模态能力接近Opus-4.8,体现低价高效理念。

一张图最多384个Token:DeepSeek多模态模型背后的“极限压缩”艺术 - 蝈蝈俊

蝈蝈俊 蝈蝈俊 · 2026-08-21T23:23:00Z

作者开发了Inkive应用,解决纸书划线笔记数字化难题。通过本地图像分割模型识别划线(准确率0.94),结合PPOCR读取文字,并优化“可接纳率”至95%,最终将书摘导出为Markdown,无缝连接Obsidian。应用坚持本地处理,保护隐私,已上架App Store。

App+1 | Inkive:把纸质书上划好的线存进 Obsidian

少数派 少数派 · 2026-08-19T02:54:52Z
让 Al Agent 看懂所有文档:将任何文档转换为统一的 Markdown 格式

Firecrawl 开源了 PDF Inspector 和 AnyDoc 两个项目,用于将 PDF、Word、Excel 等文档高效转换为 AI 可读的 Markdown。PDF Inspector 用 Rust 编写,智能分析 PDF 结构,区分文本和图片,仅对扫描页使用本地 OCR(PP-OCRv6),降低成本。AnyDoc 支持多种格式,统一表格、标题等输出结构,并支持 AI 操作,纯本地运行,无需 API,提升 AI 处理文档的效率和准确性。

让 Al Agent 看懂所有文档:将任何文档转换为统一的 Markdown 格式

小众软件 小众软件 · 2026-08-18T08:44:06Z
Kimi K3、Unlimited OCR包揽全球前二,中国开源模型持续刷屏海外

中国AI开源模型引发全球关注。月之暗面发布Kimi K3登顶Hugging Face趋势榜,百度Unlimited OCR五天内GitHub Star破万,获图灵奖得主转发,一个月后重回榜首。其创新R-SWA机制解决长文档解析痛点,控制KV Cache规模,提升效率。中国AI开源从“发布即关注”迈向“持续被采用”,展现全球影响力。

Kimi K3、Unlimited OCR包揽全球前二,中国开源模型持续刷屏海外

量子位 量子位 · 2026-07-28T08:17:05Z
OCR 教程汇总丨覆盖长文档/端到端/多语言,百度/小红书/华中科大等面向不同场景开源高性能模型,实现多模态文档精准解析

随着大模型的发展,OCR技术成为连接视觉数据与智能应用的重要工具。新一代多模态模型整合了文字识别和信息抽取等功能,推动了OCR在科研、金融和医疗等领域的应用。本文介绍了五款开源OCR模型,包括Unlimited-OCR、Chandra-ocr-2、dots.mocr、Qianfan-OCR和FireRed-OCR,适用于文档解析和手写文字处理等场景,帮助开发者选择合适的解决方案。

OCR 教程汇总丨覆盖长文档/端到端/多语言,百度/小红书/华中科大等面向不同场景开源高性能模型,实现多模态文档精准解析

HyperAI超神经 HyperAI超神经 · 2026-07-13T09:31:26Z
如何使用JavaScript构建基于浏览器的PDF OCR文本转换器

本文介绍了如何使用JavaScript构建基于浏览器的PDF OCR文本转换器。该工具允许用户上传PDF文件,预览页面,配置OCR设置,提取文本并导出结果。OCR技术能够识别扫描图像中的文本并将其转换为可编辑的数字文本,确保用户隐私和安全。通过优化图像质量和选择合适的OCR语言,可以提高识别准确性。

如何使用JavaScript构建基于浏览器的PDF OCR文本转换器

freeCodeCamp.org freeCodeCamp.org · 2026-07-07T16:23:22Z

Godcoder 是一个本地优先的 Rust 编码助手,强调自我迭代和优化,支持代码修改和 GUI 自动化。franken_ocr 是一个纯 Rust 的 OCR 引擎,专注于无依赖的文档解析。QCue 是一个知识管理工具,将碎片化信息转化为可检索的 Markdown Wiki。ipatool-rs 重写了 IPA 下载工具,适应 Apple 新认证流,提供完整的下载链路。

【Rust日报】2026-07-01 Godcoder:本地优先 Rust 编码助手,连自己的 Harness 都能边跑边自我迭代

Rust.cc Rust.cc · 2026-07-01T01:10:31Z
在线教程丨32K上下文一次解析数十页文档,百度开源Unlimited OCR,重构长文档复杂场景

近年来,OCR 技术已从简单的文字识别发展为完整的文档理解。新一代 DeepSeek OCR 模型通过引入大语言模型,提升了识别准确率和复杂版面解析能力。百度的 Unlimited OCR 解决了传统 OCR 的效率低和上下文割裂问题,采用 R-SWA 机制,降低计算成本,支持长文档的高效处理,并可扩展至其他任务。

在线教程丨32K上下文一次解析数十页文档,百度开源Unlimited OCR,重构长文档复杂场景

HyperAI超神经 HyperAI超神经 · 2026-06-29T12:57:58Z
一次吃下一本书!百度开源新OCR,作者疑似前DeepSeek研究员

百度推出的Unlimited OCR模型在长文档处理上刷新了SOTA,采用参考滑动窗口注意力机制,模拟人类阅读方式,解决了传统OCR的显存膨胀问题。该模型在OmniDocBench上表现优异,推理效率提升35%,并计划扩展到语音识别和机器翻译等任务。

一次吃下一本书!百度开源新OCR,作者疑似前DeepSeek研究员

量子位 量子位 · 2026-06-28T06:04:17Z
如何使用Python自动化PDF数据提取

PDF仍是商业中常用的文档格式,但数据提取困难且易出错。Python成为自动化PDF数据提取的有效工具,开发者可以利用其库提取文本和表格,并处理扫描文档。文章探讨了如何使用Python进行PDF数据提取,包括环境设置、文本和表格提取、OCR处理等,强调了自动化在提高效率和减少错误方面的重要性。

如何使用Python自动化PDF数据提取

freeCodeCamp.org freeCodeCamp.org · 2026-06-03T16:25:14Z
在线教程丨英伟达开源LocateAnything,3B模型可实现图像+视频的目标指向/开放词汇目标检测/指代表达定位/OCR文本定位等功能

NVIDIA 最近推出了视觉语言定位模型LocateAnything-3B,拥有30亿参数,支持多种视觉定位任务。其核心创新为并行框解码(PBD),显著提升了定位精度和解码速度,尤其在复杂场景下表现优异,推动了视觉定位技术的发展。

在线教程丨英伟达开源LocateAnything,3B模型可实现图像+视频的目标指向/开放词汇目标检测/指代表达定位/OCR文本定位等功能

HyperAI超神经 HyperAI超神经 · 2026-06-02T09:55:40Z

屏忆是一款开源的本地屏幕记忆工具,自动记录手机屏幕内容,利用OCR和索引功能帮助用户找回遗忘的信息。它支持按时间回看、生成回放和每日总结,强调本地保存和隐私控制,用户可选择记录内容并支持数据导出和清理。未来,屏忆计划扩展到更多平台,提供更完整的记录和回顾体验。

屏忆:这款开源工具,把过目就忘的日常变成「上下文」

少数派 少数派 · 2026-05-27T07:10:53Z
如何构建一个基于人工智能的医疗影像去标识化管道以支持临床研究

医疗影像正在改变医疗保健,研究人员利用深度学习模型检测肺炎、评估心脏功能和识别肿瘤。保护患者隐私是关键挑战。本文介绍了构建去标识化管道的方法,使用光学字符识别(OCR)和命名实体识别(NER)技术,自动去除医疗影像中的受保护健康信息(PHI),确保数据在临床研究和AI模型训练中的安全性。

如何构建一个基于人工智能的医疗影像去标识化管道以支持临床研究

freeCodeCamp.org freeCodeCamp.org · 2026-05-22T15:06:15Z
CVHub x PaddleOCR:X-AnyLabeling 升级 OCR 实战工作流,服务开发者数据闭环

PaddleOCR与CVHub合作推出X-AnyLabeling工具,支持PaddleOCR-VL-1.5模型,提升复杂文档的解析、复核和结构化导出能力。该工具简化了OCR数据准备流程,支持多任务解析,降低人工标注成本,助力开发者高效完成文档处理和数据沉淀。X-AnyLabeling被指定为PaddleOCR全球衍生模型挑战赛的官方标注平台。

CVHub x PaddleOCR:X-AnyLabeling 升级 OCR 实战工作流,服务开发者数据闭环

百度大脑 百度大脑 · 2026-05-13T11:54:39Z
在线教程丨单卡即可爆改,面壁智能等开源MiniCPM-V-4.6,1.3B端侧模型支持图像理解/视频理解/OCR/多轮多模态对话

近年来,AI行业认识到并非所有场景都需使用大型模型。高昂的推理成本和数据隐私风险使得小型模型在实际应用中更具效率。新开源的MiniCPM-V 4.6模型仅有1.3B参数,支持多种任务,适合在端侧设备上运行,推动AI应用落地。

在线教程丨单卡即可爆改,面壁智能等开源MiniCPM-V-4.6,1.3B端侧模型支持图像理解/视频理解/OCR/多轮多模态对话

HyperAI超神经 HyperAI超神经 · 2026-05-13T10:50:55Z
C# 结合 llama.cpp 实现 PaddleOCR-VL-1.5:本地 OCR 客户端开发全攻略

本文介绍了如何使用C# WinForm结合PaddleOCR-VL-1.5模型,构建一个本地离线的OCR客户端。该客户端支持多种识别任务,包括文字、表格和公式,架构简单,服务端与客户端解耦,便于升级和维护。通过RestSharp实现HTTP请求,确保识别过程的安全与高效。

C# 结合 llama.cpp 实现 PaddleOCR-VL-1.5:本地 OCR 客户端开发全攻略

dotNET跨平台 dotNET跨平台 · 2026-05-12T00:01:01Z
DeepSeek识图模式是个新模型?!一手实测在此(没错我被灰度到了)

DeepSeek的识图模式在灰度测试中表现优异,支持快速识别和推理。非思考模式下速度快但准确性需提升;思考模式下推理能力强但耗时较长。该模式有效处理OCR和网页图片,显示出独立训练的潜力。整体来看,DeepSeek的多模态能力发展迅速,仍有改进空间。

DeepSeek识图模式是个新模型?!一手实测在此(没错我被灰度到了)

量子位 量子位 · 2026-04-30T06:52:23Z
畅聊Agent OS、CLI美学、OCR破局,为车展装上AI引擎

4月26日,百度飞桨主办的“前沿AI技术交流会”在车展上成功举办,吸引了众多开发者。会议聚焦AI技术演进与实战应用,讨论了智能体向Agent OS的转变、命令行美学的优势及企业OCR的最新进展,促进了AI技术的深入交流与合作。

畅聊Agent OS、CLI美学、OCR破局,为车展装上AI引擎

百度大脑 百度大脑 · 2026-04-28T11:33:18Z

文章介绍了多种免费的GPU版OCR识别库和服务,适用于Windows和Linux平台,包括OnnxRuntime DML和PaddleOCR v5等,支持多种显卡,便于用户进行文字识别。

Windows、Linux免费CPU、GPU版OCR推理资源整理汇总

dotNET跨平台 dotNET跨平台 · 2026-04-24T00:01:30Z
  • <<
  • <
  • 1 (current)
  • 2
  • 3
  • >
  • >>
👤 个人中心
在公众号发送验证码完成验证
登录验证
在本设备完成一次验证即可继续使用

完成下面两步后,将自动完成登录并继续当前操作。

1 关注公众号
小红花技术领袖公众号二维码
小红花技术领袖
如果当前 App 无法识别二维码,请在微信搜索并关注该公众号
2 发送验证码
在公众号对话中发送下面 4 位验证码
友情链接: MOGE.AI 九胧科技 1tok 菜鸟教程 Remio.AI DeekSeek连连 53AI 神龙海外代理IP IPIPGO全球代理IP 东波哥的博客 匡优考试在线考试系统 开源服务指南 蓝莺IM Solo 独立开发者社区 AI酷站导航 极客Fun 我爱水煮鱼 周报生成器 He3.app 简单简历 白鲸出海 T沙龙 职友集 TechParty 蟒周刊 Best AI Music Generator 模力方舟 Gitee AI

小红花技术领袖俱乐部
小红花·文摘:汇聚分发优质内容
小红花技术领袖俱乐部
Copyright © 2021-
粤ICP备2022094092号-1
公众号 小红花技术领袖俱乐部公众号二维码
视频号 小红花技术领袖俱乐部视频号二维码