App+1 | Inkive:把纸质书上划好的线存进 Obsidian

💡 原文中文,约3000字,阅读约需8分钟。
📝

内容提要

作者开发了Inkive应用,解决纸书划线笔记数字化难题。通过本地图像分割模型识别划线(准确率0.94),结合PPOCR读取文字,并优化“可接纳率”至95%,最终将书摘导出为Markdown,无缝连接Obsidian。应用坚持本地处理,保护隐私,已上架App Store。

🔎

延伸解读

本地处理与隐私保护

Inkive 坚持本地处理,书页照片、划线识别和 OCR 过程都留在设备上,不上传服务器。这不仅保护了用户隐私,也避免了云端费用。相比依赖云端大模型的方案,本地处理在无网络环境下也能使用,但可能受限于设备性能,识别速度或精度会有所折中。

技术选型的取舍

作者在开发中尝试了多种技术路线,如透视校正和传统 CV 方法,但最终发现这些并非关键。Inkive 的目标不是生成完美的扫描件,而是准确读取划线附近的文字。这一取舍体现了产品定位:专注于笔记提取,而非文档扫描。

与同类产品的差异

文章提到海外团队推出的智能书签硬件 Mark II,需要专用设备配合云端模型,而 Inkive 仅用手机应用加本地模型,不改变阅读习惯。两者解决相似需求,但路径不同:Inkive 更轻量,无需额外硬件,但可能受限于手机摄像头和本地算力。

Q&A

Inkive是什么?它主要解决什么问题?

Inkive是一款iOS应用,用于将纸质书上的划线、高亮和圈画等笔记数字化,并导出为Markdown格式,以便导入Obsidian等笔记软件。它解决了纸质书笔记难以无缝连接数字笔记的问题。

Inkive是如何识别纸质书上的划线的?

Inkive使用本地图像分割模型来识别书页照片中的划线、高亮和圈画。该模型在测试集上的准确率达到0.94,召回率达到0.88。

Inkive的OCR识别使用了什么技术?为什么选择本地处理?

Inkive使用PPOCR v6进行文字识别,因为它在中文纸书照片上的识别比iOS Vision框架更稳定。选择本地处理是为了保护用户隐私,避免上传照片,同时节省云端费用。

Inkive如何判断读者真正想留下的句子?

Inkive通过结合划线位置和OCR识别的文字,推测读者想留下的句子。它不追求像素级重合,而是以人的阅读判断为准,最终在测试集中95%的结果无需修改或只需轻微校对。

Inkive的使用流程是怎样的?

使用流程包括:1. 像往常一样阅读纸质书并划线;2. 读完打开Inkive,连续拍摄相关书页;3. 识别完成后逐条校对或预览整本书结果;4. 导出为Markdown文件,导入Obsidian。

Inkive与智能书签硬件Mark II有什么区别?

Mark II是海外团队推出的智能书签硬件,需要专用设备在纸上划线,并通过云端大模型识别同步到Notion和Readwise;而Inkive是手机应用,使用本地模型,不改变阅读习惯,只需读完后用手机拍照处理。

Inkive目前支持哪些平台?

Inkive目前仅支持iOS,已上架App Store。Android、Web和小程序版本仍在计划中。

🏷️

标签

➡️

继续阅读