docflow(OCR 文档批处理工具)
已上线 简介
解决什么问题
工作中大量 PDF、扫描件、Office 文档需要批量转成结构化文本。商业 OCR 工具要么按页收费、要么要求把文档上传到别人的服务器——对含敏感内容的文档不可接受。docflow 让批量 OCR 在本地完成,并且能被 AI Agent 直接调用。
核心功能
- 多引擎 OCR:MinerU Cloud(Precision / Agent 双模式)、PaddleOCR Cloud、本地 OCR 引擎三档可选,按精度与隐私需求自由切换
- 16+ 格式支持:PDF、Office 全家桶、常见图片格式、OFD 版式文档,内置魔数校验防止伪装文件
- 安全机制:SHA-256 内容去重、文件大小限制,批量处理数千文件不炸内存
- 双形态使用:GUI 桌面应用(拖拽即用)+ CLI 命令行(可接脚本管线)
- MCP 标准接口:暴露
parse_documents工具,Claude Code 等 AI Agent 可以把它当作自己的"眼睛"直接调用 - 跨平台分发:Windows NSIS 安装器 + macOS Apple Silicon 原生包
技术要点
Electron 28 / React 18 / Vite 5 / Tailwind CSS / TypeScript 5 / MCP SDK / sharp 图像处理;本地 OCR 引擎由 Python 实现(可选依赖)。约 81 个源文件,当前版本 v1.2.0,已开源。
链接
GitHub 开源仓库(见项目本地记录)
复盘
- 关键决策:多引擎抽象层是整个项目的地基——三家 OCR 服务的返回格式差异巨大,先统一成标准 Markdown 输出,后续功能才能叠加;后期把能力封装成 MCP 工具是最关键的一步棋,让一个桌面工具变成了 AI 工作流的可调用环节
- 学到什么:桌面应用的分发成本(安装器、签名、跨平台适配)经常超过功能开发本身,值得在第一天就规划
元信息
开始2026-06-18
最后活跃2026-06-18
完结2026-06-18
技术栈electron, react, typescript, vite, tailwind, node-js, python
工具OCR桌面应用