个人项目看板 工程花园 · 公开陈列
← 返回看板
docflow(OCR 文档批处理工具)
已上线

简介

解决什么问题

工作中大量 PDF、扫描件、Office 文档需要批量转成结构化文本。商业 OCR 工具要么按页收费、要么要求把文档上传到别人的服务器——对含敏感内容的文档不可接受。docflow 让批量 OCR 在本地完成,并且能被 AI Agent 直接调用。

核心功能

  • 多引擎 OCR:MinerU Cloud(Precision / Agent 双模式)、PaddleOCR Cloud、本地 OCR 引擎三档可选,按精度与隐私需求自由切换
  • 16+ 格式支持:PDF、Office 全家桶、常见图片格式、OFD 版式文档,内置魔数校验防止伪装文件
  • 安全机制:SHA-256 内容去重、文件大小限制,批量处理数千文件不炸内存
  • 双形态使用:GUI 桌面应用(拖拽即用)+ CLI 命令行(可接脚本管线)
  • MCP 标准接口:暴露 parse_documents 工具,Claude Code 等 AI Agent 可以把它当作自己的"眼睛"直接调用
  • 跨平台分发:Windows NSIS 安装器 + macOS Apple Silicon 原生包

技术要点

Electron 28 / React 18 / Vite 5 / Tailwind CSS / TypeScript 5 / MCP SDK / sharp 图像处理;本地 OCR 引擎由 Python 实现(可选依赖)。约 81 个源文件,当前版本 v1.2.0,已开源。

链接

GitHub 开源仓库(见项目本地记录)

复盘

  • 关键决策:多引擎抽象层是整个项目的地基——三家 OCR 服务的返回格式差异巨大,先统一成标准 Markdown 输出,后续功能才能叠加;后期把能力封装成 MCP 工具是最关键的一步棋,让一个桌面工具变成了 AI 工作流的可调用环节
  • 学到什么:桌面应用的分发成本(安装器、签名、跨平台适配)经常超过功能开发本身,值得在第一天就规划
元信息
开始2026-06-18
最后活跃2026-06-18
完结2026-06-18
技术栈electron, react, typescript, vite, tailwind, node-js, python
工具OCR桌面应用