
做知识库、RAG、或者让大模型读论文/报告时,最头疼的往往不是模型本身,而是文档进不来。
扫描版 PDF、带复杂公式的论文、流程图、截图、Office 文件……传统 OCR 只能抠文字,版面乱、表格丢、公式糊、图表关系没了。云端文档解析服务又贵,还要把内容上传出去。
最近 GitHub 上出现的开源项目 doc7试图换一条路: 任意文档进 → 用你自己的多模态模型理解整页 → 输出 AI 可检索、可引用的 Markdown。

doc7 网站截图
它和传统 OCR 有什么不同?
doc7 不依赖一套固定的 OCR + 版面 + 表格 + 公式模型栈。它把页面交给你配置的 OpenAI 兼容多模态模型(本地 LM Studio、Ollama,或私有部署都行),让模型直接“看懂”整页内容。
官方举了个典型例子:一张纯光栅的 Attention Is All You Need 论文页,没有文字层。doc7 能恢复论文身份、Figure 2、公式、缩放说明、脚注,以及两个注意力图内部的有序关系,并整理成可搜索的 Markdown。
在他们的对比测试中(同样用本地 qwen3.5-9b),针对 15 个可机器检查的视觉事实:
- doc7 恢复了 15/15
- MarkItDown + OCR 插件约 9/15
- Docling 标准流程约 3/15
说明它在复杂视觉元素上确实有优势。
支持什么?怎么用?
输入几乎覆盖日常文档:PDF、Office、扫描件、截图、图表、公式、流程图等,统一走同一套页面理解管线,输出一份结构化 Markdown。
安装很轻量:
# macOS / Linux
curl -fsSL https://raw.githubusercontent.com/magicrew/doc7/main/scripts/install.sh | bash
# Windows PowerShell
irm https://raw.githubusercontent.com/magicrew/doc7/main/scripts/install.ps1 | iex
然后本地起一个视觉模型(LM Studio 或 Ollama),直接:
doc7 report.pdf
首次运行会自动发现本地模型端点并保存配置。也支持远程 OpenAI 兼容接口,但会明确提示内容会离开本机。
同一个二进制还提供交互式 CLI、批量处理、MCP、Go SDK 和异步 HTTP 服务,扩展性不错。
成本与隐私上的优势
doc7 本身不按页收费,也不绑定任何文档处理服务。你用自己的硬件跑量化多模态模型,边际成本主要是电费和机器时间。适合大批量、重复处理,或者对隐私敏感的场景(本地/私有端点即可)。

适合谁?
- 想把论文、报告、扫描件喂给 RAG / 知识库的人
- 需要保留公式、图表关系、UI 状态的复杂文档处理
- 希望尽量本地化、少付云端文档解析费用的团队
- 已经在用 Ollama / LM Studio,想顺便把文档能力补上的开发者
项目目前还比较早期(v0.1.x),但方向清晰:用视觉大模型统一处理“看文档”这件事,而不是堆一堆专用小模型。MIT 协议,可放心试用。
数据统计
相关导航


iFixit

大盘云图

MCP Containers

Ghost Font

imgTu

GlooMaps










