PDF → Markdown
抽取文字与标题层级,输出整洁的 Markdown。
点击选择或将 PDF 拖入此处
完全在你的浏览器中处理,文件不会上传
大部分人要 Markdown 是为了后面那一步:喂给 AI 当上下文、粘进 Obsidian、或者塞进文档仓库好做 diff。可 PDF 里直接复制粘贴,标题和正文会被压成一锅粥,所以得先把结构猜回来——按字号、字重和位置判断哪行是标题、哪行是段落。这是「启发式」档,纯规则,不联网。切到「AI 增强」,我会把浏览器里已经提取好的纯文本交给 DeepSeek 再理一遍层级,发出去的只有文本,原始 PDF 不动。
上限 200MB,免费和 Pro 是同一个数。不是我大方,是这个工具本来就不吃内存:pdf.js 按需读页,峰值基本不超过文件自身大小,没有往下卡的理由。代价是它只认字——表格容易散架,公式不出 LaTeX,图片不提取。未经 OCR 的扫描件转出来是空文件,那种先过一遍站内的 OCR。
常见问题
pdf 转 markdown 有文件大小限制吗?免费和 Pro 一样吗?
上限 200MB,免费和 Pro 同一个数,不分档。站内确实有工具的 Pro 能提额——那些要把整个 PDF 读进内存重排,内存是真瓶颈。这个不用:文本提取是按需读页,峰值内存约等于文件本身,没必要卡低。200MB 以内页数也不重要,六百页的手册只是慢一点。
转换时文件会上传到服务器吗?AI 增强档也不上传?
启发式档整个过程在标签页里跑,pdf.js 读文件、生成 Markdown、给你下载,断网也能用,和站内其他工具一样可以自己验证。AI 增强档不同:我会把已经在本地提取出来的纯文本发给 DeepSeek(UI 上就写着「DeepSeek · 每天 5 次免费」),发出去的是文本,不是原始 PDF。合同、简历这类连文字都不想出门的,就留在启发式档。
扫描件 PDF 能转成 Markdown 吗?
看它有没有文字层。不少扫描件在扫描仪或 Acrobat 里跑过 OCR,内部已经存了可选中的文字,这种能转,只是标题层级识别通常粗一些。未经 OCR 的扫描件对 pdf.js 来说就是一堆图片,一个字也提不到,结果是空文件。遇到这种先去站内 OCR 页 做出文字层,再回来转 Markdown。
表格、公式和图片能保留吗?
基本不行,这是它最明显的短板。表格在 PDF 里只是按坐标摆好的文字,没有行列信息,规整有框线的简单表格偶尔能拼对,合并单元格、无框线、跨页的表格多半散架。公式不会还原成 LaTeX,出来是拆散的字符。图片完全不提取。真在意表格结构的,转完还得手工校对一遍。
「启发式」和「AI 增强」该选哪个?
先试启发式:按排版规则判断,快、不联网、页数多也不额外花钱,排版规整的报告、论文、说明书通常够用。如果原文标题和正文字号几乎一样、或者层级识别得很乱,再切 AI 增强,让 DeepSeek 对着提取出的文本把结构重排一遍,每天 5 次免费。它不保证更准,只是换个思路再猜一次。