
Dolphin文档解析模型实测0.3B轻量架构如何3步跑通页面级解析【免费下载链接】DolphinThe official repo for “Dolphin: Document Image Parsing via Heterogeneous Anchor Prompting”, ACL, 2025.项目地址: https://gitcode.com/GitHub_Trending/dolphin33/Dolphin想把一堆扫描PDF变成可编辑的Markdown靠人工复制粘贴得耗上大半天用 Dolphin 文档解析模型一个目录就能一条命令批量解析完。仓库核心是 0.3B 参数的多模态解析模型v2 版本升级为 3B页面级、元素级两种粒度都支持读完你能在 3 分钟跑通第一条推理命令。项目速览它是什么ACL 2025 论文《Document Image Parsing via Heterogeneous Anchor Prompting》的官方代码与模型仓库解决什么文字、公式、表格、图表混排的文档页直接转成结构化 JSON 和 Markdown适合谁做文档数字化、RAG 知识库搭建、批量内容处理的开发者Dolphin 走的是分析-解析两阶段路线第一阶段按自然阅读顺序列出页面里的所有元素第二阶段对每个元素并行解析。不同元素类型匹配各自的锚点提示异构锚点提示表格、公式、正文各走各的逻辑这也是它轻量却专业的关键。快速上手3分钟跑通的最短路径三步走克隆仓库装依赖依赖清单见 requirements.txt、下载预训练模型、对仓库内置样例页跑一次解析。git clone https://gitcode.com/GitHub_Trending/dolphin33/Dolphin cd Dolphin pip install -r requirements.txt git lfs install git clone https://huggingface.co/ByteDance/Dolphin-v2 ./hf_model python demo_page.py --model_path ./hf_model --save_dir ./results --input_path ./demo/page_imgs每页的解析结果以 JSON 和 Markdown 两种格式落在./results目录。git lfs 方式下载失败时README 里给了 HF CLI 的替代命令可直接照抄。核心能力页面级解析整页PDF直接变Markdown场景一整目录的论文 PDF 要灌进向量库。原理模型先看完整页、按阅读顺序列出元素序列再逐个并行解析。效果--input_path直接传目录或 .pdf 文件多页 PDF 不用手动拆页输出即可被下游流水线直接消费。元素级解析表格公式单独抠出来场景产品文档里截了一张表格图你想变成可编辑表格。原理不同元素类型匹配专用锚点提示各走专门解析逻辑源码见 demo_element.py。效果--element_type支持 table、formula、text、code 四类单张表格图输入即可得到结构化结果。布局解析阅读顺序一次排对场景双栏论文按从左到右硬读会乱序。原理demo_layout.py直接输出元素位置与自然阅读序列源码见 demo_layout.py。效果阅读顺序错误率Edit越低越好从初代的 0.124 降到 v2 的 0.054。0.3B轻量架构低配环境也能跑场景机器显卡不算顶配只想先把解析流程跑起来。原理0.3B 参数加上并行解析机制模型基于 Hugging Face Transformers 加载集成成本几行代码。效果不用高端卡起步Dolphin-1.5 在 OmniDocBench 上的总分已达 85.06。数据验证官方 OmniDocBench (v1.5) 基准实测数据来自 README模型参数总分↑文本Edit↓公式CDM↑表格TEDS↑阅读顺序Edit↓Dolphin0.3B74.670.12567.8568.700.124Dolphin-1.50.3B85.060.08579.4484.250.071Dolphin-v23B89.780.05487.6387.020.054同样是 0.3B 架构1.5 版本总分从 74.67 提到 85.06文本错误率约降 32%v2 升到 3B 后表格 TEDS 再上 87.02。下面是仓库 demo 集里的输入样例解析后的结构化结果对应落在./results场景实战批量转换整目录文档转Markdownpython demo_page.py --model_path ./hf_model --save_dir ./results \ --input_path ./demo/page_imgs --max_batch_size 8核心参数--max_batch_size控制并行元素解码数量显存吃紧时降到 4。单元素解析表格图片转结构化数据python demo_element.py --model_path ./hf_model --save_dir ./results \ --input_path ./demo/element_imgs --element_type table--element_type四选一table|formula|text|code注意输入必须是单个元素图不是整页。布局体检只查元素位置与阅读顺序只想看懂页面结构时用python demo_layout.py --model_path ./hf_model --save_dir ./results --input_path ./demo/page_imgs/page_1.png输入单个 PDF 时直接把 .pdf 传给--input_path即可。避坑速查元素级解析结果很怪→ 原因把整页图喂给了元素级接口它只吃单元素图 → 解法整页走demo_page.py元素级先裁剪出单元素再指定--element_type table。推理中途显存溢出→ 原因--max_batch_size偏大导致并行解码占显存 → 解法把示例值减半改用--max_batch_size 4重跑。模型下载失败或拉到空文件→ 原因git lfs 未生效或网络问题 → 解法pip install huggingface_hub后执行huggingface-cli download ByteDance/Dolphin-v2 --local-dir ./hf_model。多页PDF纠结要不要先拆页→ 原因页面级解析本来就支持 PDF 直输 → 解法--input_path直接传 .pdf例如仓库内置的./demo/page_imgs/page_6.pdf。一句话收尾Dolphin 文档解析把页面级、元素级、布局三件事收敛成三条现成命令0.3B 起步的低配门槛结果可直接喂给下游流水线。遇到解析翻车的坏案例项目正在 issue 区公开征集欢迎直接去贴出来一起修更多更新日志见 README_CN.md。【免费下载链接】DolphinThe official repo for “Dolphin: Document Image Parsing via Heterogeneous Anchor Prompting”, ACL, 2025.项目地址: https://gitcode.com/GitHub_Trending/dolphin33/Dolphin创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考