Qwen + MinerU MinerU+ OpenAI GPT Latest OpenAI GPT Latest+ GLM + Python+ PDF+ PowerPoint (.pptx)+ deepseek-v4-flash-vision-exp

双轨文档解析:文本轨道保留原生结构,视觉轨道用VLM整体理解复杂页面,统一为层级记忆模式

MinerU做文本轨道原始提取,视觉轨道渲染页面交VLM理解,两轨输出同一chunk与元数据模式,下游检索与格式无关

✓ 复杂脏PDF无需精确逐元素提取✓ 模型无关可换其他VLM供应商 ✕ 视觉轨道依赖前沿VLM能力✕ 推荐模型为实验性版本

方案简介

Knowhere 的 Document Parsing 2.0 是一套 Vision + Text 双轨文档解析方案,把复杂、脏乱的文件转化为可供 AI Agent 使用的持久化、可导航记忆。传统 OCR / Document Intelligence 流水线要求在模型理解文档前先完成每个元素的精确提取,在脏 PDF 和幻灯片上,阅读顺序、布局、表格或隐藏文本层的错误会不断累积成不可靠的模型上下文。Knowhere 不把完美的逐元素提取作为检索的前提:Text Track 在文本原生可靠的地方保留精确文本和原生结构;Vision Track 用前沿视觉模型把页面或幻灯片作为整体来理解,视觉复杂的内容无需先重构每个元素也能被召回和理解。两条轨道汇聚到同一套记忆模式(memory schema)、层级、检索引擎和引用模型,输出天然适配 Agentic RAG、向量 RAG 或任何 LLM 工作流。

亮点与能力

  • 双轨一套契约:两条解析路径产出相同的 chunk 和元数据模式,下游存储、层级、图构建和检索与格式无关
  • 无需脆弱重构即可召回:即使 OCR 或布局提取无法可靠恢复每个组件,页面也可通过摘要、实体、源文本和层级被索引
  • 一套可导航记忆:文本章节与视觉理解的页面成为兼容的层级节点,带源证据、关联资产和跨文档关系
  • 超长文档支持:解析流水线可处理数百页(如 300、500 页以上)的长篇 PDF
  • 图集类文档路由:技术图集或图纸集合通过专门的布局感知解析器处理
  • 源可追溯:结果保留到文档、章节、源页面和相关资产的连接

组成与分工

  • MinerU:V1 chunk 流水线的默认原始 PDF 提取器
  • Vision Page:V2 API 的视觉轨道,渲染源页面并结合视觉解释、文档画像与 TOC 结构,组装以页面为锚的层级节点
  • deepseek-v4-flash-vision-exp:官方推荐的统一模型,接受文本和图像输入,可处理摘要、层级推理、页面理解和资产描述
  • OpenAI / Qwen / GLM / Volcengine:可选替代模型供应商,Knowhere 保持模型无关
  • Python:项目运行环境

使用与配置要点

轨道选择规则

通过 V2 Jobs API 上传的 PDF 和 .pptx 走 Vision Track;其他支持的格式走 Text Track。两条轨道的差异在于如何理解源文档,而不在于 Agent 如何消费产出的记忆。

模型配置

推荐使用 deepseek-v4-flash-vision-exp 作为 Text 和 Vision 工作负载的统一模型;也可以使用来自 OpenAI、Qwen、GLM、Volcengine 或任何兼容供应商的另一个模型,或分别指定 Text 与 Vision 两个模型。

V1 与 V2 差异

MinerU 在 V1 chunk 流水线中仍是默认原始 PDF 提取器;V2 不再把解析器生成的 Markdown 当作唯一事实来源,而是渲染源页面、结合视觉解释与文档画像和 TOC 结构来组装页面锚定的层级节点。

注意事项与常见问题

  • 推荐模型 deepseek-v4-flash-vision-exp 目前是实验性的(experimental),生产使用需自行评估
  • 视觉轨道的效果取决于前沿视觉模型对整页的理解能力,模型可替换以适配需求
  • V1 与 V2 的解析路径不同:V1 依赖 MinerU 提取的 Markdown,V2 以页面渲染 + 视觉理解为准,迁移时注意事实来源的变化

优缺点

  • ✓ 复杂脏PDF无需精确逐元素提取
  • ✓ 模型无关可换其他VLM供应商
  • ✕ 视觉轨道依赖前沿VLM能力
  • ✕ 推荐模型为实验性版本

出处

本方案挖掘自开源项目 Ontos-AI/knowhere,方案内容与实施命令均来自其 README 原文。

方案出处
Ontos-AI/knowhere:Knowhere extracts, parses, and outputs structured chunks ready for AI Agents and
2974 star Knowhere extracts, parses, and outputs structured chunks ready for AI Agents and RAG.

本方案由真实开源项目挖掘整理,实施命令均来自其 README 原文,安装使用请遵循项目开源协议。