Document-Parsing-First RAG

RAG 的瓶頸不一定在模型或 vector search;對複雜文件,最先該查的是 parsing 是否保留了文件結構。AIHAO 導讀 LlamaIndex《Beyond RAG》工作坊,把 RAG pipeline 拆成解析、chunking、index、retrieval、reranking、synthesis 與維運,主張錯誤若在上游丟失表格、圖表、欄位或閱讀順序,後面換模型與調 prompt 只是在錯誤資料上最佳化。

可重用的 failure taxonomy

  • Parsing:多欄交錯、表格失去列欄、註腳混入正文、圖表被跳過、頁首頁尾污染、跨頁順序中斷。
  • Chunking / consolidation:chunk 粒度與問題不匹配,或 rerank、去重、截斷時把分散在多個 chunk 的答案丟掉。
  • Retrieval:召回不到、排序不對、需要多跳或多來源;可用 reranking、query rewrite 或受控的 agentic loop,但先用 eval 證明值得增加延遲。
  • Synthesis:context 已正確卻抽取錯誤,或輸出格式不符合契約;應把 schema、引用與驗收條件寫進測試。
  • Operations / safety:備援路徑未測、成本無上限、來源變動未追蹤、retrieved content 被當成可信指令,或權限沒有跟著 chunk 傳遞。

這個分層可接到 agentic-search-tool-curation:先判斷錯誤屬於資料結構、查詢/召回還是合成,再選 grep、metadata filter、BM25、vector、rerank 或 agentic retrieval,而不是把所有失敗都歸因於 embedding。

文件先行的 pipeline

  1. 保留 spatial text 或其他可回溯的版面資訊,讓表格、區域、頁碼與 bounding box 可在下游重建。
  2. 先輸出結構化 Markdown 或 typed data,再沿標題、表格、圖表與註腳邊界做 chunking。
  3. 把 parser 版本、來源、頁碼、section path、權限與 confidence 放進 metadata,支援引用、過濾與重播。
  4. 依問題形狀路由:散文走 retrieval;篩選、排序、聚合走 SQL/JQ 等 query;圖表用 caption 做召回、原圖做合成。
  5. 只在 eval 顯示長尾、多跳或高風險失敗時,加入 reranking、CRAG、平行子查詢或更昂貴的視覺解析。

這個順序補強 agent-ready-data-governance:資料治理不只要讓 agent 讀到內容,也要保留足夠的結構、來源、權限與版本,讓結果能被判斷與追溯。

Eval 與採用邊界

文件解析要用語意正確性評估,而不只是文字重疊率;可分開測表格結構、圖表數值、文字完整性、樣式結構與 grounding。RAG 端則至少保留 faithfulness、relevancy、recall、長尾題庫、延遲與成本,並把 parser/index/prompt/schema 版本化。這使 eval-is-spec 成為採用新 parser 或新 retrieval loop 的 gate,而不是上線後才看答案好不好。

這不是所有任務都需要的複雜架構:單一文件、單次問答可先用簡單函式;只有在文件型別複雜、答案需跨來源、要持續更新、需要人工審查或錯誤代價高時,才值得建立可觀測的文件工作流。LlamaIndex 的 ParseBench 與產品數字屬 vendor-adjacent evidence,應回查公開資料並在自己的語料與任務上重跑。

PDF 轉 Markdown 的文件路由與驗收 gate

BusinessNext 的 PDF 工具整理把「先處理文件,再讓模型回答」落成可執行的路由:先逐頁確認文件是文字型、掃描型或混合型;有文字層的 PDF 可先用 pdf-inspector,Office 檔案可用 Microsoft MarkItDown,掃描件、多欄與複雜版面則需要具 OCR 與 layout analysis 的 Docling。這三者的能力、授權、隱私與效能說法是文章與專案方的 attributed claims,不應直接當成跨工具 benchmark。

轉檔不是終點。送進 ChatGPT、Claude 或 NotebookLM 前,至少抽查跨頁表格、合併表頭與財報等式,並要求輸出標明數字所在列與年度;找不到的值直接回報,不要推算。對 AI Ark 而言,這把 document-parsing-first-rag 的上游 parsing failure 具體化成 eval-is-spec 的驗收項目,也延伸 agent-ready-data-governance 的來源、結構、版本與人工確認 gate。

實務上,工具選擇還要把檔案大小、是否需下載模型、CPU/記憶體、OCR 語言與本機資料邊界納入 metadata;瀏覽器 demo 的 25MB 限制或本機 OCR 的硬體門檻,都應在 workflow 入口先判斷,而不是等模型產生錯誤答案後才追查。

相關頁面