Agentic Search Tool Curation

Agentic Search Tool Curation 指的是:不要把 grep、BM25、向量檢索、programmatic/file-based retrieval 當成單一答案,而是依照語料訊號、查詢型態、harness 與回饋機制,策展出一組可切換的檢索工具。

核心判斷

  • 高訊號字串(code symbol、log、日期、人名、ID)→ grep / BM25
  • 混合訊號文件 → hybrid retrieval
  • 低訊號語意 → vector retrieval
  • 使用者其實在操作資料欄位、分類、時間、權威性或多樣性時 → 先做 query understanding 與結構化條件,再把 vector search 放在 fallback / rerank 位置
  • 迭代式 agent → 工具選擇比單一檢索演算法更重要

文章帶出的重點

  • harness 影響可能大於檢索演算法本身
  • inline 回傳和 file/programmatic 回傳會改變工具效果
  • 不是「向量已死」,而是要把檢索工具放進可觀測、可迭代的 loop

AIHAO 轉述 Doug Turnbull 的 RAG 文章補上另一個邊界:許多 RAG 失敗不是 embedding 模型不夠好,而是把資訊架構、資料欄位與使用者 affordance 全壓成單一相似度分數。較穩的做法是先用 LLM 做 query understanding,把自然語言轉成分類、材質、時間、來源、權威性、多樣性等可解釋條件;vector search 用於無法結構化的模糊部分,而不是整個搜尋系統的第一選擇。這也讓 agentic-rag-cross-corpus 的 sufficient-context loop 更有操作面:agent 需要多元、可修正的搜尋訊號,才知道下一輪該改查什麼。

Deep Research 的來源策展與查證 gate

BusinessNext 對 ChatGPT Deep Research 的整理補上一個研究型 agent 的最小 gate:先區分 Search(快速事實)、Thinking(推理加強)與 Deep Research(多步驟跨來源探索),再依任務需要限制可信網域、連接私有文件與指定來源標準。這不是把所有搜尋都升級成深度研究,而是讓來源權威性、時間範圍、涵蓋/排除條件成為可檢查的 query specification。

文章也要求研究完成後逐條點開引用、核對數據發布日期,並對「第一、首創、歷史新高」等高風險主張回到一手資料與第二來源交叉確認。這使 source curation 不只是搜尋前的白名單,而是延伸到報告輸出的 citation verification loop,並與 agent-trace-observability、prompt-debugging-eval-checklist 的 review gate 相連。

對 wiki / loop 的意義

這個概念和 loop-engineering、agent-trace-observability、agentic-rag-cross-corpus 都指向同一件事:AI 系統要靠可回饋的流程選工具,而不是先賭單一檢索法。

Filesystem 的完整性與失敗訊號

AIHAO 2026-07-25 的 Agent Harness 導讀補上一個檢索工具的評估問題:工具不只要能被重複呼叫,還要在成功與失敗時提供可信的進度訊號。Grep 對高訊號字串的優勢不只是簡單或熟悉,而是能回傳範圍內 pattern 的完整出現位置;零結果也是「在此範圍與 pattern 下確認沒有」的硬訊號,能直接引導 agent 改關鍵字、放寬 pattern 或調整目錄。相較之下,RAG 回傳相似但不對的 chunk 時,agent 往往無法判斷是 query、切塊或 embedding 出錯。

這不代表 filesystem 永遠取代 RAG。該導讀把選擇放回 LLM × Harness × Data × Task:code 的語義切分、索引新鮮度、權限與任務型態都會改變最佳方案;企業場景仍可能需要 metadata filter、BM25、vector、rerank、graph 與 ACL 的 hybrid stack。可重用的判準是檢查工具輸出是否能讓下一輪行動更確定,而不是只比較單次 top-k 命中率。

先查文件解析,再選檢索工具

AIHAO 2026-07-26 導讀 LlamaIndex《Beyond RAG》工作坊,補上一個更上游的 failure gate:多欄、表格、圖表、註腳與跨頁順序若在 parsing 時遺失,後面的 chunking、retrieval、reranking 與 synthesis 都可能在錯誤資料上運作。這使 document-parsing-first-rag 成為工具策展的前置判斷:先確認資料結構與 metadata 是否保留,再決定使用結構化 query、BM25、vector、rerank 或 agentic loop。

來源也提醒,agentic retrieval 不是無條件升級;CRAG、query rewrite 與多跳迴圈應只在長尾、多跳或高風險失敗能由 eval 證明改善時加入,並設 token、延遲與 trace gate。這延伸 agentic-rag-cross-corpus 的 sufficient-context 思路,也把文件解析、檢索與合成的錯誤責任分開。

AI Search Frontier:先做基本盤,再加 agentic loop

AIHAO 2026-08-25 整理 Trey Grainger 與 Doug Turnbull 的《The New Frontier of AI Search》,把「AI 搜尋」同時分成使用者直接搜尋與 agent 背後執行的 agentic search;兩者共用檢索、排序與相關性基礎。來源的 18 題清單提供的是技術成熟度與採用順序的導覽,不是獨立 benchmark;可重用的主線是先完成 hybrid search、行為訊號與成本控制,再依任務加入更昂貴的 agentic 或 neural retrieval。

Hybrid 是基本盤,不是前沿

文章用 BM25 的精確詞彙命中與 dense vector 的語意召回對照,主張兩者應透過 reciprocal rank fusion(RRF)或類似方法合併,而不是把 pure vector search 當成預設答案。Sparse 到 dense 是一條連續光譜:可先用 lexical/BM25 召回,再用 dense embedding、cross-encoder 或其他 reranker 重排;中間也可以放 term expansion、SPLADE、learning to rank 與 late interaction。這延伸既有 document-parsing-first-rag 與 agentic-rag-cross-corpus 的採用順序:先釐清資料結構與查詢形狀,再用 eval 決定是否值得增加 retrieval loop。

Agentic search 的價值是保留補救機會

傳統 RAG 把 query construction、搜尋與 synthesis 串成一次性的直線;agentic search 則讓 agent 知道搜尋是可呼叫的工具,能在查詢、搜尋、結果評估之間反覆改寫 query,並在評估節點加入護欄。這和 agentic-rag-cross-corpus 的 sufficient-context iteration 同方向,但不能把「有迴圈」直接當成品質保證:仍需用 eval-is-spec 檢查召回、延遲、成本與長尾失敗是否真的改善。

Reflected intelligence:先把使用者行為變成訊號

來源把點擊、加入購物車、購買與收藏視為搜尋系統的 feedback signals,並分成 signals boosting、learning to rank、collaborative filtering 與 knowledge graph learning。若已有足夠的行為資料,講者建議先做最簡單的 signals boosting:依熱門 query 的實際點擊對結果加權,因為它能直接利用領域使用者告訴系統「什麼是相關」。這是 agentic-search-tool-curation 的 Ponytail 判準:先修正資料與排序的基本盤,再考慮 wormhole vectors、hypencoders 等研究階段技術。

行為回饋也會產生 presentation bias:模型只展示少數結果,使用者只會點那些結果,下一輪模型又只學到已展示的內容。Active learning 的角色不是單純追求 exploitation,而是找出訓練資料缺少的區域,主動補 exploration;這應與 agent-trace-observability、人工標註與 eval-is-spec 的資料分布檢查相連。

LLM judge 必須拆成校準迴圈與最佳化迴圈

當排序結果缺少人工標註時,LLM judge 可以提供即時訊號,但文章特別區分兩個迴圈:先用人工標註或行為資料檢查 judge 與人類的一致性,再用已校準的 judge 改善搜尋排序。跳過第一個迴圈直接最佳化,可能只是把系統調到迎合未校準的評分器;這個邊界補強 eval-is-spec 的 judge calibration 與 production feedback gate。

表示法與成本的選擇

Bi-encoder、late interaction 與 cross-encoder 可視為互動時機、表達力與成本的連續取捨:前者適合大規模初步召回,後者適合少量候選重排,中間的 late interaction 保留 token-level matching 但要承擔多向量索引成本。多模態搜尋與 ColPali 類方法則把 PDF 頁面 patch、圖片與文字放進同一個 retrieval 問題;若文件版面在 parsing 時已遺失,後續多向量檢索仍可能只是在錯誤表示上最佳化。

文章也把 semantic knowledge graph 還原成可由 inverted index 與 forward index 走訪的領域訊號,搭配 pseudo relevance feedback(PRF)做 query expansion;它提醒通用 SPLADE 或 embedding 在離開訓練領域後可能產生 hotel、club、location 等雜訊。最後,embedding quantization 應以 index size、recall、rerank 後品質、延遲與吞吐量驗證,不能和 LLM weight quantization 混用同一套指標。上述技術成熟度與節省比例仍是演講與文章的來源歸屬,正式採用前應在自己的語料與任務上重跑。

Source revision:成熟度表與採用順序

AIHAO canonical page 後續將標題與內容更新為「AI 搜尋前沿技術總覽:哪些該做、哪些值得投入、哪些先知道就好」,並補上更明確的成熟度/採用表。相較於前一版,修訂版把 sparse/dense 強調為可逐步部署、逐步量測的光譜,而不是一次二選一;因此先做 hybrid search、signals boosting、embedding quantization 與 cross-encoder rerank,再依資料與風險投入 learning to rank、agentic search、semantic knowledge graph、已校準的 LLM judge 與 active learning。

這張表的可重用判準是「先做能直接改善自身語料與回饋訊號的基本盤,再用 eval-is-spec 證明更昂貴的 retrieval loop 值得加入」:有行為資料才做 learning to rank;LLM judge 先走人類/行為校準迴圈,再拿來最佳化;late interaction、multimodal search、SPLADE、semantic IDs、wormhole vectors 與 hypencoder 則依場景、資料量與索引成本決定,不應因為名詞新就先上線。來源提到的 75% 索引成本節省、recall 數字與講者成熟度仍是文章/演講 attribution,正式採用前要在自己的語料、延遲、成本與 agentic-rag-cross-corpus 任務上重跑。

相關頁面