GIST smart sampling

GIST(Greedy Independent Set Thresholding)是 google-research-blog 提出的訓練資料 subset selection 方法:在完整資料集太大、訓練成本太高時,先選出較小但仍高資訊量的資料子集。它處理的核心衝突是 diversity 與 utility:只追求多樣性可能選到不相關資料,只追求效用又可能選到高度重複的資料。

核心方法

  • 先固定 diversity 門檻:把資料點視為 graph;距離太近的點相連,代表不能同時進入同一子集。
  • 近似 maximum independent set:在每個距離門檻下,用 bicriteria greedy algorithm 選出高 utility、低重複的資料點。
  • 跨門檻找 sweet spot:逐一測試可能的距離規則,選出兼顧 coverage 與 usefulness 的子集。
  • 保留理論下限:來源主張 GIST 至少可達最優解價值的一半,且 subset selection runtime 相對完整訓練成本可忽略。

對 AI Ark 的判準

GIST 補強 sequential-attention-subset-selection:Sequential Attention 問的是「模型或特徵結構中哪些 component 值得保留」;GIST 問的是「訓練前哪些 data points 值得保留」。兩者都把效率問題改寫成 subset selection,但 GIST 位於資料層,適合在模型訓練、資料縮減、benchmark sampling 或推薦系統 coverage 場景使用。

Ponytail 判準:資料量太大時,不要先加更貴的訓練 pipeline;先問能不能用 diversity + utility 的 sampling 規則刪掉冗餘資料。若任務是 agent trace / eval 資料集,也應先保留失敗型態與情境多樣性,再追求樣本數。