Sequential Attention subset selection

Sequential Attention 是 google-research-blog 提出的模型結構最佳化方法:把 feature selection、embedding chunk selection、weight block sparsification 等大型模型效率問題,統一視為 subset selection。傳統 greedy selection 需要反覆重訓或重算 marginal gain;Sequential Attention 則把選擇過程放進單次模型訓練,用 attention score 逐步挑出下一個最有邊際價值的 component。

核心方法

  • 逐步選擇,不是一口氣排序:standard attention 同時替所有候選打分;Sequential Attention 會根據已選集合重新估計剩餘候選的重要性,比單點 ranking 更能處理高階非線性互動。
  • 用 attention score 當便宜 proxy:模型在每一步計算未選特徵的 attention weight,把最高者加入 subset,避免昂貴的 explicit marginal gain 計算。
  • 延伸到結構化 pruning:SequentialAttention++ 把 differentiable pruning 與 combinatorial optimization 接起來,選出可整塊移除的 weight blocks / channels,讓 sparsity 更容易在 GPU / TPU 上轉成實際 latency 與 memory gain。

對 AI Ark 的判準

這個概念補強 frozen-multi-token-prediction 與 model-harness-fit:模型效率不只來自更快 decoding 或更便宜模型,也來自訓練/壓縮階段對結構冗餘的可解釋刪減。Ponytail 判準是:不要先加 serving cache、agent router 或更大模型;若瓶頸在模型 footprint / inference latency,先問能不能用 structured pruning、feature selection 或硬體友善 sparsity 解掉。

它也和 nested-learning-continual-learning 相鄰:Nested Learning 把 architecture、optimizer、memory 的更新頻率抽象化;Sequential Attention 則提供較窄但可操作的子問題——在固定任務與效率目標下,哪些 component 值得保留。

gist-smart-sampling 則把同一個 subset selection 問題移到資料層:訓練前先選出兼顧 diversity 與 utility 的 data points,而不是在模型結構內選 features / blocks。兩者的共同判準是先刪冗餘、保留可解釋選擇訊號,再投入更大的訓練或 serving 成本。