Tabular Foundation Models
Tabular foundation models 指把表格分類、回歸等傳統機器學習任務,改成可用預訓練模型 zero-shot / in-context learning 處理的模型類型。Google Research 的 TabFM 把訓練列與待預測列作為同一個上下文輸入,目標是減少每個新資料集都要重訓、調參與手工特徵工程的成本。
方法重點
- 表格不是文字序列:表格是二維且行列順序通常不改變語意,因此需要同時處理 row / column 關係。
- 行列交替 attention:TabFM 先在 row 與 column 維度交替 attention,捕捉特徵交互與樣本關係。
- Row compression:再把每一列壓成 dense vector,讓後段 Transformer 對壓縮列向量做 in-context learning,降低計算成本。
- Synthetic table pretraining:由於企業表格常涉及專有 schema 與敏感資料,TabFM 用 structural causal models 產生大量合成表格做預訓練。
對企業 AI 的意義
這個方向把 tabular ML 從「資料科學專案」推向「平台內建預測能力」。Google Research 提到 TabFM 將整合進 BigQuery,讓使用者用 AI.PREDICT SQL 指令做回歸與分類;這和 agent-ready-data-governance 相連,因為企業資料若已有清楚 schema、權限與流程語意,agent 或 analyst 就能把預測任務接到日常資料工作流,而不是每次重開一個模型訓練專案。
風險與檢核
- Zero-shot convenience 不等於免驗證;仍需要 eval-is-spec 式的任務級 eval 檢查商業指標與錯誤成本。
- 合成資料預訓練能降低資料取得問題,但真實企業資料分布、缺值、偏誤與敏感欄位仍要做治理。
- 如果預測結果要驅動 agent 行動,必須接到 loop-engineering 的 human review、rollback 與 observability。