Planetary Prediction Engine(PPE)

Planetary Prediction Engine(PPE) 是 Google Research 在 Google Earth AI 旗下介紹的 experimental research capability。它把自然語言的 geospatial predictive query,交給由 LLM 編排的資料發現、資料清理/整理、特徵工程、模型訓練、評估與報告生成流程;來源主張原本需要數週的人工資料工程,可縮短到數分鐘,但 PPE 仍是 early-stage research project,這些效能與 benchmark 結果都是 Google Research attribution,不等於獨立重現或可直接部署的證據。

最小架構

PPE 的核心不是單一 foundation model,而是把 geospatial modeling 拆成可交接的模組:

  1. Intelligent data selection:依預測問題尋找並選擇相關的地理空間資料與 covariates。
  2. Dataset curation:清理資料、處理資料缺口並完成 feature engineering,形成可供模型使用的資料集。
  3. AutoML & prediction:訓練、評估與最佳化預測模型,產出 predictions 與 final report。

每個階段由 LLM 作為 orchestrator,但階段之間以 well-defined inputs/outputs 交接。資料 artifact 使用 opaque handles 傳遞,而不是把完整資料序列化進下一個 LLM prompt;這是把大型中間結果移出 context window、降低上下文瓶頸的具體設計。這個模式可與 data-science-agents 的 Planner/Coder/Verifier/Router loop 對照,但 PPE 把資料型態從一般異質檔案推進到需要 spatial validation 的 planetary-scale data。

研究任務與報告結果

Google Research 以不同 machine-learning paradigms、地理區域與科學領域組成多維評估矩陣:

  • 美國公共衛生與環境 spatial regression:21 項 CDC health indicators 的平均 R² 為 76.8%,對照 manual expert pipeline 的 60.0%;FEMA national risk indicators 為 64.9% 對 60.0%,Social Vulnerability Index 為 66.2% 對 58.6%。
  • 奈及利亞 food security super-resolution downscaling:從 ADM1 省級資料下推至 ADM2 local government area,R² 為 66.1% 對 31.5% baseline。
  • 剛果民主共和國 Ebola nowcasting:五次連續每週預測中,Recall@10 為 83.3%,辨識 18 個新入侵 health zones 中的 15 個;相對發表的 Bayesian baseline 約 73%,絕對提升 10.3 個百分點。

這些數字只能說明來源報告的特定任務結果;評估 PPE 時仍需追問資料切分、地理泛化、時間外推、baseline 是否公平,以及是否有外部重現與真實決策成效。

Multimodal fusion 與 intelligent data selection

PPE 的可重用判準是把兩種互補訊號放在一起:

  • Structured statistical covariates 提供可解釋的顯式訊號。
  • Foundation model embeddings(例如 Population Dynamics Embeddings 與 AlphaEarth Foundations embeddings)提供從大規模預訓練資料學到的非線性地理空間表徵。

來源的 ablation 結果主張,multimodal fusion 加上 intelligent data selection 優於只用單一模態的 baseline。這不只是「再接一個模型」,而是讓 agent 先決定哪些資料值得進入任務,再把可追蹤的資料 artifact 交給後續預測流程;因此可連到 world-models 所強調的可更新世界狀態與預測層,也和 agent-ready-data-governance 的資料語意、權限與可驗證中間結果相接。

與既有研究 loop 的關係

PPE、empirical-research-assistance 與 discovery-loop 都採用相近的 問題/成功指標 → 搜尋或選擇資料 → 執行可計算產物 → 評估 → 回報或下一輪修正 抽象,但焦點不同:

  • ERA 偏 scientific coding 與跨領域 computational experiments。
  • Discovery Loop 偏把 research loop 作為公司與跨領域研究基礎設施。
  • PPE 偏 geospatial data discovery、spatial modeling 與 time-sensitive prediction,並把各階段的大型資料用 artifact handle 隔離於 LLM context 之外。

因此 PPE 是 data-science-agents 從資料分析 agent 延伸到地理空間預測的一個案例,不應被簡化成「LLM 自動跑 AutoML」;真正的工程難點在於資料選擇、空間泛化、任務級評估與中間 artifact 的交接。

AI Ark 的採用檢核

  • 先定義預測目標、時間 horizon、地理單位與成功指標,再決定是否值得自動化。
  • 將 data selection、curation、feature engineering、training、evaluation 與 report 分成可回查的階段,不把大資料直接塞入 prompt。
  • 同時保留 interpretable covariates 與 latent embeddings,透過 ablation 檢查融合是否真的提供增益。
  • 以 unseen geography、時間外推、data-scarce 區域與 failure cases 做 task-level eval;不要只採用 demo 或單一平均分數。可參考 eval-is-spec。
  • 高風險的公共衛生、糧食安全與災害決策仍需要領域專家、資料 provenance、人工覆核與 deployment gate;來源沒有證明 PPE 已取代這些責任。

相關頁面