Groundsource News-to-Data Extraction
Groundsource 是 google-research-blog 提出的 news-to-data extraction 方法:用 Gemini 從全球新聞、政府報告與地方公告中抽取災害事件,轉成含時間、地點與分類的結構化資料。第一個公開應用是 flash flood dataset,涵蓋 150+ 國家、2000 年至今、約 260 萬筆事件。
方法
- 先篩選以 flooding 為主要主題的報導。
- 用 Google Read Aloud user-agent 抽取 80 種語言的主要文字,再用 Cloud Translation API 標準化成英文。
- 用 Gemini 做三層驗證式抽取:分類是否為真實洪災、把相對時間錨定到發文日期、把街區/街道等細粒度地點對齊到標準地理 polygon。
- 以人工審查與既有 GDACS 等資料做 spatiotemporal matching,確認抽取結果是否足夠實務使用。
為什麼重要
對 media-monitoring 與 aiark-loop-engineering 來說,Groundsource 提供一個可重用模式:媒體監測不只產出摘要,也可以把非結構化報導轉成可驗證的事件資料。它也提醒 agent-ready-data-governance:LLM 抽取出的資料必須保留來源、時間推理、地理標準化與人工驗證門檻,否則只是把新聞噪音放大成資料庫噪音。
Ponytail 判準
不要先做通用「所有新聞轉資料」平台。先選一種事件、一個固定 schema、一組人工驗證樣本與一個 baseline archive;只有 precision / coverage 明確勝過人工或既有資料庫時,再擴到其他事件類型。