Articles in Turing Academy cover three major themes: ESG Net Zero Laboratory, AI Laboratory and Lean Management Laboratory. We will share articles on related topics from time to time. We also welcome students who are interested in the above topics to submit articles and share them with you. Insights (I want to contribute)

MIT最新研究: 未見極端,先知危機!「η-Learning」AI演算法如何預測從未發生的超級風暴與災難?



科楠老師
2026-8-31


一、 當「百年一遇」成為常態:傳統 AI 在極端事件面前的致命盲點


    近年來,全球各地「百年一遇」、「千年一遇」的極端氣候事件頻率陡增:從瞬間摧毀城鎮的超強豪雨、海洋中無預警出現的瘋狂巨浪(Rogue Waves),到震撼金融體系的黑天鵝事件,人類社會正面臨著前所未有的極端風險考驗。在氣候科學與工程領域,準確預估這些極端事件的發生機率與強度,是建立災害早期預警、制定適應性防禦工程的重中之重。當前風靡全球的機器學習(ML)與深度學習模型,在面對「極端事件」時卻暴露出了極其致命的軟肋。傳統 AI 模型的預測能力高度依賴於「訓練數據」就像一個只看過平靜海面的人,無論模型參數再怎麼龐大,也無法憑空想像出高達數十公尺的瘋狂巨浪。


傳統數據驅動 AI 的兩大困境:


1.數據極度稀缺(Data Scarcity): 極端事件本質上就是低機率(Rare Events)。在有限的歷史觀測或數值模擬資料中,極端樣本往往極少,甚至完全為零。


2.「平滑化」與經驗風險最小化(ERM)的詛咒: 傳統 AI 普遍採用均方誤差(MSE)作為損失函數。為了追求整體平均誤差最小化,模型會傾向於「過度平滑(Smoothing)」,直接無視尾部的極端峰值,將極端事件抹平為溫和的常規現象。

 

如果我們無法在電腦裡透過高解析度物理模擬來產生極端資料(因為計算成本高昂到不可行),而在歷史觀測紀錄中又碰巧「從未遭遇過」這種強度的災害,難道 AI 就只能束手無策嗎?麻省理工學院(MIT)機械工程系與計算科學工程中心的 Kai Chang(張凱) 與 Themistoklis P. Sapsis 教授 團隊,在 2026 年 8 月的《Nature Communications》上發表了里程碑式的重磅研究。他們提出了名為 「極端事件感知學習」(Extreme Event Aware Learning,簡稱 η-Learning 或 e2a-Learning) 的全新學習範式,成功破解了這項困擾數據科學界多年的難題!


二、 破局之作:沒有極端數據,η-Learning 憑什麼能「預見未見」?


    η-Learning (η, 讀音:艾塔或是伊塔)的核心創新哲學非常直觀且深刻:「即使訓練數據中沒有極端事件,人類對系統極端行為的物理規律或統計先驗(Prior Knowledge)卻並非一片空白。」例如,物理學家與氣象學家雖然可能缺乏某些地區的高解析度豪雨觀測數據,但根據弱非線性漸近分析(Asymptotic Analysis)、白噪聲近似、吉布斯假設(Gibbs Hypothesis),或是廣義極值分布理論(GEVD),我們對「極端事件應該遵循什麼樣的尾部統計規律」擁有相當明確的理論知識。


η-Learning 的雙重驅動核心:


    η-Learning 將模型訓練轉化為一個兼顧「局部數據契合」與「全域尾部統計一致」的雙目標優化問題:


1.常規區域依賴數據(Supervised Data Fit): 在資料充足的常規(非極端)區域,繼續利用經驗風險最小化(ERM)學習輸入與輸出之間的精細對應關係。


2.極端區域依賴統計先驗(Statistical Regularization): 在資料匱乏甚至零資料的極端尾部區域,強制約束模型產出的觀測量分佈,使其嚴格符合預先給定的極端統計律 ν₀。

 

這種設計讓 η-Learning 展現出驚人的能力:它不需要在訓練集中看過特定的極端事件,就能在推理階段(Inference Time)自動激發出物理上高度合理、統計上一致、且從未在歷史數據中出現過的全新極端情境!


三、 理論數學心法:最優傳輸(Optimal Transport)與 1-Wasserstein 距離


    為了賦予 η-Learning 嚴謹的數學基礎,MIT 團隊引進了數學領域的最優傳輸理論(Optimal Transport, OT)。假設系統的輸入為 X ~ μ(例如低解析度氣候場或初始條件),真實的系統狀態映射為 u(x),而我們關心的純量觀測量為 g(u(x))(例如全區最大降雨量或最高浪高)。模型的目標是找到一個估計器 yη 或 uη。


1. 為什麼選擇 1-Wasserstein 距離?


    在統計學中,比較兩個機率分佈的差異有許多指標,如著名的 KL 散度(Kullback-Leibler Divergence)。但在極端事件預測中,KL 散度有致命缺陷:當極端事件發生機率極低(例如 10⁻⁴)時,KL 散度的權重會被嚴重壓縮;若模型初始預測完全沒涵蓋極端區域,KL 散度甚至會直接數值發散(Divergence)。相對地,1-Wasserstein 距離(W₁) 直觀上代表「將一個機率分布搬運變形為另一個分布所需的最小幾何成本」。其定義為:

 

W₁(ν₁, ν₂) = infγ ∈ Π(ν₁, ν₂) ∫ ||y₁ - y₂|| dγ(y₁, y₂)

 

W₁ 距離具備極佳的幾何連續性與穩定性。即便模型一開始完全產出不了極端值,W₁ 也能提供明確且強大的梯度訊號,拉動模型的預測分佈向極端尾部延伸。


2. 破除數據限制的硬核定理 (Theorem 4 & 7)


    論文在理論上證明了著名的「數據稀缺局限定理(Theorem 4)」:證明傳統的數據一致性估計器(如 MSE)在數據缺乏極端樣本時,其產出的推導分佈與真實分佈之間必定存在無法消除的 W₁ 下界誤差。隨後,團隊推導出 Theorem 7 與 Theorem 10(最優性定理),證明了在 η-Learning 損失函數中加入 W₁ 正則化項,其本質上緊密等價於最小化極端區域 E 內的期望估計誤差 ∫E |yη - y| dμ!這在數學上確保了 η-Learning 在控制尾部誤差上的最優性(Optimality)。

 

四、 演算法巧思:IICT 架構如何破解計算瓶頸?


    在實際高維度的神經網絡訓練中,計算 W₁ 距離通常需要巨大的記憶體與算力。為了讓 η-Learning 能應用於真實世界的大規模氣候模型,MIT 團隊設計了 IICT(Inference-Informed Continual Training,推論知情持續訓練)演算法:

 

 

五、 實戰驗證:美國大陸 25 年豪雨降尺度的驚人表現


    為了驗證 η-Learning 的威力,研究團隊進行了多項極具挑戰性的實驗,其中最引人注目的莫過於「美國大陸氣候降尺度(Precipitation Downscaling)」實測。


1. 氣候科學的真實痛點


    在氣候變遷研究中,全球氣候模型(Low-Resolution, LR)可以模擬數十年甚至上百年的長期趨勢,但解析度非常粗糙,無法捕捉局部的極端暴雨;而高解析度(High-Resolution, HR)的衛星與地表觀測資料雖然精細,但歷史紀錄往往非常短暫(可能只有幾個月或幾年)。


2. 極限對比實驗與結果


    團隊使用了歐洲中期天氣預報中心(ECMWF)的 ERA5-Land 美國大陸 25 年(1999–2023)每小時降雨資料。研究人員刻意設定了一個極端的數據稀缺環境:


•訓練集: 僅提供 0.5 年(半年) 的高解析度降雨數據對(且不包含任何超過 150 mm/day 的超強豪雨)。


•測試任務: 將 25 年的低解析度氣候模擬資料,超解析度降尺度為高解析度豪雨預測場。


實驗結果對比:


•傳統 MSE 模型: 產出的降雨場極度平滑,降雨峰值被嚴重低估,完全無法生成超過 150 mm/day 的強降雨,尾部機率密度崩塌。


•η-Learning 模型: 僅憑 0.5 年的訓練數據,成功重現了超過 200 mm/day 的極端豪雨場!其產出的每日最大降雨機率密度曲線(PDF)與 25 年真實高解析度地表觀測幾乎完美重合。

 

3. 更多多元應用場景展示


•修正深層生成模型(Flow Matching)的統計偏誤: 生成式 AI(如 Diffusion 或 Flow Matching)在訓練資料不足時同樣會產生尾部失真。η-Learning 可作為模型無關(Model-Agnostic)的統計修正器,顯著提升生成畫面的極端真實度。


•未來的極端氣候假設模擬(Hypothesized GEVD): 即使人類尚未經歷某種極端氣候,只要給定一個假設的廣義極值分佈(GEVD),η-Learning 即可生成符合未來氣候惡化假設下的「災難演練圖景」,為氣候風險評估提供前瞻性指引。


六、 局限與展望:AI 預測極端風險的下一個里程碑


    儘管 η-Learning 展現出了開創性的預測能力,作者也在論文中客觀地討論了當前架構的局限性與未來的優化方向:


•純量觀測量的幾何不確定性(Residual Uncertainty): 當前方法主要針對純量觀測量 g(u)(如全區最大值)進行分佈匹配。這能精確鎖定極端事件的強度,但在缺乏空間導引的情況下,極端事件具體發生的精確地理位置可能存在殘餘不確定性。


•多元與高維觀測量拓展: 未來可結合切片 Wasserstein 距離(Sliced Wasserstein)或熵正則化最優傳輸,將 η-Learning 擴展至多變量極端指標。


•物理守恆律約束: 將質量守恆、能量守恆等物理先驗進一步納入損失函數,可使產出的極端事件在動態演化上更加無懈可擊。


七、 結語:為不確定的未來,建立確定性的防線


    MIT 團隊提出的 Extreme Event Aware (η-) Learning,不僅僅是一套優雅的數學架構,更是人工智慧邁向「高風險臨界系統」預測的重要里程碑。它打破了傳統數據驅動模型「未見即無法預測」的思維枷鎖,成功將物理/統計先驗與數據驅動 AI 深度融合。


從預防極端氣候災害、評估海洋巨浪對航海與離岸風電的威脅,到防範金融市場的黑天鵝引爆,η-Learning 為人類在面對未知且嚴峻的極端風險時,提供了一把前所未有的科技利刃!

 


參考文獻
Chang, K., & Sapsis, T. P. (2026). Extreme Event Aware (η-) Learning. Nature Communications, Article in Press. https://doi.org/10.1038/s41467-026-76811-x