
科楠老師
2026-10-6
在生成式 AI 飛速發展的今天,從深偽換臉(Deepfake)到像 Google VEO-3、Sora 等文字生成影片(Text-to-Video)工具,AI 製造出來的影片早已到了「假作真時真亦假」的地步。然而,面對每秒鐘數以萬計湧入社群網路與影音平台的影片,傳統的數位深度學習演算法(如大型 CNN 或 Transformer)雖然精準,卻面臨著致命的瓶頸——運算量過於龐大、電力消耗驚人,且難以抵禦有心人士的「對抗性攻擊」(Adversarial Attacks)。為了解決這項危機,加州大學洛杉磯分校(UCLA)的 Aydogan Ozcan 教授團隊在國際權威學術期刊《eLight》發表了一項震撼研究:他們開發出一套「數位-光學混合神經網路」(Hybrid Digital-Optical Neural Network)。這套系統打破了傳統矽晶片運算限制,改用「光」來做 AI 推理,不僅能在一瞬間同時檢測 15 部以上的獨立影片,更將能耗降低了近 90%,且對偽造影片的檢測敏感度高達 99.86%!
為什麼要用「光」來幫 AI 做算術?
傳統的電腦或顯示卡(GPU)在執行 AI 模型時,本質上是在進行數億次的「矩陣乘法」與「加法」運算。每一次電子在矽晶片電路中流動,都會產生熱能與電量消耗。但「光」不一樣。當光波穿過透鏡、鏡片或特定形狀的微結構時,光的繞射(Diffraction)、干涉(Interference)與相位變化,自然而然就在物理空間中完成了複雜的數學變換。這種「光子運算」(Optical Computing)具備三大極致優勢:
1. 光速傳播:延遲極低(僅取決於光傳播幾公分的時間)。
2. 零被動能耗:光經過靜態鏡片傳播時,鏡片本身不消耗任何電能。
3. 高維度平行處理:一束光可以同時攜帶大量的空間資訊,實現極大規模的「平行運算」。
雙重分工架構:數位前端 + 光學後端
UCLA 團隊設計的系統並非完全棄用數位電腦,而是採用了「數位與光學各司其職」的混合分工架構:
[多部輸入影片]
↓
[數位前端 Encoder]:人臉擷取 + 空間與頻率特徵融合
↓ 編碼為 2D 相位圖 (Phase Map)
[空間光調製器 SLM]:將數位訊號轉化為實體光波
↓
[光學解碼器 Optical Decoder]:光波穿過被動繞射層 (Diffractive Layers) 進行物理推理
↓
[光電感測器 Detector]:讀取光斑強度差,直接輸出真偽分數!
1. 數位前端(Encoder):精準擷取關鍵特徵
系統首先從每部影片中採樣關鍵影格,利用 RetinaFace 演算法精準框出人臉並進行對齊。接著,數位神經網路從「空間特徵(人臉細節)」與「傅立葉頻域特徵(AI 生成留下的高頻瑕疵)」雙管齊下抽取特徵,並透過注意力機制(Attention Mechanism)將其壓縮合成為一張 2D 的「相位圖(Phase Map)」。
2. 光學後端(Decoder):光速完成深度推理
這張相位圖會被載入至空間光調製器(SLM)上。當相干雷射光照射 SLM 後,攜帶著影片特徵的光波便會發射出去,穿過數層精心設計的被動靜態繞射層(Diffractive Layers)。當光束抵達終點的感測器時,每一部影片都會對應到一組「正/負光斑對」。感測器只需讀取光斑的強度差異,就能在物理層面上直接得出這部影片是真還是假!
核心亮點一:空間多路複用——「一招看透 15 部影片」
傳統數位 AI 在處理影片時,必須「一部接一部」依次處理,或者需要堆疊昂貴的 GPU 記憶體來做平行運算。而 UCLA 團隊利用光學的空間特性,實現了「空間多路複用」(Spatial Multiplexing)。研究人員將 15 部(甚至 18 部)完全獨立的影片特徵,共同編碼在同一張 SLM 畫面上。當雷射光穿過時,15 部影片的真偽辨識在同一瞬間(Single Optical Pass)全部完成!
核心亮點二:能耗革命!電力消耗驟降 90%
資料中心的龐大耗電量是當前 AI 發展的最大痛點之一。這套光學神經網路在「綠色 AI(Green AI)」方面展現了驚人的突破:
這意味著,光學解碼器能降低 86.5% 至 95.5% 的電力消耗!在相同的處理吞吐量下(每秒處理約 2,500 部影片),傳統數位系統需要 77.38 瓦的功率,而光學系統僅需 3.51 至 10.45 瓦,大幅減輕了雲端伺服器的散熱與電力負擔。
核心亮點三:物理級防護!反制駭客的對抗性攻擊
在網路安全領域,駭客經常使用「對抗性攻擊」(Adversarial Attacks)——在影片中加入極微小的數位雜訊,肉眼無法察覺,卻能讓傳統數位 AI 徹底失效。光學神經網路具備天然的物理防禦力:
1. 物理參數隱蔽性:光學元件的實體距離、光學轉換函數等參數隱藏於實體硬體中,駭客無法取得「白箱梯度」來製造攻擊樣本。
2. 強大抵抗力:在黑箱對抗攻擊測試中(如 HopSkipJumpAttack),當數位 AI 的被欺騙率(攻擊成功率)高達 100% 時,光學解碼器的攻擊成功率竟低於 9%!
此外,面對真實世界常見的影片品質下降,如高斯雜訊、畫面模糊或高強度的 JPEG 壓縮(品質因子 Q=30),這套光學系統依然能穩定維持 94% 以上的精準辨識率。
實戰進化:輕鬆應對 Google VEO-3 / Gemini 生成式 AI 影片
面對技術日新月異的生成式 AI,這套系統是否會迅速過時?研究團隊特別使用最前沿的 Google VEO-3 / Gemini 生成式 AI 影片進行測試。結果顯示,混合系統只需使用 50 部 AI 生成影片進行微調(不到完整訓練集 1% 的運算量),就能快速「進化」。在對未見過的最新 AI 影片進行實實盲測時,達成了 94.80% 的準確率 與 97.61% 的敏感度,展現出極強的泛化能力與升級彈性。
未來展望:建構網際網路的第一道「光學安全防火牆」
研究團隊指出,這套系統的最佳定位是作為社群平台(如 YouTube、Meta、TikTok)或國家級網路安全監控的「第一階段預篩選光學防火牆」(First-stage screening front-end)。想像一下:當每秒數萬部影片上傳至雲端時,光學防火牆可以在「光速」下以極低能耗過濾掉 99% 的合格影片與明顯偽造影片,並以近乎零漏抓(99.86% 敏感度)的表現,僅將極少數有疑慮的邊緣樣本轉交給後端重型數位 AI 進行深度複查。這種「光學高速過濾 + 數位深度複驗」的黃金組合,將徹底解決 AI 時代下算力爆炸與假訊息氾濫的雙重危機,為數位世界的真實性築起一道堅不可摧的光學防線。
參考文獻
1. Parnian Ghapandar Kashani, Shiqi Chen (2026), & Aydogan Ozcan, Scalable, energy-efficient optical-neural architecture for multiplexed deepfake video detection, eLight, 6, 27. https://doi.org/10.1186/s43593-026-00085-7
2. EurekAlert!: Researchers harness light to detect deepfake videos at scale.
3. ScienceDaily:This light-powered AI can spot deepfakes with nearly 98% accuracy.
Copyright © 2025 利創智能科技股份有限公司 All rights reserved.
Replace this text with information about you and your business or add information that will be useful for your customers.
