考官不能是出題的人:李飛飛談 AI 安全,評估這一關要交給外面
李飛飛接受彭博電視訪問表示,AI 安全評估不能全由開發公司自評,獨立機構與學術界的基準、政府和產業的共同責任才是底線,本文分析這番話的時機、自評機制的缺口與後續可盯訊號。
美東時間週二,紐約聯合國大會的講臺上,美國總統川普駁斥對 AI 生存威脅的擔憂,稱之為「騙局」,並強調這項技術應該全速發展。差不多同一時間,被媒體稱為「AI 教母」的李飛飛坐在彭博電視的攝影機前,提出了一個溫和許多、卻更難迴避的問題:當 AI 系統的能力越來越強,它們的安全評估,還適合全部交給開發這些系統的公司嗎?
據彭博社報導,北京時間 9 月 23 日,這位史丹佛大學教授、World Labs 共同創辦人給出的答案是:不適合。公司內部研究人員可以評估單一模型的能力與安全性,但這無法取代由政府、產業與學術機構共同制定的更廣泛標準。這場隔空的口徑交鋒,把 AI 治理辯論裡一個被開發速度蓋過的問題推回檯面:模型的安全成績單,究竟該由誰來打分數。
考官與出題的人,不能是同一批人
李飛飛這番話值得注意的地方,在於她沒有把矛頭指向任何一家公司,也沒有渲染任何末日情境。她談的是制度設計:評估權放在哪裡。
用考試打個比方。一家 AI 公司對自家模型做的安全測試,類似補習班自己命題、自己閱卷、自己發成績單。補習班未必作弊,內部研究員也常常真的想找出問題;李飛飛自己也承認,公司內部確實能評估單一模型的能力與安全。但當這份成績單要拿去說服社會「可以放心」時,性質就變了。命題權、閱卷權與招生利益握在同一雙手裡,社會手上始終缺少第二份獨立的分數。
所以她開出的藥方分兩層:基準由獨立機構與學術界等公共部門制定;責任由產業與政府共同承擔。這兩句話在 AI 治理的討論裡不算新鮮,但從一位一手推動現代 AI 起飛、如今又自己創辦公司的學者口中說出,分量不一樣。她同時站在出題者的位置上,呼籲設置外部的考官。
為什麼是九月的這一週
這番話出現的時間點,本身就是訊息。
近幾週,Anthropic 執行長達裏奧.阿莫代伊與 OpenAI 執行長山姆.奧特曼先後公開呼籲放慢前沿模型的開發速度。兩家競爭最兇的公司,負責人在同一個方向上發聲,並不常見。彭博社報導,兩人於週三在聯合國安全理事會討論 AI 安全,把這場原本屬於工程師與研究員的辯論,正式帶進國際政治場合。背景是外界對風險的擔憂確實在升溫:矽谷一些領導人警告,這項技術的發展速度太快,可能最終超出人類的控制。
與此同時,政治端的訊號往反方向走。川普在聯大演說中把生存風險的警告斥為「騙局」,立場是繼續全速發展。政策制定者與產業領袖之間,對「該多嚴肅對待極端風險警告」的辯論正在加溫,李飛飛的說法為中間地帶補上了一個聲音:不必在「末日」與「騙局」之間選邊站,可以先處理一個技術上可操作的問題,評估由誰做、標準由誰定、責任由誰背。
自評的極限:行銷與安全在同一間辦公室
把鏡頭拉近一點看,開發者自評的缺口是具體的。
最直接的一層是誘因。安全測試的結果直接影響產品的上市節奏與行銷話術,而在同一間公司裡,安全團隊與商業團隊的預算和考績往往綁在同一條產品線上。內部研究員可以很盡責,但盡責的發現能不能變成延後發布的決定,取決於公司治理,而非科學本身。
視野是另一層問題。公司評估的是自己的模型、以及自己設想的危害清單。模型離開實驗室之後,會被使用者以開發者沒預期的方式使用,內容安全是最容易理解的例子:廠商在模型內建了防線,但防線在真實世界撐不撐得住,往往要靠外部測試與流通現場來揭曉。先前 DeepSeek 模型權重開放下載後,一元「教程」隨即在閒魚流動的案例說明了這種落差:開源模型的內容防線,止步於權重下載那一刻,之後的帳,開發者自己看不到,也管不到。
再往深一層是問責。內部報告沒有法律地位,出了事,社會無法拿一份公司自評文件去要求任何人負責。李飛飛把「政府共同承擔責任」講在「獨立基準」後面,順序上有講究:先有公認的量尺,責任才有得分配。
當 AI 走出對話框
李飛飛談評估,並不是站在旁觀席上喊話。她創辦的 World Labs 正在開發所謂的「世界模型」:生成與重建三維環境的系統,可用於訓練與評估機器人,也能支援設計、醫療等行業的應用。
這讓她的呼籲多了一層切身的 context。今天主流的安全評估,對象多半是文字與圖片的生成模型,最壞的後果大致是一次糟糕的回答或一張問題圖片。當模型開始驅動在三維空間裡行動的機器人,評估的賭注就換了量級:答錯一句話和走錯一步路的後果,無法放在同一個尺度上衡量。
她在訪問裡把整個行業面臨的處境總結為同一個根本提問:如何評估能力日益強大的 AI,並判斷它是否按預期運行。順著世界模型的路線再往前想一步,還會多出一個新題目:用來訓練與考核機器人的模擬環境,本身也是模型,也是某家公司的產品。考場由誰來蓋、考場本身準不準,會變成評估問題的下一層,而這一層現在還沒有公認的答案。
電力、蒸汽機與一個老題目
面對「生存風險」這個最容易流於互相喊話的題目,李飛飛選了一條冷靜的路徑。她說,AI 是否構成生存性風險,最終取決於人類選擇如何開發、治理與使用這項技術;同樣的原則也適用於 AI 以外的技術,從電力、蒸汽機到現代交通工具,人類社會始終在技術帶來的益處與人身安全之間求取平衡。
她強調人類握有技術的力量,必須握住控制權;AI 的課題終究回到人身上,關乎共同的與個人的尊嚴、自主權與責任。這套論述把風險從模型的參數裡搬回人的決策裡,也和她一貫的關注相呼應:她先前曾表示,AI 進入校園的最大風險,是可能削弱孩子的學習能力。類似的擔憂也出現在這個開學季,多所大學校長在開學典禮上點名認知卸載與思維外包、勸新生對 AI 慢一點,與李飛飛談的自主權與責任,指向同一個方向:技術的帳,最後都記在人的能力與選擇上。
接下來值得盯的訊號
短期看週三的聯合國安全理事會會議。奧特曼與阿莫代伊怎麼講、各國代表回應時採用「風險治理」還是「發展競賽」的語言,會透露國際協調的溫度,也會顯示川普的「騙局」說在多大程度上綁住美國的立場。
中期看兩件事。其一,獨立評估是否從原則變成編制:有沒有穩定經費、法定地位與資料存取權的第三方基準組織出現,還是繼續停留在宣言層級。其二,前沿公司是否接受外部稽核:在內部安全報告之外,願不願意讓外部機構在發布前後實質介入測試。這兩件事任何一件成真,李飛飛的呼籲才算落地成制度;兩件都沒有,它就只是聯大週間的一段訪談。
對一般讀者,這場高層辯論可以轉成一個實用的檢查動作:下次看到任何 AI 產品的安全聲明,先找「測試是誰做的」。公司自評提供的是素材,獨立基準提供的才是分數。當兩者並列、而且量尺不是出題者自己畫的時候,安全這兩個字才開始有第二份分數可以對照。