跳至主要內容
文化 分析

畫得出黃山,畫不出安徽:「AI展現不了安徽的美」掛上熱榜,出題的是安徽人

「AI展現不了安徽的美」掛上抖音熱榜,本文分析生成模型為何畫得出黃山、畫不出整個安徽,訓練資料的旅遊業偏差如何塑形地方影像,以及使用者端的繞道方案與後續觀察訊號。

Techroomage 編輯部 閱讀約 7 分鐘
畫得出黃山,畫不出安徽:「AI展現不了安徽的美」掛上熱榜,出題的是安徽人

模型對安徽的認識,停在遊客鏡頭反覆拍攝的那幾處。熱榜上這句不服氣,量出來的是訓練資料的地理分布。

在文字生圖工具輸入「黃山雲海」,出圖很少失手,奇松、怪石加雲海一次到位。把提示詞換成「安徽的風景」,結果就開始飄:有時給一片長江中下遊通用的青山綠水,有時把皖南古村落錯置成江浙水鄉,有時乾脆渲染出一張看不出省分的風景明信片。「AI展現不了安徽的美」掛上抖音熱榜,寫的就是這類落差。這句話值得先停在句子本身:它預設考試已經結束,有人出題、模型作答、分數已經打完,而閱卷的是安徽人。

詞條先假定了一場考試

熱榜詞條多半是新聞或事件的壓縮,這條不同,它本身就是一個結論。主詞是 AI,動詞是否定的「展現不了」,受詞是「安徽的美」。句子裡沒有出現任何人,但每個環節都有人的影子:要說 AI 展現不了,前提是有人拿安徽去問過它;要看得出「不美」,前提是判卷的人心裡先有一份安徽。

這也是生成模型很少遇到的考場。平常衡量這類模型,靠的是基準測試與公開排行,題目和標準都由工程側制定。這條熱榜把考題換成家鄉記憶,閱卷標準換成在地的眼睛,模型的輸出要跟安徽人每天看見的安徽對答案。這份卷子很難及格,因為模型備考的教材裡,安徽這一章本來就薄。

順帶一提,這是道填空題。把「安徽」換成別的省份,文法照樣成立,任何一省的網友都能拿去用。填空句式如何在平臺上流行、能活多久,我們在「歲月是把殺豬刀」的句式分析裡談過;差別在於殺豬刀填的是時間,這裡填的是地圖。

抖音熱榜詞條「AI展現不了安徽的美」,一句把生成模型的輸出交給安徽人評分的判斷

模型認得的安徽,是遊客拍過的安徽

要看懂 AI 為何在這題失手,得先看它怎麼學。主流文字生圖模型屬於擴散模型,訓練時餵入海量「圖片加文字描述」的配對,讓模型記住哪些字眼對應哪些視覺特徵。一個詞在資料裡出現越多、照片拍得越集中,模型對它的掌握就越準。

用這個標準檢查「安徽」,會發現它的網路影像高度集中。黃山是世界遺產,宏村、西遞也是,奇松雲海和粉牆黛瓦被拍了幾十年,中外文的標註都很密集。於是模型學到的「安徽」,大致等於黃山加皖南古村落。問黃山,它答得漂亮;問宏村,月沼和馬頭牆也到位。可是「安徽」要覆蓋的範圍遠大於此:皖北的平原與麥田、淮河的河道、江淮之間的丘陵、縣城街景、菜市場的燈光,這些在資料裡很少見,或者根本沒有跟「安徽」這個詞綁在一起。模型遇到沒把握的地方,就用通用山水填空,出來的圖自然對不上。

還有一層落差更難補。安徽人講的美,常常不在明信片構圖裡:梅雨季的濕度、巷子裡的光線,或者某條老街的尺度與氣味。這些屬性存在於照片中,卻很少被寫進文字標註,而模型只學文字與圖片的對應。沒被寫下來的美,模型視而不見。

清單列出馬頭牆、粉牆黛瓦、天井、徽州古道與新安江五項徽派建築與地景的辨識特徵

資料的地圖,長成了旅遊業的形狀

把視野拉遠,這條熱榜其實在測一張地圖:哪些地方被大量拍攝、大量標註,哪些地方在資料裡近乎透明。這張圖不等於人口分布,也未必對應風景好壞,它更像旅遊業與攝影文化的等高線。景區越有名、遊客越多,相機越密集,該地在模型裡的解析度就越高。

安徽在這張圖上的位置有點尷尬。它夾在長三角與中部之間,隔壁江蘇、浙江的網路影像密度明顯更高;省內的視覺資源又往皖南傾斜,徽州意象幾乎等於安徽的對外面孔,皖北在這套敘事裡長期缺席。對阜陽或宿州的居民來說,AI 畫出的「安徽之美」是雙重的陌生:模型給的是皖南,而皖南之外的家鄉根本不在畫面裡。

這條詞條也延續了安徽網友在平臺上的老姿態。省籍存在感之爭裡,安徽長期是積極應戰的一方,南京被戲稱「徽京」的玩笑流傳多年,每逢地域話題,留言區總有安徽人現身補充。這回對手換成了模型,考題從別人怎麼看安徽,變成機器學到了什麼安徽。

影響不止於一次出圖的好壞。生成內容正湧進行銷素材、搜尋結果與社羣動態,當地方文旅用 AI 產出宣傳圖,薄資料地區得到的只有通用模板;這些產物回頭又成為未來模型的訓練素材,薄的地方更薄,通用的更通用。同類的壓縮也發生在其他傳統元素上,琵琶被派定「古風搖」的新身分就是近例:平臺需要可辨識的標籤,細節在標籤化的過程裡被磨掉。

把省份換成地名,是使用者端的繞道

對一般使用者,這個落差有現成的繞道:別問省份,問地名。提示詞寫「安徽」,模型只能在有限的省分印象裡取平均;寫「宏村」「呈坎」「查濟」,每個詞對應的影像密度都遠高於省名,出圖的辨識度立刻不同。再進一步,把建築詞彙直接寫進提示詞,馬頭牆、天井、粉牆黛瓦,等於替模型補上它沒學好的標註。皖北亦然,淮河沿岸、皇藏峪這類具體地名,都比省名更容易把模型帶到現場。這也順帶修正一個常見誤解:生圖模型回答的是你寫下來的問題,「安徽」這一題目前的資料答不好,換個問法就換了答案。

清單建議以宏村、呈坎、查濟、漁梁壩、新安江等具體地名取代省份名稱作為提示詞

還有一個繞回來的觀察:這條熱榜正在生產它所抱怨的東西。話題之下,安徽網友貼出的實拍照片與影片,附著明確地名與在地視角,這正是模型當初缺的訓練素材。抱怨即標註,圍觀即建檔,社羣上的不服氣,說不定比任何官方資料集都更有效地把安徽搬進模型。

可盯的訊號

後續有幾個方向值得觀察。其一,這個句式會不會在其他省份的熱榜複製;若各地接連出現「AI展現不了某省的美」,等於網友自發做了一輪資料普查。其二,地方文旅的應對,是趁勢發起實拍徵集,還是直接用 AI 產宣傳品,兩種選擇指向完全不同的資料策略。其三,模型廠商端的動作,中文生圖工具若開始強調地方場景理解、推出在地化微調,這條熱榜就是現成的需求證明。

判斷可以很樸素:把 AI 生成的風景當氣氛參考可以,當地方再現不行。模型畫不出安徽,記的是資料的帳,安徽不必為這筆帳負責;要補帳的是把照片放上網路並好好寫下地名的人,而這件事,安徽人正在做。

#文化#分析#生成式ai#訓練資料偏誤#地域形象