跳至主要內容

蛐蛐罐裝進 GLM-5.3:模型評測在 B站變成了對戰節目

智譜 GLM-5.3 上架不滿一週,B站湧現大量讓模型捉對競技的賽博鬥蛐蛐影片,本文分析跑分失靈、token 補貼與內容娛樂化如何把模型評測變成對戰節目,以及讀者能帶走的判斷方法。

Techroomage 編輯部 閱讀約 9 分鐘
蛐蛐罐裝進 GLM-5.3:模型評測在 B站變成了對戰節目

跑分擠成一團、官方榜單失去鑑別度之後,判斷模型好壞的工作,正轉移到拍對戰影片的創作者與發彈幕的觀眾手上。 鬥蛐蛐是流傳幾百年的消遣:兩隻蟋蟀放進同一只陶罐,旁人圍觀下注,勝負幾分鐘內分曉。八月中旬的這一週,B站上最熱鬧的蛐蛐罐裡,放進去的是一個語言模型。 智譜的 GLM-5.3 上架還不滿一週,在 B站搜尋這個型號,正式的跑分報告只佔搜尋結果的一小角,其餘大多是對戰。有創作者搶首發,讓它直接寫一款 CS 風格的小遊戲,影片衝上十二萬播放;有人把「AI 鬥蛐蛐大賽」辦到第二期,讓 Claude、DeepSeek、Grok 輪流進罐;也有人擺開「屎山論劍」,讓開源與閉源模型在混亂的舊程式碼裡一決高下。播放量最高的幾支,都停在十萬上下。 對一般使用者來說,這些影片已經取代白皮書與排行榜,成為挑模型的第一手參考。對廠商來說,模型一發布就會被推進蛐蛐罐,這已經是發布流程的固定環節:躲不掉,也買不斷。

一週對戰表:速度戰、捉對廝殺與屎山論劍

把這一週的影片攤開,大致看得出幾種。 第一種是首發競速。權重剛上線,創作者搶在幾小時內完成實測,一支 CS 小遊戲的搶先測試拿下十二萬播放,說明觀眾確實想第一時間看到新模型的身手。同一路線還有讓 GLM-5.3 直出《進擊的巨人》題材遊戲、無聊到用它編譯 KernelSU 再換個圖標的各種嚐鮮片段。 第二種是捉對廝殺。「AI 鬥蛐蛐大賽」第二期讓 Claude、DeepSeek、Grok 同場競技,播放十萬;另有創作者安排 GLM-5.3 對決 Claude Opus 與 DeepSeek V4 Pro,標題直接寫上「決戰」二字。播放最密集的一支主流模型橫評,讓 GLM-5.3 對上 Kimi K3、GPT-5.6 與 Grok 4.6,五萬七千播放、一千餘則彈幕,彈幕密度直逼體育賽事直播。也有人走極簡路線,讓 GLM-4.7 與 GLM-5.1 下井字棋,看新一代會不會在最基本的對局裡犯低級錯誤。

清單圖列出手動對戰影片中與 GLM-5.3 同場競技的五個模型:GPT-5.6、Claude Opus、DeepSeek V4、Grok 4.6 與 Kimi K3
第三種最接近真實工作。有創作者長期經營「屎山考核」系列:所謂屎山,指的是沒有文件、命名混亂、疊了多年補丁的舊程式碼,讓模型讀懂它並安全地動手修改,比任何榜單都更接近工程師的日常。這個系列的 GLM-5.3 篇同樣衝上十萬播放,後續又加開「開源 AI 閉源 AI 決戰屎山之巔」的論劍場。資安圈也進場了,有人把 GLM-5.3 帶進滲透測試靶場實測找漏洞的能力,播放三萬。國外博主的實測則被配上中文字幕搬進來,標題下了一句很有代表性的註解:跑分直逼頂級閉源,寫遊戲卻頻頻翻車。 ## 跑分擠成一團之後,差異搬進罐子裡 鬥蛐蛐內容時間點爆發,有三個前提疊在一起。 首先是跑分失去鑑別度。這一輪新模型的共同處境,是各家榜單分數全擠在頂端:GLM-5.3 的相關影片標題寫著「基座不變,登頂開源編程榜」,另一支影片宣稱程式能力暴增五成、還順手挖出四十年老漏洞。問題在於對手也在往前跑,GPT-5.6、Claude、DeepSeek V4 的分數同樣漂亮。當數字分不出高下,差異就轉移到榜單量不到的地方:能不能寫出一個真的能玩的遊戲、能不能讀懂屎山、會不會在井字棋裡打結。這正是鬥蛐蛐影片在測的東西。 其次是成本結構變了。開源權重加上大方的 token 補貼,讓創作者能把實驗規模拉到過去不敢想的程度,「一天一億 token 免費領」「周日登入再送一億」這類促銷已經是發布標配;稍早 DeepSeek V4 Flash 上線時伺服器被擠爆的場面,也說明了需求端有多大。開源這條路從 DeepSeek 起跑,梁文鋒一年暴增的身價是市場給這條路的定價,如今每一家中國模型廠發布都照著劇本補貼一波,等於替內容創作者備好了免費彈藥。 第三是內容本身的娛樂性。看模型翻車是好看的:有創作者實測 GLM-5.3 寫喫豆人,總耗時七百二十萬毫秒,換算下來整整兩小時,過程全程錄影就是一支影片。看模型完成不可能任務也好看:有人用它一天完成 QGIS 到鴻蒙的基礎框架移植。勝負、懸念、翻車、揚眉吐氣,對戰格式把這些要素全部打包,彈幕自然滿屏。
統計圖卡呈現 GLM-5.3 花費約兩小時完成喫豆人遊戲的實測數據,換算自影片標題標註的七百二十萬毫秒
## 井字棋、屎山與靶場,量的是榜單外的能力 細看這些題目會發現,它們補上的恰好是正式評測的空洞。井字棋規則極簡,測的是模型在最少步數的多步推理裡會不會卡死;屎山考核測的是理解與收斂,面對現實專案裡最糟的程式碼,模型能不能不改壞、不崩潰;靶場挖洞測的是深度能力,順便踩在資安倫理的敏感線上。這些題目沒有標準答案可以背,也沒有榜單可以刷,過程公開錄影,觀眾可以自己重現。
引言圖卡引用國外博主實測 GLM-5.3 的影片標題,指出其跑分接近頂級閉源模型,實際寫遊戲仍經常出錯
所以這些影片的形式是綜藝,功能卻接近評測:題目具體、過程可看、輸贏立判,觀眾看完大概知道自己手上的任務該交給哪個模型。這也是為什麼「屎山論劍」這類系列能長期經營,它提供的判斷價值會累積,綜藝感只是包裝。 ## 誰在付錢養這罐蛐蛐 免費的一億 token 當然算得出行銷帳。對智譜來說,創作者替它做了最貴的一段:發布後頭幾天的大規模公開實測與口碑擴散,行銷部門用預算都未必買得到同等觸及。而 B站上流傳的高盛報告解讀,提醒了現實的另一面:模型變強,盈利仍是最大難題。補貼打得越兇,越說明獲利壓力還沒解開,這個矛盾我們先前在 豆包推薦飯店抽取傭金 的爭議裡已經見過一次,模型廠遲早要從補貼換到收費的賽道。 對創作者來說,這是流量生意,標題的軍備競賽已經開打:「完爆」「OpenAI 慌了」「震驚癱坐」,用詞一次比一次重,因為溫和的標題在演算法裡拿不到分配。熱度周邊也長出灰色地帶:搜尋結果裡混著「公益中轉站」的推廣,宣稱免費提供 GLM-5.3、GPT-5.6 與 Claude 的 API,來路不明的轉發服務搭著熱搜順風車吸收使用者。把對話內容交給這類中轉站,隱私與資安風險由使用者自行承擔,這是熱鬧之餘最少被細講的部分。 ## 觀眾能帶走什麼 把鬥蛐蛐當參考,先記住三件事。第一,單支影片的樣本只有一次,提示詞怎麼下、代理流程卡在哪裡、運氣好不好,都足以翻轉勝負;井字棋贏了不代表程式能力強,喫豆人寫了兩小時也不代表這個模型不能用。第二,挑與自己工作形態相近的題目看:要判斷工程可用性,屎山考核、靶場實測、專案移植這類內容的參考價值,明顯高於純綜藝對戰。第三,token 補貼期間是最好的親測窗口,與其看別人的蛐蛐打架,不如拿自己的實際任務進場跑一遍,一億 token 的額度足夠把結論驗證兩輪。 後續有幾個訊號值得留意。創作者會不會把賽制標準化,固定題庫與公開測試集一旦出現,鬥蛐蛐就會從綜藝長成半正式評測;廠商會不會開始官方贊助對戰節目,把免費行銷收編成正式管道;以及挖漏洞這類資安展示,會不會引來監管對模型能力邊界的關注。 蛐蛐罐不會空著。下一個模型發布那天,罐子會清乾淨,換上新的一對選手,彈幕照樣滿屏。這一週真正定下來的事實是:判斷模型好壞的權力,已經有相當一塊落在拍片的人與發彈幕的人手上,廠商能做的是把蛐蛐養得更壯,觀眾該做的是看懂自己究竟在看什麼。
#數位生活#分析#大模型評測文化