由 50K 到 820 萬:Vozinha 的「演算法封聖」與多語言敘事如何製造世界盃能見度
- 6月25日
- 讀畢需時 7 分鐘
2026 年 6 月 15 日,佛得角在世界盃逼和西班牙 0–0,40 歲門將 Vozinha(@vozinha1)撲出多球,成為全場焦點。但真正在網上瘋傳的,唔係嗰幾下撲救,而係一個數字:佢嘅 Instagram 由賽前幾萬粉,一日之內衝到超過 800 萬。
「50k to 8M」呢句話,短時間內以四種語言喺新聞標題、社交貼文同截圖之間流傳。問題係:點解一場 0–0 和波,可以被語言加工成一件「全球都讀得明」嘅象徵性事件?
論文 From 50K to 8.2 Million in 24 Hours: Vozinha's Algorithmic Consecration and the Multilingual Making of World Cup Visibility,就係用計算語言學(cs.CL)角度去拆呢個現象。
本文重點
要講清楚:呢篇唔係體育行銷研究,研究對象係語言本身。作者想問嘅唔係「點解一個運動員會多咗 follower」,而係「四個語言公眾(葡、西、英、法)點樣用唔同嘅敘事框架,將一場邊緣賽事轉化成全球可讀嘅 consecration」。
論文最核心嘅一個 move 係 metric-as-discourse:將「粉絲數」本身當成一個語言對象去分析。「50k to 8M」唔只係一個量度結果,而係一個可以被引用、可以截圖、可以跨語言流傳嘅「證據」。數字本身,變成咗一種語言。
一、點解 Vozinha 呢單 case 特別「易讀」?
作者揀呢單 case,係因為佢作為一個論述對象異常清晰。
佛得角: 一個約 50 萬人口嘅島國,首次打入世界盃,本身就係「歷史」級敘事素材。
門將背景: Josimar José Évora Dias,40 歲,據報 25 歲先轉職業,大半生涯喺低組別同歐洲以外打滾,Transfermarkt 身價只係約 5 萬歐元。呢個傳記本身就供應咗 underdog、veteran、late recognition 幾個框架。
直播動員: 場波由 CazéTV(巴西 streamer Casimiro 主持嘅 internet-native 直播)帶畀龐大葡語觀眾。葡語報道描述咗一個現場、明確嘅「跟佢 follow」呼籲一場 mutirão(集體動員)令粉絲數喺呼籲後幾分鐘已衝上幾十萬。
正正係呢種「直播動員」,令呢單 case 同賽前就鋪排好嘅 influencer campaign 區分開:又快,又有得講。
二、「metric-as-discourse」係咩意思?
傳統做法會將 follower count 當成一個結果變數(outcome),即係「行銷做得好,所以粉絲升」。
呢篇論文嘅角度相反:數字本身就係論述嘅一部分。
當 before/after 截圖(例如「50k → 1.9M」)、跨運動比較(「followers 多過 Wembanyama」)、滾動計數喺網上流傳時,數字並唔係靜靜哋做緊「量度」,而係被當成公眾證據——一種唔使翻譯都讀得明嘅「呢件事好緊要」嘅講法。
一個數字,對葡語、西語、英語、法語公眾同時 legible,所以佢成為咗各種分歧框架最終都會 converge 落去嘅共同對象。
三、九個敘事框架(F1–F9)
論文定義咗九個 narrative frames,並且規定:淨係喺有明確 lexical / rhetorical cue 出現時先可以標註,唔准靠推測作者意圖去標。一個 excerpt 可以同時有多個框架。
F1 underdog / 邊緣英雄: 「unbeatable goalkeeper」,跨語言常見。
F2 國族能見度 / Cape Verde making history: 細國寫歷史。
F3 年齡 / 老將 / 遲來認可: 「at 40」。
F4 平台指標奇觀(「50k to 8M」): 跨語言共通。
F5 巴西直播動員 / CazéTV: 葡語專屬。
F6 西班牙危機 / 挫敗: 西語專屬。
F7 情感 / 家庭 / 眼淚: 例如「母親負擔唔起簽證費」。
F8 經濟注意力 / influencer value: 「5 萬歐元嘅門將」。
F9 跨運動比較: 同 NBA / NFL 球星比 follower。
呢個 taxonomy 嘅好處係:佢將「演算法封聖」呢個抽象概念,operationalize 成可觀察、可標註嘅語言線索,而唔係單純斷言「佢爆紅咗」。
四、標註流程:LLM 建議 + 人手驗證
呢篇 paper 嘅方法論值得做 NLP 標註嘅人留意。
流程係:language model 先為每個 excerpt 建議框架標籤同英文 gloss;但呢個只係 suggestion,永遠唔係最終答案。之後人手標註員按 cue rules 確認或推翻每個標籤,並記錄所有 override。有分歧就裁決;裁決唔到嘅 item 標為 low-confidence 並排除喺主要結論之外。
要留意,作者好誠實咁講明:v0.1 只係一個 seeded pilot corpus,用嚟驗證 taxonomy 同流程,唔應該當成事件全部報道嘅代表性樣本。完整 double-annotation 同 inter-annotator agreement(Cohen's κ / Krippendorff's α)係 planned work。
五、數據紀律:只有一個「精確」數字
呢篇 paper 喺數字處理上極度克制,呢點對做 data 嘅人好有參考價值。
作者明確區分證據類型:news consensus、news-reported、primary-scraper、screenshot。整個 follower 時間線之中,只有一個精確值:
8,235,652 followers @ 2026-06-16 15:47 UTC(Apify 主錨點,very high confidence)其餘全部都報為估計範圍或門檻值,唔扮成連續曲線:
賽前 baseline 45k–56k(範圍估計)
賽中(CazéTV 動員後) 200k–300k(門檻)
全場完 / 更衣室時段 ~1.0–1.1M(門檻)
當日(6/15) over 2M(門檻)
6/15 夜至 6/16 凌晨 ~5.0–5.7M(報道值)
6/16 上午 6.0–6.4M(報道值)
6/16 下午稍早 7.6M(報道值)六、截圖點解唔等於 API 數據?
論文另設一個 visual evidence corpus:6 月 16 日上午約 09:17 至 09:28 之間擷取嘅 48 張截圖(9 張 X、39 張 IG Stories)。
關鍵原則係:截圖係「平台介面當時顯示咗咩」嘅紀錄,唔等於 API-equivalent measurement。
每張截圖以 SHA-256 hash 記錄喺 evidence_hashes.csv,確保事後可驗證係同一份檔案。
圖內可見文字(帳號、顯示時間、follower 值、caption)由人手轉錄,冇用 OCR,避免喺花俏 UI 上出現靜默轉錄錯誤。
圖內嘅 engagement 數字(like、轉發、瀏覽)只作 context,明確唔當指標證據,因為佢哋 volatile 又冇經 logged API call 收集。
Stories 嘅相對時間戳(「18h ago」)只用嚟排序,±1h 容差。
換句話講:截圖係「呢個數值同論述曾經公開展示」嘅強證據,適合做論述分析;但佢哋無法建立連續序列,亦排除唔到 client-side 或介面 rendering artifact。所以截圖係視覺—論述證據,Apify 錨點先係唯一精確量化點。
七、五個主要發現(R1–R5)
R1:指標奇觀語言就係頭條。 跨語言之嚟,follower count 不斷被推到最前(F4),數字而唔係撲救,先係新聞本身。
R2:葡語 / 巴西論述係「動員語言」。 葡語報道嘅特徵係綁住 CazéTV / Casimiro 嘅動員詞彙(F5):明確叫人 follow、framing 成集體 mutirão、向「os brasileiros」道謝。喺度,語言唔只係描述爆升——佢直接 enact 咗爆升。
R3:西語論述係「危機 / 挫敗」框架。 西語報道聚焦西班牙射唔入(F6):「le hace la vida imposible a España」,將 0–0 framing 成西班牙嘅尷尬多過 Cape Verde 嘅勝利,並經常同經濟價值框架(F8,5 萬歐元門將)一齊出現。
R4:英語 / 全球論述係「underdog / 國族製造」框架。 英語報道偏重 underdog 同 nationhood(F1、F2、F3):「unbeatable goalkeeper」、40 歲老將、Cape Verde「making history」。再加情感家庭框架(F7,負擔唔起簽證費嘅母親)放大可分享性。
R5:平台語言將表現轉化成封聖。 綜合 R1–R4:platform-metric language 係 connective tissue——每個語言公眾供應一個獨特框架,但全部 converge 落個數字之上。表現唔係喺完場一刻 consecrated,而係喺佢被「數出嚟」並「以數字方式被敘述」嗰刻先成為 consecration。
八、咩叫「演算法封聖」(algorithmic consecration)?
作者將 algorithmic consecration 定義成一個同時由語言與平台中介嘅過程:當公眾論述用可分享嘅框架去 encode 一件事,而平台指標又令呢個價值變得 legible、countable 嗰陣,象徵價值就被賦予。
作者特別指出,「viral fame」(爆紅)呢個描述唔夠用,因為佢只強調 spread,卻忽略咗:
語言勞動: 令 spread 變得有意義;
指標勞動: 令 spread 變得 durable。
呢個 case 同時示範咗 peripheral visibility 同 nationhood:一個細國、一個低身價球員,透過跨語言嘅框架組合(葡語動員播種、西語危機供應衝突、英語國族製造提供敘事耐久度、共通嘅指標奇觀框架將時刻轉成可攜帶嘅數字),取得全球象徵性存在。
九、對做 data、NLP、體育分析嘅人有咩啟示?
第一,volatile 指標應該當論述證據,唔好當 ground truth。Follower count、like、view 喺高熱度期間極不穩定,仲會撞上 cache、rate limit、介面 artifact。將佢哋 type 成範圍、門檻、報道值、精確值,並標明 confidence 同 evidence type,係一種值得學嘅紀律。
第二,LLM-assisted 標註要有 human-in-the-loop 同 override log。用 LLM 出 suggestion 可以加速,但最終標籤要人手按明確 cue rules 確認,並保留可審計嘅 override 紀錄,先講得上 reproducible。
第三,截圖同 API 數據要嚴格分流。喺今時今日好多分析都靠 scrape 同 screenshot,呢篇 paper 用 SHA-256 hash、人手轉錄、明確唔升級截圖為 API-equivalent 嘅做法,係一個誠實又可複製嘅範式。
第四,數字本身可以係一種語言。對做 prediction market、social listening、品牌監測嘅人嚟講,「一個 metric 點樣被敘述」往往比 metric 嘅絕對值更影響傳播。
十、這篇 paper 的價值
呢篇文章嘅貢獻,唔在於話「Vozinha 爆紅」呢件事有幾誇。佢真正示範嘅係:點樣將一個睇落純屬「網絡熱話」嘅現象,用嚴謹嘅語料 schema、框架 taxonomy、標註流程同數據紀律,變成一個可複製、可延伸嘅研究對象。
最值得帶走嘅一句係:個數字唔只係記錄咗能見度,佢本身成為咗生產能見度嘅其中一種語言。
作為 v0.1 pilot,作者亦好坦白標明限制:唔擁有完整 API-native follower 歷史、語料係 seeded 樣本、單一 case study 嘅 generalizability 有限。佢哋將貢獻定位成一套方法與類型學,而唔係一個完整結論——呢種克制,本身就值得學。
Reference
Vinicius Covas. From 50K to 8.2 Million in 24 Hours: Vozinha's Algorithmic Consecration and the Multilingual Making of World Cup Visibility. arXiv:2606.19647v1 [cs.CL], 17 Jun 2026. https://arxiv.org/abs/2606.19647
José van Dijck. The Culture of Connectivity: A Critical History of Social Media. Oxford University Press, 2013.
Taina Bucher. If...Then: Algorithmic Power and Politics. Oxford University Press, 2018.
Alice E. Marwick. Status Update: Celebrity, Publicity, and Branding in the Social Media Age. Yale University Press, 2013.
Crystal Abidin. Internet Celebrity: Understanding Fame Online. Emerald Publishing, 2018.



