top of page

由 50K 到 820 萬:Vozinha 的「演算法封聖」與多語言敘事如何製造世界盃能見度

  • 6月25日
  • 讀畢需時 7 分鐘

2026 年 6 月 15 日,佛得角在世界盃逼和西班牙 0–0,40 歲門將 Vozinha(@vozinha1)撲出多球,成為全場焦點。但真正在網上瘋傳的,唔係嗰幾下撲救,而係一個數字:佢嘅 Instagram 由賽前幾萬粉,一日之內衝到超過 800 萬。

「50k to 8M」呢句話,短時間內以四種語言喺新聞標題、社交貼文同截圖之間流傳。問題係:點解一場 0–0 和波,可以被語言加工成一件「全球都讀得明」嘅象徵性事件?

論文 From 50K to 8.2 Million in 24 Hours: Vozinha's Algorithmic Consecration and the Multilingual Making of World Cup Visibility,就係用計算語言學(cs.CL)角度去拆呢個現象。


本文重點

要講清楚:呢篇唔係體育行銷研究,研究對象係語言本身。作者想問嘅唔係「點解一個運動員會多咗 follower」,而係「四個語言公眾(葡、西、英、法)點樣用唔同嘅敘事框架,將一場邊緣賽事轉化成全球可讀嘅 consecration」。

論文最核心嘅一個 move 係 metric-as-discourse:將「粉絲數」本身當成一個語言對象去分析。「50k to 8M」唔只係一個量度結果,而係一個可以被引用、可以截圖、可以跨語言流傳嘅「證據」。數字本身,變成咗一種語言。


一、點解 Vozinha 呢單 case 特別「易讀」?

作者揀呢單 case,係因為佢作為一個論述對象異常清晰。

佛得角: 一個約 50 萬人口嘅島國,首次打入世界盃,本身就係「歷史」級敘事素材。

門將背景: Josimar José Évora Dias,40 歲,據報 25 歲先轉職業,大半生涯喺低組別同歐洲以外打滾,Transfermarkt 身價只係約 5 萬歐元。呢個傳記本身就供應咗 underdog、veteran、late recognition 幾個框架。

直播動員: 場波由 CazéTV(巴西 streamer Casimiro 主持嘅 internet-native 直播)帶畀龐大葡語觀眾。葡語報道描述咗一個現場、明確嘅「跟佢 follow」呼籲一場 mutirão(集體動員)令粉絲數喺呼籲後幾分鐘已衝上幾十萬。

正正係呢種「直播動員」,令呢單 case 同賽前就鋪排好嘅 influencer campaign 區分開:又快,又有得講。


二、「metric-as-discourse」係咩意思?

傳統做法會將 follower count 當成一個結果變數(outcome),即係「行銷做得好,所以粉絲升」。

呢篇論文嘅角度相反:數字本身就係論述嘅一部分

當 before/after 截圖(例如「50k → 1.9M」)、跨運動比較(「followers 多過 Wembanyama」)、滾動計數喺網上流傳時,數字並唔係靜靜哋做緊「量度」,而係被當成公眾證據——一種唔使翻譯都讀得明嘅「呢件事好緊要」嘅講法。

一個數字,對葡語、西語、英語、法語公眾同時 legible,所以佢成為咗各種分歧框架最終都會 converge 落去嘅共同對象。


三、九個敘事框架(F1–F9)

論文定義咗九個 narrative frames,並且規定:淨係喺有明確 lexical / rhetorical cue 出現時先可以標註,唔准靠推測作者意圖去標。一個 excerpt 可以同時有多個框架。

  • F1 underdog / 邊緣英雄: 「unbeatable goalkeeper」,跨語言常見。

  • F2 國族能見度 / Cape Verde making history: 細國寫歷史。

  • F3 年齡 / 老將 / 遲來認可: 「at 40」。

  • F4 平台指標奇觀(「50k to 8M」): 跨語言共通。

  • F5 巴西直播動員 / CazéTV: 葡語專屬。

  • F6 西班牙危機 / 挫敗: 西語專屬。

  • F7 情感 / 家庭 / 眼淚: 例如「母親負擔唔起簽證費」。

  • F8 經濟注意力 / influencer value: 「5 萬歐元嘅門將」。

  • F9 跨運動比較: 同 NBA / NFL 球星比 follower。

呢個 taxonomy 嘅好處係:佢將「演算法封聖」呢個抽象概念,operationalize 成可觀察、可標註嘅語言線索,而唔係單純斷言「佢爆紅咗」。


四、標註流程:LLM 建議 + 人手驗證

呢篇 paper 嘅方法論值得做 NLP 標註嘅人留意。

流程係:language model 先為每個 excerpt 建議框架標籤同英文 gloss;但呢個只係 suggestion,永遠唔係最終答案。之後人手標註員按 cue rules 確認或推翻每個標籤,並記錄所有 override。有分歧就裁決;裁決唔到嘅 item 標為 low-confidence 並排除喺主要結論之外。

要留意,作者好誠實咁講明:v0.1 只係一個 seeded pilot corpus,用嚟驗證 taxonomy 同流程,唔應該當成事件全部報道嘅代表性樣本。完整 double-annotation 同 inter-annotator agreement(Cohen's κ / Krippendorff's α)係 planned work。


五、數據紀律:只有一個「精確」數字

呢篇 paper 喺數字處理上極度克制,呢點對做 data 嘅人好有參考價值。

作者明確區分證據類型:news consensus、news-reported、primary-scraper、screenshot。整個 follower 時間線之中,只有一個精確值

8,235,652 followers @ 2026-06-16 15:47 UTC(Apify 主錨點,very high confidence)

其餘全部都報為估計範圍或門檻值,唔扮成連續曲線:

賽前 baseline           45k–56k(範圍估計)
賽中(CazéTV 動員後)   200k–300k(門檻)
全場完 / 更衣室時段     ~1.0–1.1M(門檻)
當日(6/15)            over 2M(門檻)
6/15 夜至 6/16 凌晨      ~5.0–5.7M(報道值)
6/16 上午               6.0–6.4M(報道值)
6/16 下午稍早           7.6M(報道值)

六、截圖點解唔等於 API 數據?

論文另設一個 visual evidence corpus:6 月 16 日上午約 09:17 至 09:28 之間擷取嘅 48 張截圖(9 張 X、39 張 IG Stories)。

關鍵原則係:截圖係「平台介面當時顯示咗咩」嘅紀錄,唔等於 API-equivalent measurement。

  • 每張截圖以 SHA-256 hash 記錄喺 evidence_hashes.csv,確保事後可驗證係同一份檔案。

  • 圖內可見文字(帳號、顯示時間、follower 值、caption)由人手轉錄,冇用 OCR,避免喺花俏 UI 上出現靜默轉錄錯誤。

  • 圖內嘅 engagement 數字(like、轉發、瀏覽)只作 context,明確唔當指標證據,因為佢哋 volatile 又冇經 logged API call 收集。

  • Stories 嘅相對時間戳(「18h ago」)只用嚟排序,±1h 容差。

換句話講:截圖係「呢個數值同論述曾經公開展示」嘅強證據,適合做論述分析;但佢哋無法建立連續序列,亦排除唔到 client-side 或介面 rendering artifact。所以截圖係視覺—論述證據,Apify 錨點先係唯一精確量化點。


七、五個主要發現(R1–R5)

R1:指標奇觀語言就係頭條。 跨語言之嚟,follower count 不斷被推到最前(F4),數字而唔係撲救,先係新聞本身。

R2:葡語 / 巴西論述係「動員語言」。 葡語報道嘅特徵係綁住 CazéTV / Casimiro 嘅動員詞彙(F5):明確叫人 follow、framing 成集體 mutirão、向「os brasileiros」道謝。喺度,語言唔只係描述爆升——佢直接 enact 咗爆升。

R3:西語論述係「危機 / 挫敗」框架。 西語報道聚焦西班牙射唔入(F6):「le hace la vida imposible a España」,將 0–0 framing 成西班牙嘅尷尬多過 Cape Verde 嘅勝利,並經常同經濟價值框架(F8,5 萬歐元門將)一齊出現。

R4:英語 / 全球論述係「underdog / 國族製造」框架。 英語報道偏重 underdog 同 nationhood(F1、F2、F3):「unbeatable goalkeeper」、40 歲老將、Cape Verde「making history」。再加情感家庭框架(F7,負擔唔起簽證費嘅母親)放大可分享性。

R5:平台語言將表現轉化成封聖。 綜合 R1–R4:platform-metric language 係 connective tissue——每個語言公眾供應一個獨特框架,但全部 converge 落個數字之上。表現唔係喺完場一刻 consecrated,而係喺佢被「數出嚟」並「以數字方式被敘述」嗰刻先成為 consecration。


八、咩叫「演算法封聖」(algorithmic consecration)?

作者將 algorithmic consecration 定義成一個同時由語言與平台中介嘅過程:當公眾論述用可分享嘅框架去 encode 一件事,而平台指標又令呢個價值變得 legible、countable 嗰陣,象徵價值就被賦予。

作者特別指出,「viral fame」(爆紅)呢個描述唔夠用,因為佢只強調 spread,卻忽略咗:

語言勞動: 令 spread 變得有意義;

指標勞動: 令 spread 變得 durable。

呢個 case 同時示範咗 peripheral visibility 同 nationhood:一個細國、一個低身價球員,透過跨語言嘅框架組合(葡語動員播種、西語危機供應衝突、英語國族製造提供敘事耐久度、共通嘅指標奇觀框架將時刻轉成可攜帶嘅數字),取得全球象徵性存在。


九、對做 data、NLP、體育分析嘅人有咩啟示?

第一,volatile 指標應該當論述證據,唔好當 ground truth。Follower count、like、view 喺高熱度期間極不穩定,仲會撞上 cache、rate limit、介面 artifact。將佢哋 type 成範圍、門檻、報道值、精確值,並標明 confidence 同 evidence type,係一種值得學嘅紀律。

第二,LLM-assisted 標註要有 human-in-the-loop 同 override log。用 LLM 出 suggestion 可以加速,但最終標籤要人手按明確 cue rules 確認,並保留可審計嘅 override 紀錄,先講得上 reproducible。

第三,截圖同 API 數據要嚴格分流。喺今時今日好多分析都靠 scrape 同 screenshot,呢篇 paper 用 SHA-256 hash、人手轉錄、明確唔升級截圖為 API-equivalent 嘅做法,係一個誠實又可複製嘅範式。

第四,數字本身可以係一種語言。對做 prediction market、social listening、品牌監測嘅人嚟講,「一個 metric 點樣被敘述」往往比 metric 嘅絕對值更影響傳播。


十、這篇 paper 的價值

呢篇文章嘅貢獻,唔在於話「Vozinha 爆紅」呢件事有幾誇。佢真正示範嘅係:點樣將一個睇落純屬「網絡熱話」嘅現象,用嚴謹嘅語料 schema、框架 taxonomy、標註流程同數據紀律,變成一個可複製、可延伸嘅研究對象。

最值得帶走嘅一句係:個數字唔只係記錄咗能見度,佢本身成為咗生產能見度嘅其中一種語言。

作為 v0.1 pilot,作者亦好坦白標明限制:唔擁有完整 API-native follower 歷史、語料係 seeded 樣本、單一 case study 嘅 generalizability 有限。佢哋將貢獻定位成一套方法與類型學,而唔係一個完整結論——呢種克制,本身就值得學。


Reference

  1. Vinicius Covas. From 50K to 8.2 Million in 24 Hours: Vozinha's Algorithmic Consecration and the Multilingual Making of World Cup Visibility. arXiv:2606.19647v1 [cs.CL], 17 Jun 2026. https://arxiv.org/abs/2606.19647

  2. José van Dijck. The Culture of Connectivity: A Critical History of Social Media. Oxford University Press, 2013.

  3. Taina Bucher. If...Then: Algorithmic Power and Politics. Oxford University Press, 2018.

  4. Alice E. Marwick. Status Update: Celebrity, Publicity, and Branding in the Social Media Age. Yale University Press, 2013.

  5. Crystal Abidin. Internet Celebrity: Understanding Fame Online. Emerald Publishing, 2018.


原文 Paper


bottom of page