為足球場上每一個動作定價:Actions Speak Louder than Goals 與 VAEP 框架
2017 年 12 月 23 日,班拿貝球場,第 93 分鐘。巴塞隆拿以 2-0 領先皇家馬德里,Messi 盤球突入禁區後,沒有射門,反而把足球回傳到六碼區以外。Aleix Vidal 接應射入,比數變成 3-0。
以傳統統計衡量,這次進攻只留下兩個數字:Vidal 一個入球,Messi 一個助攻。Messi 那記回傳的判斷力,以及此前 Busquets 的直線傳球,都沒有位置。KU Leuven 的 Tom Decroos、Jesse Davis 與 SciSports 的 Lotte Bransen、Jan Van Haaren 在 2019 年 KDD 大會發表 Actions Speak Louder than Goals: Valuing Player Actions in Soccer,文中的框架把這記回傳評為 +0.09 個入球,並指出在以事件數據為基礎的方法之中,此前沒有一個會給 Messi 這個分數。
本文依原文脈絡導讀:先談現有方法的三個缺口,再介紹論文的兩項貢獻,即統一數據格式的 SPADL 語言,以及為每個動作定價的 VAEP 框架;繼而跟隨原文的實驗與案例,最後補充這套方法對球隊評估與賽果預測的意義。

本文重點
原文要解決的問題是:一名球員在比賽中作出的每一個動作,對球隊的表現有多大影響。這個問題關乎球員收購、評估與球探工作,但足球入球少、局面連續,一直沒有客觀的量化方法。
作者提出兩項工具。SPADL(Soccer Player Action Description Language)把 Opta、Wyscout、StatsBomb 等不同供應商的事件數據,轉換成同一套只有九個屬性的動作描述。VAEP(Valuing Actions by Estimating Probabilities)則為每個動作計算一個以入球為單位的價值,即動作前後,球隊在接下來 10 個動作內入球與失球的機率變化。兩者均透過 Python 套件 socceraction 公開。
一、現有方法的三個缺口
原文開首指出,足球比賽入球少,大部分動作不會直接改變比數,卻往往有長遠效果。一記由一側翼位傳向另一側的長傳,未必立即帶來入球,卻可以在幾個動作之後拉開空間,製造機會。
現有為動作定價的方法,在作者看來有三個限制。
只看射門與入球:此前的研究大多集中在射門的預期價值,即 xG 一類概念,其餘動作幾乎不獲評分。
價值固定,不看情境:很多傳球指標把後防之間無壓力的橫傳,與前場在對手緊迫下的傳球,視為同一種東西。
只看即時效果:大部分方法只計算動作的直接結果,不會追蹤幾個動作之後的影響。
VAEP 的設計正是針對這三點:所有類型的動作都會計算,價值取決於動作發生的情境,並且會看動作之後一段時間的發展。直觀地說,一個價值 +0.05 的動作,預期為本隊帶來 0.05 個入球;價值 −0.05 的動作,預期為對手帶來 0.05 個入球。
二、SPADL:先讓數據說同一種語言
在為動作定價之前,作者先處理一個工程問題。市面上的事件數據並非為數據分析而設計,原文列出五個具體困難:數據為廣播與媒體服務而生,重要資訊可能缺失(例如 Wyscout 不記錄射門的準確終點);每家供應商各有術語與定義;格式為向後兼容而保留早期設計,例如 Opta 按射門結果分為四種事件類型;不少事件附帶可選的補充資料,長度不一;機器學習模型需要固定長度的特徵向量,分析師因此要為每家供應商另寫一套前處理程式。
SPADL 只描述「動作」,即需要球員執行的事件,賽事結束一類事件不在其內。每個動作固定九個屬性:開始與結束時間、開始與結束位置、球員、球隊、動作類型、身體部位、結果。動作類型共 21 種,包括傳球、傳中、界外球、角球、盤球、過人、搶截、攔截、解圍、射門、十二碼、門將撲救等。身體部位分四種,結果最多六種,最常見的是成功與失敗,另有越位、烏龍球、黃牌、紅牌。
原文附錄提到,Wyscout 數據轉成 SPADL 之後,每場比賽平均約 1,250 個動作,其中傳球佔 64.63%,盤球 8.69%,攔截 5.01%。作者發佈的套件可將 Opta、Wyscout 與 StatsBomb 三家的數據轉成 SPADL。
三、VAEP:進攻值加防守值
VAEP 的出發點是:球員做動作,一般是為了提高本隊入球的機會,或降低本隊失球的機會。由於大部分動作的影響有時限,評估一個動作的方法,就是計算它令這兩個機率在短期內改變了多少。
設比賽狀態 S(i) 為直至第 i 個動作為止的所有動作。對球隊 x 而言,動作 a(i) 把狀態由 S(i−1) 帶到 S(i),入球機率的變化為:
ΔP(入球) = P(入球 | S(i)) − P(入球 | S(i−1))
這個變化為正,代表動作提高了球隊 x 入球的機率,原文稱之為動作的進攻值。失球機率的變化以同樣方式計算,但因為所有動作都應該降低失球機率,作者把它的負值稱為防守值。兩者相加就是動作的 VAEP 值:
V(a) = ΔP(入球) + (−ΔP(失球))
原文強調,這個框架把「一個動作值多少」這個主觀問題,轉化成「未來一段時間會否入球或失球」這個可以客觀預測的問題,而且不依賴任何特定的動作表示方式。
球員評分則是把該球員在某段時間內所有動作的 VAEP 值加總,再按上陣分鐘換算成每 90 分鐘的數值。這個數字的意義是:球員每 90 分鐘平均為球隊貢獻多少淨入球差。評分也可以按動作類型分開計算,用來描繪球員風格。

四、如何估計入球與失球機率
框架需要的機率由機器學習模型估計。作者把「近期」定義為動作之後的 k = 10 個動作,這個數字來自足球知識與初步實驗。
其中一個關鍵簡化是:主隊的失球機率就是客隊的入球機率,反之亦然。因此只需為當時控球的一方估計入球與失球兩個機率,另一方的數字自然得出。問題於是變成兩個輸入相同、標籤不同的二元分類:控球隊在之後 10 個動作內有否入球;控球隊在之後 10 個動作內有否失球。
特徵方面,作者不用整場比賽的歷史描述狀態,只取 {a(i−2)、a(i−1)、a(i)} 三個最近的動作,特徵長度因此固定,注意力也集中在最相關的情境。三個動作是實驗中表現較好的窗口。特徵分三類:
SPADL 特徵:每個動作的類型、結果、身體部位,起點與終點座標,以及比賽已進行的時間。
複合特徵:起點與終點到球門的距離和角度,動作在 x 與 y 方向的位移;相鄰兩個動作之間的距離、時間差,以及控球權有否轉換。這些特徵大致反映當時的比賽節奏。
比賽情境特徵:控球隊與防守隊在該時刻的入球數,以及入球差。球隊會按比數調整踢法,領先 1-0 的球隊通常踢得比落後 0-1 的球隊保守。
分類器選用 CatBoost。原則上任何能輸出機率的模型都可以,但作者指出,機率必須校準良好,因為 VAEP 值由機率相加相減得出。第九節會以實驗支持這個選擇。
數據方面,Wyscout 提供英格蘭、西班牙、德國、意大利、法國、荷蘭、比利時七個頂級聯賽 2012/13 至 2017/18 球季共 11,565 場聯賽賽事,不含友誼賽、盃賽與歐洲賽。模型分兩次訓練:以 2012/13 至 2015/16 訓練,評估 2016/17;以 2012/13 至 2016/17 訓練,評估 2017/18。訓練與評估按球季切開,沒有以未來數據預測過去。
五、一次進攻的六個動作
回到開首那個入球。原文以這次進攻的六個動作,示範框架如何運作。
Busquets 把足球傳向右路(1),局面沒有變好也沒有變差,價值 0.00。Messi 回傳 Busquets(2),足球退到較差的位置,價值 −0.01。Busquets 直線傳球給 Messi(3),足球終於逼近球門,價值 +0.01。Messi 接球後盤過一名皇馬防守球員突入禁區(4),入球機率由 0.03 升至 0.08,價值 +0.05。
第五個動作是關鍵。Messi 把足球回傳,退出擠迫的六碼區(5)。框架給這記傳球 +0.09,因為入球機率由 0.08 升至 0.17。作者指出,模型純粹從數據學到:在這個情境下,把足球傳離對方球門是好選擇;據他們所知,此前沒有任何以事件數據為基礎的方法會為這個動作給 Messi 加分。
最後 Vidal 射入(6)。把 0.17 的機會轉化為入球,價值 +0.83。若他射失,這個動作的價值會是 −0.17。
這個例子也說明 VAEP 與 xG 的關係:一次射門前的狀態值,就是這次射門的 xG;射門動作本身的價值,是結果(1 或 0)減去這個 xG。
六、與入球、助攻榜的比較
球員的進攻貢獻通常以入球與助攻計算。原文以 2017/18 英超上陣至少 900 分鐘的 305 名球員為對象,比較每 90 分鐘入球、每 90 分鐘助攻、兩者合計,以及 VAEP 評分四個榜單的前十名。
入球榜前十是專注把握機會的前鋒,Salah(0.986)、Agüero(0.960)、Aubameyang(0.851)、Kane(0.847)居前。助攻榜前十多是為隊友製造機會的中場,Mkhitaryan、Coutinho、Sané、De Bruyne 居前。入球加助攻榜試圖平衡兩者。
VAEP 榜前十如下(括號內為在 305 人中的排名):
VAEP 排名 | 球員 | VAEP/90 | 入球榜 | 助攻榜 | 入球加助攻榜 | 市值 |
1 | P. Coutinho | 0.899 | 10 | 2 | 4 | €140m |
2 | M. Salah | 0.817 | 1 | 23 | 2 | €150m |
3 | K. De Bruyne | 0.641 | 72 | 4 | 15 | €150m |
4 | E. Hazard | 0.636 | 21 | 122 | 34 | €150m |
5 | R. Mahrez | 0.635 | 34 | 11 | 16 | €60m |
6 | A. Martial | 0.607 | 13 | 13 | 9 | €60m |
7 | R. Sterling | 0.579 | 7 | 6 | 5 | €120m |
8 | P. Pogba | 0.549 | 55 | 9 | 28 | €80m |
9 | H. Kane | 0.545 | 4 | 140 | 6 | €150m |
10 | Son Heung-min | 0.539 | 19 | 36 | 17 | €50m |
作者提出兩點觀察。其一,De Bruyne、Hazard 與 Mahrez 三人公認是英超明星,卻不在任何一個傳統榜單的前十;VAEP 把三人排入前五。其二,VAEP 榜前十球員的市值總和(Transfermarkt,2019 年 2 月 1 日)為 11.1 億歐元,高於入球榜的 8.62 億、助攻榜的 7.60 億,以及入球加助攻榜的 9.47 億。

市值由市場決定,並非客觀真值。作者只把它當作旁證,說明 VAEP 捕捉到的球員貢獻,比傳統指標更貼近球會實際願意付出的價錢。
七、球探用途:年輕球員與較小聯賽
英格蘭與西班牙聯賽競爭最激烈,年輕球員難有上陣時間,球會因此傾向從法國、荷蘭、比利時等聯賽收購新星。原文分開列出 2017/18 球季這兩組聯賽中,1997 年 1 月 1 日後出生、上陣至少 900 分鐘球員的 VAEP 前五。
英西聯賽:Rashford(曼聯,0.406)、Alexander-Arnold(利物浦,0.405)、Dembélé(巴塞,0.360)、Jonjoe Kenny(愛華頓,0.344)、Oyarzabal(皇家蘇斯達,0.337)。作者特別點出第四名的 Kenny:市值只有 500 萬歐元,遠低於 Rashford 與 Dembélé,原因在於他是防守球員,而且身處中游球會,隊友質素有限。VAEP 評分顯示他的價值高於市場估計。
法荷比聯賽:David Neres(阿積士,0.620)、Mason Mount(維迪斯,0.616)、Malcom(波爾多,0.567)、Mbappé(巴黎聖日耳門,0.507)、Frenkie de Jong(阿積士,0.495)。原文寫作時,Neres 已成為利物浦、車路士、阿仙奴的收購目標,Mount 獲選維迪斯年度最佳球員,Malcom 與 de Jong 先後加盟巴塞。
作者的結論是,只要有事件數據,這個框架可以為世界任何聯賽產生排名,包括次級聯賽以及美洲、亞洲聯賽。
八、風格拆解,以及質量與數量的取捨
把 VAEP 按動作類型分開計算,就得到球員的風格輪廓。原文舉出兩宗收購案例。
2017 年夏天,巴塞失去 Neymar,先後收購 Dembélé 與 Coutinho。按動作類型比較三人:Dembélé 與 Coutinho 的傳球價值都高於 Neymar,但 Neymar 的盤球明顯優勝;Dembélé 的傳中勝過 Neymar,Coutinho 的射門勝過 Neymar。作者認為兩人都是合理目標,因為能複製 Neymar 盤球能力的球員本來就少,而兩人在其他方面有所補足。
2018 年夏天,皇馬失去 C. Ronaldo,傳聞目標包括 Rashford 與 Hazard。數據顯示兩人都遠遠不及 Ronaldo 的射門價值;Ronaldo 每 90 分鐘的射門總值,高於兩人相加。Hazard 在所有方面都優於 Rashford,但 Rashford 的傳球與盤球評分與 Ronaldo 相近,風格較接近。作者的判斷是:若皇馬要維持現有踢法,21 歲的 Rashford 較合適;若要即時提升實力,28 歲的 Hazard 是更好的球員。
另一個角度是動作的數量與質量。球員做的動作越多,每個動作的平均價值越難維持高位。原文以 2017/18 英西聯賽球員為對象,橫軸為每個動作的平均價值,縱軸為每 90 分鐘的動作數,兩者相乘就是 VAEP 評分。Kane 與 Salah 這類前鋒動作少但平均價值高;De Bruyne 與 Pogba 這類中場動作多但平均價值較低;Coutinho、Hazard、Mahrez、Martial、Sterling、Son 落在兩者之間。西班牙聯賽出現同樣的兩種類型,Kroos 與 Isco 屬多動作型,Ronaldo、Griezmann、Bale 屬少而精型。Messi 是例外:數量與質量同時高企,圖中以一條等值線顯示他與其餘球員的差距。
九、設計選擇的驗證
為動作定價沒有客觀真值,準確率、精確率一類指標都用不上。作者的做法是評估框架的各個組件:入球與失球機率有真實標籤,可以直接檢驗。
評估指標用 Brier score 與 ROC AUC。Brier score 同時衡量準確度與校準度,在報告真實機率分佈時達到最小值;這對 VAEP 特別重要,因為動作值由機率相加相減得出。ROC AUC 衡量模型區分正負例的能力,而且不受類別不平衡影響;數據中只有 1.5% 的狀態在之後 10 個動作內入球,失球更只有 0.5%。
特徵集方面,對比四個基準:無特徵(永遠預測基準率)、只有位置、只有動作類型、位置加動作類型。全部特徵在入球與失球兩個任務、兩個指標上都最好。入球機率的 AUC 由只有位置的 0.7330 升至 0.7693;失球機率的 AUC 由 0.6770 升至 0.7313。
演算法方面,對比 Logistic Regression、Random Forest、XGBoost、CatBoost,全部用同一組特徵。CatBoost 在四個指標都最好,XGBoost 緊隨其後。作者把這個微小差距歸因於 CatBoost 對類別特徵的處理,XGBoost 只用 one-hot 編碼。附錄記錄的訓練時間則相反:CatBoost 在較大訓練集上需要 140 分鐘,XGBoost 22 分鐘,Logistic Regression 6 分鐘。

十、作者承認的限制
原文最後一節列出四個尚未解決的問題。
其一,只計有球動作。模型只為球員有球在腳時的動作定價,但防守很大程度在於用站位與預判阻止對手拿球,這些都不在事件數據之內。
其二,跨聯賽難以比較。在較小聯賽做出高價值動作,比在英西聯賽容易;第七節中法荷比聯賽年輕球員的評分普遍高於英西聯賽,正是這個效應。
其三,同一聯賽內的跨球會比較也有偏差。在隊友出色的頂級球會,做出高價值動作也比在中游球會容易。
其四,信任問題。傳統球探不熟悉這種評分方式,而 VAEP 評分也不如每 90 分鐘入球那樣直觀;對分析背景較弱的球探而言,要理解評分究竟量度甚麼並不容易。
對球隊評估與賽果預測的啟示
原文有一點對預測系統特別有用:動作值由機率相加相減得出,機率的校準度因此比區分能力更重要。作者選模型時以 Brier score 為準,而非只看 AUC,並把訓練與評估按球季切開。賽果預測面對的是同一問題:一個模型可以把強隊排在弱隊之前,但若輸出的機率系統性地偏高或偏低,與市場賠率比較時便會得出錯誤的價值判斷。
AIP 系統 建立球隊評估時採用同一思路:除了 xG 一類射門質素指標,也把控球推進、攻防轉換等動作層面的價值訊號納入特徵,原因正如原文所言,射門與入球只是全部動作中極小的一部分。模型輸出的機率會與市場隱含機率對照,並以樣本外、按時間切分的數據檢驗校準;若差距不足,或關鍵數據缺失,系統不會產生推介。
原文承認 VAEP 難以跨聯賽比較,因為在較弱的聯賽做出高價值動作較容易。這一點對跨聯賽的預測同樣成立,所以球隊層面的動作價值訊號應在同一聯賽內比較,而不應直接把不同聯賽的數值放在同一尺度上。
總結:把主觀評價變成可驗證的預測
這篇論文的核心是一次問題轉換。「這個動作值多少」沒有客觀答案,「接下來 10 個動作內會否入球或失球」則有。VAEP 以後者的機率變化定義前者,再以 SPADL 統一數據格式,令整條流程可以在 Opta、Wyscout、StatsBomb 三家數據上運行。實驗顯示,情境特徵與 CatBoost 的組合在校準與區分能力上都優於只看位置或動作類型的基準;由此得出的球員排名,能找出 De Bruyne、Hazard、Mahrez 這類傳統榜單漏掉的球員,也能在較小聯賽中提前指出 Neres、Mount、de Jong 一類目標。
概念 | 內容 | 章節 |
三個缺口 | 只看射門;價值固定;只看即時效果 | 一 |
SPADL | 九個屬性、21 種動作類型;支援 Opta、Wyscout、StatsBomb | 二 |
VAEP 值 | ΔP(入球) − ΔP(失球);以入球為單位 | 三 |
機率估計 | k = 10 個動作;最近三個動作的三類特徵;CatBoost | 四 |
巴塞第三球 | Messi 回傳 +0.09;Vidal 射門 +0.83 | 五 |
與傳統榜比較 | De Bruyne、Hazard、Mahrez 不在任何傳統 top-10;市值總和 €1,110m | 六 |
球探用途 | Kenny 市值 €5m 但評分排英西聯賽第四;Neres、Mount 領先法荷比聯賽 | 七 |
風格與取捨 | 按動作類型拆分;數量與質量的等值線;Messi 為例外 | 八 |
設計驗證 | 全部特徵 + CatBoost:入球 AUC 0.7693、失球 AUC 0.7313 | 九 |
限制 | 只計有球動作;跨聯賽、跨球會比較;球探信任 | 十 |
VAEP 之後成為多個 possession value 模型的參照點。KU Leuven 同一實驗室在 2019 年底發表的 xT 與 VAEP 比較研究,以及 StatsBomb 的 OBV、American Soccer Analysis 的 g+,在設計上都可以與本文的框架對讀。
Reference
T. Decroos, L. Bransen, J. Van Haaren, J. Davis. Actions Speak Louder than Goals: Valuing Player Actions in Soccer. Proceedings of the 25th ACM SIGKDD International Conference on Knowledge Discovery & Data Mining (KDD 2019), pp. 1851–1861. https://doi.org/10.1145/3292500.3330758
socceraction:SPADL 轉換器與 VAEP 實作。https://github.com/ML-KULeuven/socceraction
M. Van Roy, P. Robberechts, T. Decroos, J. Davis. Valuing On-the-Ball Actions in Soccer: A Critical Comparison of xT and VAEP. AAAI-20 Workshop on AI in Team Sports, 2020.
L. Prokhorenkova, G. Gusev, A. Vorobev, A. V. Dorogush, A. Gulin. CatBoost: Unbiased Boosting with Categorical Features. NeurIPS 2018.
A. Niculescu-Mizil, R. Caruana. Predicting Good Probabilities with Supervised Learning. ICML 2005.
S. Rudd. A Framework for Tactical Analysis and Individual Offensive Production Assessment in Soccer Using Markov Chains. New England Symposium on Statistics in Sports, 2011.



