為每一幀控球估值並畫出傳球價值曲面
教練看錄影時問的問題,很少是「這次進攻最後有沒有射門」,而是「這一刻,傳給誰、帶球還是射門,哪一個較好」。要回答這條問題,模型不能只在事件發生時給一個數,而要在每一幀都有一個可解釋的估值,並且能說明這個數由甚麼組成。
Javier Fernández(FC Barcelona、加泰隆尼亞理工大學)、Luke Bornn 與 Daniel Cervone 發表 A framework for the fine-grained evaluation of the instantaneous expected value of soccer possessions(arXiv 2011.09426,後刊於 Machine Learning)。文章提出 Expected Possession Value(EPV)框架:以追蹤數據為輸入,把「下一個入球屬於哪一隊」這個期望值,拆成傳球、帶球、射門三條分支,每條分支再拆成成功機率與成功/失敗後的價值,逐一以獨立模型估計,最後按公式合併。本文按原文脈絡導讀,並在文末補充這種「分解後逐件校準」的做法對賽果預測系統的意義。

本文重點
原文要解決的問題是:在任何一個時刻 t,給定 22 名球員與足球的位置,估計 G ∈ {−1, +1} 的期望值,即下一個入球由本隊(+1)還是對手(−1)取得。這個值逐幀計算,就是一條描述控球價值如何隨時間變化的時間序列。
作者的核心主張是:單一模型直接估 EPV 可以做到準確,但對教練沒有用。教練需要知道這個值為何上升或下跌,以及當時有沒有更好的選擇。所以原文把 EPV 按全期望公式拆成一組子問題:動作選擇機率、傳球成功機率、傳球選擇機率、成功與失敗傳球的價值、帶球成功機率、成功與失敗帶球的價值、射門價值(即 xG)。每個子模型獨立訓練,最後合併;三個與傳球相關的模型以全卷積神經網絡輸出整個球場的機率曲面,其餘用淺層神經網絡。原文以 633 場英超比賽驗證,所有組件與合併後的 EPV 在測試集的校準誤差(ECE)都低於 0.01。
一、為何要拆開來估
原文回顧了此前的動作估值方法:Rudd 的 Markov chain、Singh 的 xT、Decroos 等人的 VAEP、Power 等人以傳球後 10 秒內射門期望計算傳球回報、Spearman 以物理模型評估離球位置。作者指出這些方法各有限制:只用事件數據中的位置與時間、依賴人手規則,或只針對一種動作。一個同時考慮整個球場空間與 22 名球員動態的 EPV 框架,此前未被提出,也未被完整驗證。
分解的好處有三。第一,每個子問題可以用最適合它的模型與特徵,而不是把所有東西塞進一個網絡。第二,教練可以看到每個組件的數值,知道最終估值由甚麼構成。第三,每個組件可以單獨使用,例如只取傳球成功機率曲面來分析傳球路線。
原文以 Markov 決策過程的語言表述這個問題:持球球員是代理人,可以從動作集合 A 中選擇;目標不是找最優策略,而是在歷史數據學到的平均策略下估計狀態值 EPV(s)。這一點與強化學習的常見用法不同。
二、分解公式
設動作集合 A = {傳球 ρ、帶球 δ、射門 ς}。按全期望公式,EPV 等於三種動作的條件期望,以各自的選擇機率加權:
EPV(t) = Σ E[G | A = a, T(t)] × P(A = a | T(t))
其中 T(t) 是時刻 t 的追蹤數據快照。
傳球的落點可以是球場上任何位置,所以傳球分支要再對所有落點 l 求和:E[G | A = 傳球,D = l] 乘以傳球選擇機率 P(D = l)。帶球與射門則假設只有一個落點:帶球是球員維持速度 1 秒後的位置,射門是球門線中點。
傳球價值再按結果拆開:成功傳球的價值乘以成功機率,加上失敗傳球的價值乘以失敗機率。帶球同理。射門的期望值 E[G | 射門] 就是 xG。
原文強調一個設計決定:模型不假設成功傳球必然帶來正回報,也不假設失敗傳球必然帶來負回報。成功與失敗傳球的價值各自由數據學習,輸出範圍都是 [−1, 1]。
三、特徵:由追蹤數據建構空間與情境
所有模型的輸入都由 10Hz 追蹤數據導出。原文把特徵分成兩類。
空間特徵: 球員與足球的座標、速度向量、與球門的距離和角度,以及由此推導的 pitch control(某位置由哪一隊控制的機率)與 pitch influence(一組球員對某位置的影響程度)。後兩者沿用作者早前的統計模型,以正態分佈描述球員可到達的範圍,並按速度調整均值與協方差。
情境特徵: 與巴塞隆拿的比賽分析師合作定義,包括控球起止時間、動態壓迫線(dynamic pressure lines)、被越過的球員數、可攔截性,以及以事件數據訓練的基準模型。
動態壓迫線是原文的一個重要概念。防守時,球員傾向與隊友對齊成幾組,例如後衛、中場、前鋒三條線。原文以 complete-linkage 分層聚類把同隊球員按 x 座標分成 k = 3 組,每組的平均位置就是一條垂直壓迫線;按 y 座標分組則得到水平壓迫線。有了壓迫線,就能計算持球者相對對手陣式的位置,以及一次傳球越過了多少條線、多少名對手。原文提到,參與研究的足球專家認為破線傳球對提高最終入球期望有顯著影響。
四、傳球:從單點標籤學出整個球場的曲面
傳球分支是原文技術上最重的部分。此前的傳球模型通常假設傳球選項只有場上隊友所在的位置;原文則要為球場上每一個位置估計成功機率、選擇機率與價值。
做法是把球場離散成 104 × 68 的網格,每個模型的輸入是一疊同樣大小的圖層,每層記錄一種位置相關的資訊:本隊球員位置、對手位置、雙方速度、每個位置與球門和足球的距離及角度等。傳球成功機率模型用 13 層,傳球價值模型用 16 層,後者另加壓迫線、被越過球員數,以及一張由預訓練模型輸出的傳球成功機率曲面。
特徵提取部分是作者早前提出的 SoccerMap 架構:全卷積網絡在 1x、1/2x、1/4x 三個尺度提取特徵,再合併成一張 104 × 68 的預測曲面,兼顧局部與全局資訊。
訓練上的難點在於標籤只有一個像素。一次傳球只有一個落點,只知道這一點的結果是成功還是失敗,但模型要輸出整張曲面。原文的做法是在訓練時只取預測曲面在該落點的值,計算 log loss(成功機率模型)或均方誤差(價值模型),再反向傳播。作者稱這是一個極端的學習設定,但結果顯示可以學出校準良好的整張曲面。
三個傳球模型分工如下:
傳球成功機率: 每個位置輸出 sigmoid 後的機率,以觀察到的傳球結果訓練。
傳球價值: 成功與失敗各訓練一個模型,一個只用成功傳球,一個只用失敗傳球。輸出經 sigmoid 再線性變換到 [−1, 1]。
傳球選擇機率: 對整張曲面取 softmax,令所有位置的機率加總為 1,用作加權矩陣。訓練時只用觀察到的傳球,在落點處與 1 計算 log loss。
五、帶球、射門與動作選擇
帶球在原文定義為 1 秒內球員保持控球的動作,落點假設為維持速度後的位置。帶球成功機率以兩層全連接的淺層網絡估計,特徵包括對手在該位置的密度、本隊的 pitch control,以及最近的本隊與對手壓迫線。帶球價值同樣分成功與失敗兩個模型,另加帶球成功機率作輸入。
射門價值即 xG。原文在常見的位置與角度特徵之外,加入 3 米內的對手人數、持球者與兩支門柱形成的三角形內的對手人數、門將位置的三項特徵、是否頭球,以及一個以事件數據訓練的基準 xG 作先驗。基準模型用 OPTA 的 117,948 次射門、12,266 個入球,以 XGBoost 訓練,測試集 log loss 為 0.2540、ECE 為 0.00594。
動作選擇機率也是淺層網絡,輸出三個動作的 softmax 機率,特徵包括足球位置、與球門的距離和角度、pitch control、雙方壓迫線相對位置,以及基準 xG。
六、估計目標:下一個入球,不是這次控球
每個組件的訓練目標不同。成功機率類模型用短期結果:傳球有沒有被隊友接到、帶球後有沒有保住控球。價值類模型則用長期回報,原文對此有一個不常見的定義。
一般做法是控球權易手時便結束。原文改為:控球直到下一個入球才結束,中間不論足球出界或控球權易手多少次。入球出現後,兩個入球之間的所有動作,屬入球一方的得 +1,另一方得 −1。
這個定義會為距離入球很遠的動作帶來噪音。原文引入一個常數 ε:距入球超過 ε 秒的動作回報設為 0。作者取 ε = 15 秒,即數據中一次標準控球的平均長度。這等於假設當前控球狀態只有 15 秒的影響力。原文數據平均每場 2.8 個入球、1,433 個動作,這個比例正說明了為何要謹慎定義長期回報。

七、數據、訓練與校準結果
原文使用 STATS LLC 提供的 633 場英超(2013/14、2014/15 球季)光學追蹤數據與事件數據,共 480,670 次傳球、413,123 次帶球、13,735 次射門,成功率分別為 79.64%、90.60%、8.54%。比賽隨機切分為訓練 379 場、驗證 127 場、測試 127 場;訓練集內的事件會打亂次序,避免時間上相鄰事件的相關性造成偏差。
優化採用 Adam,學習率在 {1e-3, 1e-4, 1e-5, 1e-6} 與批次大小 {16, 32} 之間作網格搜索,並設 early stopping。傳球成功機率與傳球選擇機率兩個模型在驗證集上略有校準偏差,原文以 temperature scaling 校正,溫度分別為 0.82 與 0.5。
評估分兩層。損失函數上,機率類模型用交叉熵,價值類模型用均方誤差。校準上,原文用 Expected Calibration Error:把預測分成 10 個等量分箱,計算每箱平均預測與平均實際結果之差,再按樣本數加權。
組件 | 損失 | ECE | 參數量 | 每秒預測樣本 |
傳球成功機率 | 0.190 | 0.0047 | 401,259 | 942 |
帶球成功機率 | 0.2803 | 0.0051 | 128 | 67,230 |
傳球成功 EPV | 0.0075 | 0.0011 | 403,659 | 899 |
傳球失敗 EPV | 0.0085 | 0.0015 | 403,659 | 899 |
傳球選擇機率 | 5.7134 | 不適用 | 401,259 | 984 |
傳球 EPV × 選擇 | 0.0067 | 0.0011 | 不適用 | 不適用 |
帶球成功 EPV | 0.0128 | 0.0022 | 153 | 57,441 |
帶球失敗 EPV | 0.0072 | 0.0025 | 153 | 57,441 |
射門 EPV | 0.2421 | 0.0095 | 231 | 72,455 |
動作選擇機率 | 0.6454 | 不適用 | 171 | 23,709 |
EPV(合併) | 0.0078 | 0.0023 | 不適用 | 不適用 |
有兩點值得留意。第一,合併後的 EPV 損失(0.0078)與三條分支各自的 EPV 損失在同一水平,作者視之為模型組合穩定的證據。射門 EPV 的損失明顯較高,原文歸因於射門樣本遠少於傳球與帶球。第二,最慢的組件每秒仍可預測 899 個樣本,是 10Hz 追蹤數據頻率的 89 倍,原文據此指出框架可用於即時計算。

校準圖亦顯示各模型的預測分佈。帶球成功機率多數高於 0.5,傳球成功機率則分佔 0 至 1 整個範圍,反映保住控球比傳球成功容易。動作選擇機率受各動作的頻率主導,帶球與傳球的分佈遠較射門闊。
八、四個實務應用
原文第七節用四個例子示範框架的用法。
即時控制室: 一個以 EPV 組件為基礎的視覺工具。左邊是某一幀的 2D 場地圖,疊上傳球 EPV added 曲面;中間是三種動作的選擇機率與期望值;右邊是該次控球的 EPV 隨時間變化,以及每一幀最佳傳球選項的期望值。原文的例子中,整體 EPV 為 0.032,而最佳傳球選項可把它推高至 0.112。教練可以由此向球員說明,在該情境下傳給禁區內或禁區外的隊友,比射門有更高的入球期望。
不同動作的價值分佈不同: 原文以壓迫線、pitch control 等特徵把傳球與帶球分成十類,計算每類動作的 EPV added(動作結束時 EPV 減開始時 EPV)並做核密度估計。破第一條壓迫線的傳球分佈以 0 為中心,大部分數值在 [−0.01, 0.015];破第三條線的傳球分佈中心約 0.005,大部分在 [−0.025, 0.05]。受壓(pitch control 低於 0.4)的動作分佈較闊,負值密度較高,即較易失去控球,但成功時增值也較大。傳中是最容易大幅失值的動作,但成功時的高增值機率也高於其他動作;長傳情況相似。回傳的分佈最窄,接近一半機率落在正值一側。失去控球通常帶來負值,但若在對方禁區附近受壓時傳入禁區而失去控球,因為有反彈機會,期望值有時反而上升。
壓迫利物浦: 以 2014/15 球季 Brendan Rodgers 的利物浦為對象,按對手在利物浦組織推進時使用的陣式(以三條壓迫線的人數表示),計算利物浦在球場每個位置的在球優勢(正 EPV added 傳球的總和)與離球優勢(若接到傳球會令 EPV 上升的位置)。原文的結論是 4-3-3 最能阻止利物浦由陣式內部推進,把傳球推向兩側;4-2-4 阻止內部推進的效果更強,但中場兩側留出空間,只有己隊翼衛速度足夠才可行;5-3-2 則對利物浦明顯有利。

圍繞 David Silva 建隊: 以 2014/15 球季曼城為例,計算 Silva 與每名隊友之間傳球的在球 EPV added、離球 EPV added 與選擇比例,全部按同場時間標準化為每 90 分鐘。原文發現翼鋒與前鋒為 Silva 製造空間並從他的傳球得到高增值;最常被選擇的是中場 Yaya Touré,他也是最常找 Silva、給 Silva 最高價值的中場;Fernandinho 與 Silva 的互相增值高於 Fernando。在翼鋒之中,Milner 與 Jovetic 能製造空間並從 Silva 得益,Navas 與 Nasri 則更常找到 Silva 並帶來較高增值。教練可據此決定要用能受惠於 Silva 傳球的翼鋒,還是能增加 Silva 參與度的翼鋒。
九、對賽果預測系統的啟示
原文最值得帶走的是一個工程判斷:與其訓練一個直接輸出 EPV 的大模型,不如把它拆成一組各有明確意義的子問題,逐一訓練、逐一校準,再按公式合併。作者的驗證方式也對應這個判斷:不只看合併後的損失,還要看每個組件在測試集的 ECE,確認沒有一個環節把偏差帶進最終估值。
AIP 系統 在建立賽果機率模型時,採用的是同一種結構。讓球、入球大細與角球三類盤口不共用一個黑盒輸出,而是由各自擅長的模型獨立評分,再以 ensemble 加權整合;每輪更新都以校準曲線、Brier score 與 log loss 檢查機率是否貼近實際發生率,並在完全未參與訓練的 held-out 賽事上回測。這與原文為每個組件單獨報告 ECE 的做法目的一致:合併後的數字好看並不足夠,每一層都要對得上實際結果。
原文另一個設計也有直接對應。作者以 ε = 15 秒截斷長期回報,理由是太遠的動作與入球之間噪音太大,勉強學習只會令模型記住偶然事件。賽果預測面對同一個問題:一支球隊三個月前的表現、一場冷門盃賽的數據,與今日這場比賽的關係往往很弱。AIP 在特徵工程上以滾動近況處理這類訊號,並在門檻篩選階段對數據不足或盤口急變的場次不作輸出,避免把噪音當作證據。
總結:
EPV 框架把「下一個入球屬於誰」拆成動作選擇、傳球、帶球、射門四組子問題,傳球部分再以全卷積網絡從單點標籤學出整個球場的曲面。633 場英超的驗證顯示,所有組件與合併後的 EPV 都校準良好,且計算速度足以即時運作。原文隨後以控制室、動作價值分佈、壓迫陣式分析與建隊配對四個例子,說明分解後的組件如何直接回答教練的問題。
概念 | 原文做法 | 實務作用 | 章節 |
EPV 定義 | E[G|T(t)],G ∈ {−1, +1} | 逐幀的控球價值時間序列 | 本文重點 |
分解公式 | 三種動作的期望 × 選擇機率;傳球再對落點求和 | 每個組件可獨立解釋與使用 | 二 |
動態壓迫線 | 同隊球員按 x 座標分 3 組聚類 | 計算破線、相對陣式位置 | 三 |
傳球曲面 | SoccerMap 全卷積網絡,104 × 68,單像素標籤訓練 | 任何位置的成功機率、選擇機率、價值 | 四 |
長期回報 | 控球至下一個入球結束;ε = 15 秒截斷 | 平衡短期結果與長期價值 | 六 |
校準 | 每組件 ECE < 0.01;temperature scaling | 容許對動作子集做細緻比較 | 七 |
應用 | 控制室、動作分佈、壓迫陣式、建隊配對 | 直接回答教練的具體問題 | 八 |
原文最後列出可在此框架上延伸的方向:在球與離球球員表現分析、賽前賽後的球隊戰術評估、球探用的球員檔案、青年球員成長追蹤、比賽精華偵測。
Reference
J. Fernández, L. Bornn, D. Cervone. A framework for the fine-grained evaluation of the instantaneous expected value of soccer possessions. arXiv:2011.09426, 2020;Machine Learning 110, 1389–1427, 2021. https://doi.org/10.1007/s10994-021-05989-6
J. Fernández, L. Bornn, D. Cervone. Decomposing the Immeasurable Sport: A deep learning expected possession value framework for soccer. MIT Sloan Sports Analytics Conference, 2019.
J. Fernández, L. Bornn. SoccerMap: A Deep Learning Architecture for Visually-Interpretable Analysis in Soccer. arXiv:2010.10202, 2020.
J. Fernández, L. Bornn. Wide Open Spaces: A statistical technique for measuring space creation in professional soccer. MIT Sloan Sports Analytics Conference, 2018.
D. Cervone, A. D'Amour, L. Bornn, K. Goldsberry. A Multiresolution Stochastic Process Model for Predicting Basketball Possession Outcomes. Journal of the American Statistical Association, 2016.
T. Decroos, L. Bransen, J. Van Haaren, J. Davis. Actions Speak Louder than Goals: Valuing Player Actions in Soccer. KDD 2019. https://arxiv.org/abs/1802.07127
C. Guo, G. Pleiss, Y. Sun, K. Q. Weinberger. On Calibration of Modern Neural Networks. ICML 2017.



