top of page

全卷積網絡 - 傳球成功機率

6分钟前
讀畢需時 14 分鐘

傳球成功率是電視轉播最常見的數字,也是最沒有資訊量的數字之一。一次五米回傳與一次穿越三名防守球員的直線傳球,在成功率統計裏各佔一次。教練真正想知道的是另一個問題:在這一刻,若把足球傳到球場上任何一個位置,成功的機會有多大,而不只是傳到隊友腳下的那幾個點。

Javier Fernández(FC Barcelona、加泰隆尼亞理工大學)與 Luke Bornn(Simon Fraser University)在 2020 年發表 SoccerMap: A Deep Learning Architecture for Visually-Interpretable Analysis in Soccer(arXiv 2010.10202,刊於 ECML-PKDD 2020 Applied Data Science Track)。論文提出一個全卷積神經網絡,輸入是某一幀的追蹤數據,輸出是一張覆蓋整個球場、每格約一平方米的傳球成功機率曲面。訓練時每次傳球只有一個標籤,就是落點那一格的成功或失敗。本文按原文脈絡導讀,並在文末補充這種「準確度與校準分開報告」的做法對賽果機率模型的意義。


圖 1:SoccerMap 架構與 13 個輸入通道:三個尺度抽取特徵,各自預測,逐級上採樣合併,只在傳球落點計算損失(依原文 Figure 1、§3 整理)

本文重點

原文要解決的問題可以寫成一句:給定一個 104 × 68 × 13 的比賽狀態表示,輸出一個 104 × 68 的矩陣,每格是把足球傳到該位置的成功機率。難點在於標籤。一次傳球只有一個落點,只知道這一點的結果,模型卻要輸出整張曲面。作者稱之為弱監督學習的極端情況:影像分割的標籤通常覆蓋一片像素,這裏只有一個。

作者的答案是借用影像分割的全卷積架構。網絡在 1x、1/2x、1/4x 三個尺度提取特徵,每個尺度各自產生一張預測,再逐級上採樣、融合,最後經 sigmoid 輸出整張曲面。損失函數只取曲面在傳球落點的那一個值,與實際結果計算 log-loss。原文以 740 場英超、433,295 次傳球驗證,SoccerMap 的測試集 log-loss 為 0.217,作為對照、以人手特徵建立的 logistic 模型則為 0.384。

架構的另一個特點是可換輸出層。把 sigmoid 換成 softmax,同一個網絡就變成傳球選擇機率模型;把目標換成該次控球最後一個事件的 xG,就變成傳球價值模型。原文由此引出三個教練工具:最佳傳球落點、最佳離球站位,以及一個評估球員選擇落點質素的指標 PPA。


一、為何要整張曲面,而不只是隊友所在的點

原文回顧的既有方法,可以分成三類。Spearman 等人以物理模型計算每名球員到達並控制足球所需的時間,由此推導傳球機率。Gudmundsson 與 Horton 用 dominant region 判斷傳球後最可能控球的球員。Power 等人則以一組精心挑選的人手特徵建立線性模型,同時估計傳球的風險與回報。

這些方法有一個共通點:它們在一組離散的目標位置上做推論,通常是隊友當時所在的位置,或者由物理模型枚舉的少數落點。作者指出,此前沒有方法直接學習整張機率曲面。

這個差別在實務上有意義。教練分析一次進攻時,經常要問「若傳到那個沒有人的空位,會怎樣」。只在隊友位置上估值的模型回答不了這個問題。曲面模型可以在任何一格讀出數字,包括暫時沒有人、但隊友正在跑向的位置。原文在結果一節特別提到,模型會考慮球員速度,為尚未有人佔據的空間給出傳球機率。


二、把比賽狀態畫成 13 層圖

輸入來自兩種數據。追蹤數據以每秒 10 幀記錄 22 名球員與足球的二維座標;事件數據由人手標註,記錄每次傳球的時間、位置、球員與結果。作者先把座標標準化,令控球一方一律由左向右進攻。

球場離散成 104 × 68 的網格,每格約一平方米。原文在每次觀察到傳球的那一幀,由追蹤數據導出 13 層同樣大小的矩陣,分四組:

球員位置與速度: 六層稀疏矩陣,攻守雙方各三層,分別記錄球員位置,以及速度向量的兩個分量。

距離: 兩層密集矩陣,每格記錄到足球的距離與到球門的距離。

角度: 兩層密集矩陣記錄每格到球門與足球角度的正弦與餘弦,另一層記錄到球門的角度弧度值。

持球者與隊友的關係: 兩層稀疏矩陣,記錄持球者速度向量與每名隊友之間角度的正弦與餘弦。

這組通道全部是低階資訊。沒有 pitch control、沒有壓迫線、沒有任何由人手設計的複合特徵。作者的立場是把特徵工程交給卷積層,讓網絡從位置與速度學出需要的空間關係。


三、架構:三個尺度、各自預測、逐級合併

SoccerMap 的設計目標有兩個。近距離的特徵要夠細,例如落點附近有多少隊友與對手可以到達、局部壓迫多大。遠距離的特徵要夠闊,例如足球從起點到落點的路徑上有多少人可以攔截、球員密度如何分布。一個尺度做不到兩件事,所以原文用三個。

特徵提取: 在 1x、1/2x、1/4x 三個尺度各用兩層 5 × 5 卷積,步長 1,每層之後接 ReLU。降採樣以 max-pooling 完成。作者用對稱 padding 保持尺寸,理由是零填充會在球場邊界產生假影,影響預測與視覺呈現。

預測層: 每個尺度都有自己的預測層,由一層 32 個 1 × 1 卷積加 ReLU,再接一層單個 1 × 1 卷積加線性激活組成。這一步不把輸出縮成單一數值,而是保留空間維度,在每格各自產生預測。

上採樣: 低尺度的預測要放大回高尺度。原文不用轉置卷積,改為先做兩倍最近鄰上採樣,再套 32 個 3 × 3 卷積加 ReLU,最後接一個 3 × 3 卷積加線性激活。作者引用 Odena 等人的研究,指轉置卷積容易產生棋盤格假影,這種先放大再卷積的做法輸出較平滑。

融合層: 兩張同尺度的預測沿通道方向串接,經一個 1 × 1 卷積合成一張。1/4x 的預測先上採樣、與 1/2x 的預測融合,結果再上採樣、與 1x 的預測融合,最後經 sigmoid 輸出。

為何用卷積而不是全連接網絡?原文的理由有三。卷積濾波器天生辨識相鄰像素的關係,產生具空間感知的特徵;球場的二維座標本身就是歐幾里得結構,與影像相同;作者亦引用 Long 等人的結果,指即使在大感受野與弱標籤下,卷積網絡學到的特徵有時比人手特徵更強。至於要輸出整張 104 × 68 的映射,把分類網絡的密集層換成 1 × 1 卷積,正是全卷積網絡的標準做法。


四、只用一個像素訓練:target-location loss

這是原文技術上的核心。訓練數據裏,每次傳球只有落點座標 d 與二元結果 y。原文的做法是定義一個 target-location loss:對輸入 x 算出整張曲面 f(x),只取曲面在 d 處的值,與 y 計算 log-loss,再反向傳播。

L( f(x_k; θ), y_k, d_k ) = logloss( f(x_k; θ)[d_k], y_k )

曲面上其餘 7,071 格沒有標籤,也沒有任何直接的梯度訊號。它們之所以能學出合理的機率,依賴卷積層的權重共享:同一組濾波器掃過整個球場,在落點學到的「這種局部配置容易成功」,會自動套用到其他有相似配置的位置。作者形容這是弱監督學習的一個不尋常個案。

原文沒有提供理論保證,而是以實驗結果回應這個疑慮:既然模型在測試集的落點上校準良好,而落點分布覆蓋球場大部分區域,整張曲面的可信度便有間接支持。這一點在下文的限制一節會再討論。


五、數據、基準與訓練設定

數據由 STATS LLC 提供,共 740 場英超,涵蓋 2013/14 與 2014/15 兩個球季。追蹤數據為每秒 10 幀的球員與足球座標;事件數據記錄 433,295 次傳球的位置、時間、球員、球隊與結果,其中 344,957 次成功,88,338 次失敗。以 104 × 68 × 13 的表示計算,整個數據集的形狀是 433,295 × 104 × 68 × 13。

比賽隨機切分為訓練、驗證、測試三組,比例 60:20:20,並做分層抽樣,令三組的成功與失敗傳球比例一致。驗證集用於網格搜索選取模型,測試集完全獨立保留,所有結果都在測試集上報告。

基準模型有三個。Naive 對每次傳球都輸出全數據集的平均成功率 80%。Logistic Net 是單個 sigmoid 單元的網絡,Dense2 Net 是兩層全連接加 ReLU 再接 sigmoid 的網絡。後兩者的輸入是一組人手特徵,設計上參照 Power、Spearman 等人的既有工作:起點與落點座標、傳球距離、攻守雙方在起點與落點的空間影響力、起點與落點到球門的角度,以及起點到落點直線上對手影響力的最大值。空間影響力沿用作者早前在 Wide Open Spaces 提出的統計模型。

優化器用 Adam,學習率在 10⁻³、10⁻⁴、10⁻⁵ 之間、批次大小在 1、16、32 之間做網格搜索,β₁ 與 β₂ 分別設為 0.9 與 0.999,early stopping 的最小改善幅度為 0.001。硬件是單張 Tesla M60,框架為 TensorFlow 1.5.0。


六、結果:log-loss 0.217,校準與速度

評估採用兩個指標。一個是負 log-loss,量度預測機率與實際結果的差距。另一個是 Expected Calibration Error:把預測按機率分成 K 個等寬的箱,每箱計算「實際成功比例」與「平均預測機率」之差,再按樣本數加權。原文指出,由於模型不是分類器,ECE 裏的準確率一項以正類樣本數取代。

模型

Log-loss

ECE

單樣本推論時間

參數量

Naive

0.5451

不適用

不適用

0

Logistic Net

0.384

0.0210

0.00199 秒

11

Dense2 Net

0.349

0.0640

0.00231 秒

231

SoccerMap

0.217

0.0225

0.00457 秒

401,259

三點觀察。第一,SoccerMap 的 log-loss 比最強的人手特徵基準低 0.132,這個差距並非邊際改善。第二,校準方面,Logistic Net 與 SoccerMap 都表現良好,ECE 分別為 0.0210 與 0.0225,Logistic Net 反而略勝;Dense2 Net 的 log-loss 比 Logistic Net 好,ECE 卻差三倍。準確度與校準是兩件事,原文的校準可靠性圖亦分開呈現。第三,SoccerMap 有四十萬個參數,單樣本推論仍只需 0.00457 秒,作者據此指出模型可支援 200Hz 以下的即時估算,遠高於追蹤數據本身的 10Hz。

圖 2:左:四個模型的測試集 log-loss 與 ECE;右:消融實驗中各變體的 log-loss(數據出自原文 Table 1、Table 2)

原文 Figure 3 展示一個真實比賽情境的曲面。作者指出,模型同時捕捉到細粒度資訊,例如攻守球員對鄰近位置的影響,也捕捉到粗粒度資訊,例如按距離足球遠近與球員密度而變化的大範圍可達性。曲面亦反映球員速度:正在跑動的隊友前方會出現機率較高的區域,即使那裏當下沒有人。


七、消融:哪些部件真正有用

原文測試了十個架構變體,逐一移除 skip connection(SC)、非線性上採樣(UP)、融合層(FL)、非線性預測層(NLP),或改變每個尺度的卷積層數(NF)。

變體

SC

UP

FL

NLP

NF

Log-loss

SoccerMap

有

有

有

有

2

0.217

移除 NLP

有

有

有

無

2

0.245

移除 FL

有

有

無

有

2

0.221

移除 FL 與 NLP

有

有

無

無

2

0.292

移除 UP

有

無

有

有

2

0.216

移除 UP 與 FL

有

無

無

有

2

0.220

移除 UP 與 NLP

有

無

有

無

2

0.225

移除 UP、FL、NLP

有

無

無

無

2

0.235

單尺度 CNN-D4

無

有

有

有

2

0.256

單尺度 CNN-D8

無

有

有

有

4

0.228

影響最大的是非線性預測層:單獨移除後,log-loss 由 0.217 升至 0.245;與融合層一併移除,更升至 0.292。多尺度結構本身也重要:單尺度網絡即使把卷積層加深到四層,log-loss 仍是 0.228。

非線性上採樣是一個有趣的例子。移除它之後 log-loss 反而略降至 0.216,數值上與完整版本沒有分別。作者保留它的理由不是數字,而是視覺:沒有非線性上採樣的曲面出現肉眼可見的假影,而這些曲面的用途是給教練看。以可讀性為由選擇數值上略差的配置,是這篇文章少有的、不由 log-loss 決定的設計選擇。


八、換一個輸出層:傳球選擇與傳球價值

原文第五節示範同一架構如何改用於另外兩個問題。

傳球選擇機率: 問題由「傳到這裏會否成功」變成「持球者會把足球傳到哪裏」。做法是把最後的 sigmoid 換成 softmax,令整張曲面的機率加總為 1;訓練目標改為一個稀疏矩陣,只在實際落點設為 1。輸出的是持球者在該情境下對每個位置的選擇傾向,原文以對數尺度呈現。

傳球價值: 成功機率低的傳球,期望價值未必低。原文把目標改為該次控球最後一個事件的 xG,若最後動作由攻方做出則取正值,由守方做出則取負值,並相應改動損失函數。Figure 4 把價值曲面的色階限制在 [−0.2, 0.2]。有了這張圖,教練可以看到一次傳球的預期回報,而不只是成功率。

這兩個變體在原文只作示範,沒有獨立的基準比較。它們的重要性在於證明架構的通用性:輸入表示與特徵提取不變,只換輸出層與目標。作者隨後在 EPV 框架中把這三個模型(成功機率、選擇機率、價值)作為傳球分支的組件,並以更嚴格的長期回報定義重新訓練。


九、由曲面到教練工具:最佳落點、最佳站位、PPA

有了整張曲面,原文提出三個直接可用的分析。

最佳傳球落點: 給定一個比賽狀態,對每名隊友取其按當前速度推算的一秒後位置,在周圍 5 × 5 的網格上讀取曲面數值。網格內機率比隊友當前位置高出最多的一格,定為該隊友的最佳落點。次佳落點則是機率有正增幅、且與已選位置相距至少五米的其他格。原文 Figure 5 左欄以紅圈標示每名隊友的最佳落點與對應機率,教練可據此向球員指出「傳到他前面兩米,而不是傳到他腳下」。

最佳離球站位: 反過來問,若某名隊友站在別處,接到傳球的機率會否更高。做法是逐一把該球員移到 5 × 5 網格內的其他位置,重新計算曲面,找出令傳球機率增加最多的一格。Figure 5 右欄以綠圈標示每名球員的最佳站位與機率增幅。這是離球跑動的量化回饋,此前的傳球模型難以提供。

PPA(pass completion added): 一個評估球員選擇落點質素的指標。對每次觀察到的傳球,比較模型認為的最佳落點機率 ŷ 與實際選擇落點的機率 y:

PPA = Σ_{成功傳球} (1 − ŷ) × (1 − (ŷ − y))  −  Σ_{失敗傳球} ŷ × (ŷ − y)

成功傳球的獎勵以 (1 − ŷ) 為基礎,即當最佳落點本身已很容易成功時,獎勵不多,再按實際選擇與最佳落點的機率差距折減。失敗傳球則只按與最佳落點的差距扣分,若球員選擇的已是最佳落點而仍然失敗,扣分接近零。作者的意圖是把「選擇」與「執行」分開,只評選擇。

圖 3:2014/15 英超 PPA/90 十大,附原文引用的年齡與 transfermarkt 身價(數據出自原文 Table 3)

原文以 2014/15 球季英超計算每名球員的累計 PPA,按 90 分鐘標準化。榜首是阿仙奴的 Mesut Özil(0.0578),其後是曼城的 David Silva(0.0549)、車路士的 Eden Hazard(0.0529)、曼聯的 Antonio Valencia(0.0502)與阿仙奴的 Tomáš Rosický(0.0500)。作者的評語是名單包含了該聯賽近年最好的一批球員:Özil、Silva、Hazard、Fàbregas 這類創造型中場,Navas、Valencia 這類深位創造型翼鋒,以及 Rosický 這位資深球員。表中另附 2014 年身價,Rosický 為 €2M,Hazard 為 €48M。


十、球隊層面的傳球傾向:利物浦與般尼

第五節最後一個應用回到傳球選擇模型。聯賽層面的模型學到的是「典型球隊」在某情境下的選擇傾向,但教練更想知道特定對手與典型有何不同。原文的做法是先以 2014/15 球季全聯賽的傳球訓練一個選擇模型,再分別用利物浦與般尼的傳球微調,得到兩個球隊專屬模型。

Figure 6 比較兩隊。每欄左上角的熱圖,是當足球位於某個綠圈區域時,該隊平均選擇分布與聯賽平均的差異。利物浦傾向短傳,般尼傾向長傳到前鋒或打開兩側。作者承認這一層資訊不會超出教練的直覺。

更細的一層是具體情境。原文取一個左中堅控球組織攻勢的畫面,在每名球員頭上標示該隊選擇傳給他的機率相對聯賽平均的增減百分比。同一個畫面下,利物浦會大幅提高傳給最近的空位隊友的機率;般尼則明顯提高長傳給前鋒的機率,尤其在前鋒正開始跑向後衛身後的時候。原文的結論是,只需對聯賽模型做一次直接的微調,就能為教練提供針對特定情境的對手分析。


十一、限制與閱讀時要留意的地方

原文沒有獨立的限制章節。以下幾點從實驗設定讀出,屬本文的判斷,不是作者的結論。

弱監督的可信度: 模型只在傳球落點上被驗證,可信度只有間接證據。落點以外的方格,特別是遠離所有球員、極少有人傳向的區域,其機率沒有任何直接測試。原文以曲面的視覺合理性與落點上的校準作為支持,這在教練工具的用途上足夠,若要把曲面數值當作嚴格的機率使用,則需要另行驗證。

切分方式: 兩個球季的比賽混合後隨機分配到訓練與測試組,並非按時間切分。對傳球成功機率這個問題,時間洩漏的風險不高,但同一支球隊、同一批球員會同時出現在訓練與測試集,模型可能學到球隊特定的傾向。原文亦沒有測試跨球季或跨聯賽的泛化。

最佳落點的搜索範圍: 最佳傳球與最佳站位都只在隊友一秒後預期位置周圍的 5 × 5 格內搜索,即約五米見方。真正遠離所有隊友的空位傳球不在考慮之列,這與第一節「曲面可以評估任何位置」的優勢有一定張力。PPA 也因此只衡量球員在隊友附近選擇落點的細節,而不是全場的選擇。

PPA 榜的驗證: 十大名單與球迷認知吻合,是合理性檢查,不是預測效度的證明。原文沒有測試 PPA 與球隊成績、球員身價或其他外部指標的關係;身價一欄只作參考。

傳球價值模型的目標: 以控球最後一個事件的 xG 作為每次傳球的價值標籤,會把控球中所有傳球都對應到同一個結果,噪音不小,目標因此較粗。作者在其後的 EPV 論文中改用「下一個入球」並以 15 秒截斷,正是針對這個問題。

數據年代: 2013 至 2015 年的追蹤數據,來自單一供應商。架構本身與數據無關,但報告的數值不應直接與今日的追蹤系統或其他聯賽比較。


對賽果機率模型的啟示

原文 Table 1 有一個容易被略過的細節:log-loss 最低的 SoccerMap,ECE 是 0.0225;只有 11 個參數的 Logistic Net,ECE 是 0.0210。準確度更高的模型,校準未必更好,作者因此把兩個指標分開報告,並另附校準可靠性圖。這個習慣對任何輸出機率的系統都適用。

AIP 系統 在評估賽果機率模型時採用同一套做法。模型的辨別能力以 log-loss 與 Brier score 衡量,校準則以分箱後的實際發生率對平均預測機率另行檢查,兩者都在未參與訓練的 held-out 賽事上計算,再與市場隱含機率對照。原文另一個可以借鑑的觀察是,人手特徵的 Logistic Net 在校準上並不輸給四十萬參數的網絡。AIP 的特徵層因此同時保留結構性特徵與學習型模型,前者負責可解釋的基線,後者負責捕捉前者遺漏的交互作用,最終輸出以校準結果決定是否採用。


總結:把標籤留在一格,把答案鋪滿全場

SoccerMap 的貢獻可以分三層。方法上,它證明全卷積網絡可以只憑每次傳球一個像素的標籤,學出整張校準良好的傳球成功機率曲面,測試集 log-loss 由人手特徵基準的 0.349 降至 0.217。架構上,三尺度特徵提取、各尺度獨立預測、非線性上採樣與融合的組合,經消融實驗證實每一項都有貢獻,其中非線性預測層影響最大。應用上,同一個網絡換輸出層即可估計傳球選擇與傳球價值,並衍生出最佳落點、最佳站位、PPA 與球隊傳球傾向四個教練工具。

概念

原文做法

實務作用

章節

比賽狀態表示

104 × 68 × 13,位置、速度、距離、角度

不用人手複合特徵,交給卷積學

二

多尺度全卷積

1x、1/2x、1/4x 各兩層 5 × 5 卷積

同時捕捉局部壓迫與全場可達性

三

Target-location loss

只在落點計 log-loss

由單像素標籤學出整張曲面

四

基準比較

log-loss 0.217 對 0.384 / 0.349;ECE 分開報告

準確度與校準分開看

六

消融

移除 NLP 升至 0.245;移除 UP 為 0.216 但有假影

可讀性可以壓過微小的數值差異

七

換輸出層

softmax 得選擇機率;xG 目標得價值

一個架構三個模型

八

教練工具

5 × 5 網格搜索最佳落點與站位;PPA

量化選擇質素與離球跑動

九

球隊微調

聯賽模型再以單隊傳球微調

針對特定對手與情境的分析

十

原文最後指出,這套由時空數據導出曲面的分析框架,可以直接應用於其他團隊運動;作者的判斷是,複雜資訊的視覺呈現能拉近教練與數據分析師的距離。


Reference

  1. J. Fernández, L. Bornn. SoccerMap: A Deep Learning Architecture for Visually-Interpretable Analysis in Soccer. arXiv:2010.10202, 2020;ECML-PKDD 2020, Applied Data Science Track, Lecture Notes in Computer Science. https://doi.org/10.1007/978-3-030-67670-4_30

  2. J. Fernández, L. Bornn, D. Cervone. A framework for the fine-grained evaluation of the instantaneous expected value of soccer possessions. arXiv:2011.09426, 2020;Machine Learning 110, 1389–1427, 2021.

  3. J. Fernández, L. Bornn, D. Cervone. Decomposing the Immeasurable Sport: A deep learning expected possession value framework for soccer. MIT Sloan Sports Analytics Conference, 2019.

  4. J. Fernández, L. Bornn. Wide Open Spaces: A statistical technique for measuring space creation in professional soccer. MIT Sloan Sports Analytics Conference, 2018.

  5. W. Spearman, A. Basye, G. Dick, R. Hotovy, P. Pop. Physics-based modeling of pass probabilities in soccer. MIT Sloan Sports Analytics Conference, 2017.

  6. P. Power, H. Ruiz, X. Wei, P. Lucey. Not all passes are created equal: Objectively measuring the risk and reward of passes in soccer from tracking data. KDD 2017.

  7. J. Long, E. Shelhamer, T. Darrell. Fully convolutional networks for semantic segmentation. CVPR 2015.

  8. A. Odena, V. Dumoulin, C. Olah. Deconvolution and checkerboard artifacts. Distill, 2016.

  9. C. Guo, G. Pleiss, Y. Sun, K. Q. Weinberger. On calibration of modern neural networks. ICML 2017.


原文 Paper


bottom of page