如何改寫足球動作定位的編碼方式
- 3分钟前
- 讀畢需時 9 分鐘
一場 90 分鐘的直播比賽,絕大部分畫面都是背景。模型要在其中找出每一次傳球、控球推進、頭槌與攔截,已經不容易;SoccerNet 2026 Challenge 再加一道門檻:每一個偵測到的動作,還要指明是哪一位球員做的。判定為 true positive 的條件變成四維同時命中,幀數、球隊、球衣號碼與動作類別缺一不可。
論文中提出的 ME-DST,針對的正是這個 player-centric 設定。他們沒有換掉 FOOTPASS 官方基線的序列解碼框架,只改了編碼器一件事:不要把 26 個 role slot 壓平。單是這個改動,加上配套的特徵與視覺融合,Micro F1 由 0.675 升到 0.778。
本文重點
原本最強的 TAAD+DST 把 event spotting 當成 Denoising Sequence Transduction:給定 750 幀窗口內的視覺 logits 與 tracking 特徵,用 Transformer encoder-decoder 生成一串有序的球員事件。問題出在編碼器的入口,每一幀,26 個 role slot 的特徵先被串接成單一向量,然後才做時序 self-attention。
這一步把實體結構抹走了。編碼器之後要在同一份扁平表示裏面,同時推斷三種不同的東西:每位球員自身的時序演化、球員之間的關係,以及每個固定 role slot 對應的身分。作者的做法是把這條軸保留到底,再用兩種 attention 分工處理:temporal attention 只看同一個 slot 的歷史,spatial attention 只在同一幀跨 slot 交換資訊。
一、任務如何一步步加碼
Action spotting 與一般動作識別的分別在於輸入。後者處理已剪裁好的短片,前者要在未剪裁的長片裏面同時預測每個事件的時間位置與類別,並且在絕大多數時間都是背景的情況下,維持幀級的時間精度。
Ball action spotting 把範圍收窄到與皮球接觸的事件。這一收窄反而更難:目標由入球、紅黃牌、定位球這類顯眼場面,變成傳球、推進、傳中、射門、頭槌、界外球、攔截與封阻,全部是開放比賽中密集而短促的接觸,不少在零點幾秒之內完成。
SoccerNet 系列的技術路線大致可以分成幾段。早期以特徵池化為主,NetVLAD++ 在 SoccerNet-v2 取得 53.4 average-mAP,但時間解析度粗糙;CALF 改為直接回歸時間戳,tight-mAP 較 NetVLAD++ 改善 12.5%;E2E-Spot 用端到端的 RegNetY transformer 達到 61.8 tight-mAP;Dense Detection Anchors 把問題改寫成每個時刻每個類別一個 anchor 的密集預測,以 67.8 tight-mAP 贏得 2022 年賽事。
2024 年的 ball action spotting 擴展到 12 類,由 T-DEED 奪冠;2025 年再要求把每個動作歸屬到執行的球隊,冠軍方案在 T-DEED 上加一個統一的 action-team 分類頭,取得 60.03 Team-mAP@1。到 2026 年,歸屬對象由球隊變成個別球員,FOOTPASS 隨之建立了對應的基準:54 場直播比賽,同步的 tracking 數據,八個動作類別合共 102,992 條標註。
二、扁平化丟失了甚麼
FOOTPASS 提供三條基線,逐級加入球員與序列脈絡。TAAD 用 X3D-L backbone 對每個 role slot 做逐幀視覺分類;TAAD+GNN 在球員鄰近圖上做訊息傳遞;TAAD+DST 則把整件事重新表述成序列轉導,由自迴歸解碼器輸出有序的球員事件。序列層面的表述明顯勝過逐幀的 TAAD,說明長時脈絡與結構化解碼確有價值。
但 DST 編碼器的入口設計有代價。作者指出,足球影片裏面有兩種性質不同的依賴:個別球員的時序演化,以及周邊隊友與對手的空間配置。扁平化把兩者混在同一條序列裏面,要求模型同時學會。分開處理的話,每條球員軌跡的時序資訊可以先保存下來,之後才透過 spatial attention 跨球員交換。
作者也留意到,同類的 factorized 設計近年在美式足球防守責任分析與羽毛球擊球識別上都出現過,暗示「時序動態與實體互動分開建模」可能是結構化運動分析的通用設計原則,而不只是這個任務的特例。
三、ME-DST 的編碼器
整條管線分四段:球員表示、factorized 時空編碼、全域聚合、自迴歸解碼。
球員表示。 每個 role slot 每一幀的 22 維輸入向量,經一個兩層 MLP(GELU 加 LayerNorm)投影到 d_model = 512 的潛在表示。之後為每個 slot 加上一條可學習的 role embedding,再套用由窗口內幀索引計算的正弦位置編碼。
Factorized 時空編碼。 兩個結構相同的 attention block 依次處理。每個 block 內先做 temporal self-attention,獨立作用於每條球員軌跡;再做 spatial self-attention,在每一幀跨全部 role slot 建立互動。兩個模組都用 Pre-LN Transformer encoder layer,8 個 attention head,隱藏維度 512。Spatial attention 分塊計算以節省記憶體,運算結果不變。
全域事件表示。 球員層的表示以一個可學習的 query token 聚合成共用的事件記憶。這一步之後可以選擇再加一層沿時間維的 Transformer encoder 作全域精修,不過 ablation 顯示最佳配置正正是省掉這一層。
自迴歸解碼。 用六層 Pre-LN Transformer decoder,每一步同時由三個輸出頭預測動作類別、球員 role 與事件幀位。輸出詞彙表只有八個動作類別加 SOS 與 EOS,沒有明確的背景 token;產生 EOS 或達到 25 個事件的上限即停止。
四、輸入端:視覺融合與戰術特徵
編碼器吃的 22 維向量,由兩部分拼成。
視覺部分是 9 維 logits(八個動作加一個背景類),來自兩條 TAAD 分支。兩條分支共用同一套偵測框架:特徵金字塔聚合、以 ROIAlign 在球員 ROI 內池化、再解碼成逐幀 logits,只有 backbone 不同,分別是 X3D-L 與 Swin3D-S,兩者各自處理 50 幀、352×640 解析度的片段。Swin3D-S 的預測先經一維高斯濾波(σ = 1.5)平滑,之後按 0.6 : 0.4 的權重與 X3D-L 加權平均。
Tracking 部分是 13 維:五個原始屬性(正規化座標 x、y,速度 vx、vy,以及可見度指標),加八個手工設計的戰術描述子。八個描述子分三組。動作類包括速度與加速度大小;互動類包括到最近可見隊友的距離、到最近可見對手的距離,以及一個壓力指標,定義為球場座標半徑 0.05 之內的對手正規化數目;場地幾何類包括到球門中心的歐氏距離,以及球門方向角的 sine 與 cosine。用三角函數而非角度本身,是為了避開角度的不連續。
五、主結果
FOOTPASS 的 54 場比賽分成 48 場訓練、3 場驗證、3 場測試。按官方協議,預測落在真值 ±12 幀(25 fps 下即 ±0.48 秒)之內才算命中,信心門檻 0.15,以 micro-averaged 的 precision、recall、F1 評分。
相對最強的 TAAD+DST,Micro F1 高出 10.3 個百分點,precision 由 0.682 升到 0.792,recall 由 0.668 升到 0.765。相對 TAAD 與 TAAD+GNN 的絕對改善分別是 41.9 與 25.7 個百分點。
報告的 ME-DST 配置為:融合視覺預測、八維戰術特徵、兩個 factorized attention block、有 role embedding、無全域時序精修。要注意的是,表中基線數字取自官方 FOOTPASS 基準,而後續 ablation 則以作者自行復現的 X3D-L+DST 為參照,以確保實驗設定一致。
六、Ablation:哪一件事真正有用
視覺 backbone。 在沒有戰術特徵的情況下,由單一 X3D-L 改為融合預測,Micro F1 由 0.667 升到 0.710;加入三維戰術特徵之後,對應數字是 0.670 升到 0.715。融合帶來的四個百分點左右,是這一組裏面最大的單項改善。
時序前處理。 作者比較了 Conv1D、額外一層 Transformer encoder 與雙向 GRU。在相同視覺與特徵配置下,三者分別取得 0.710、0.708 與 0.703,差距不足 0.7 個百分點;這一組最好的結果是融合視覺加 Conv1D 的 0.714。前處理模組的選擇,對成績影響有限。
特徵維度。 這一組的對比最有意思:
扁平編碼器由三維加到八維,分數反而由 0.715 跌至 0.708;多實體編碼器同一組特徵則由 0.758 升到 0.778。同一批手工特徵,在兩種架構下的效果方向相反。作者的解讀是,戰術描述子本來就是描述球員層面的量,只有當表示保留了它們所指涉的結構,額外維度才有地方安放。
編碼器組件。 以兩個 block、有 spatial attention、有 role embedding、有全域精修的配置作基準(F1 = 0.736):
Role embedding 是全表影響最大的組件
,拿走之後 F1 由 0.736 跌到 0.569,足足 16.7 個百分點。相比之下,拿走 spatial attention 只跌 0.3 個百分點。作者的解釋是,不同戰術位置的球員在整場比賽中有明顯不同的空間分布與動作模式;明示這項資訊,編碼器就能區分短期軌跡相似但職責不同的球員,否則模型要單憑觀測到的運動去推斷,在訓練數據有限時尤其困難。
反過來,全域時序精修那一層不但沒有幫助,拿走之後反而升到 0.778,是整份 ablation 的最佳成績。作者的推測是,在到達精修層之前,每條球員表示已經聚合了約 750 幀(約 30 秒比賽時間)的資訊,再做一輪全域時序 attention 邊際效益有限,甚至可能干擾時間定位。這個假設與 ablation 結果一致,但要驗證背後機制,仍需要 attention 視覺化或邊界定位實驗。
七、逐類表現
八個類別全部改善,幅度差別很大。
Cross、Header 與 Block 的升幅最大。Throw-in 幾乎不變,合理:界外球位置固定、姿勢明確,基線本來已經做得不錯。Tackle 仍然是最難的一類,由零個正確偵測變成一個,F1 由 0 變成 0.044,實務上談不上可用。
事件層面的混淆矩陣顯示,類別替換由 224 次減到 200 次,漏檢與無對應的預測亦同步下降。分不同評估子集看,ball-visible 事件的 recall 由 0.760 升到 0.826,ball-hidden 由 0.391 升到 0.480,重播片段由 0.474 升到 0.513,即時比賽片段由 0.720 升到 0.794。皮球被遮擋的情況改善 8.9 個百分點,幅度最為明顯——這正是純視覺證據最不可靠、序列與空間脈絡最派得上用場的場景。
八、限制
作者對結論的邊界交代得相當清楚,有幾點值得原文照錄。
類別不平衡沒有解決。 改動序列編碼器並不能補償稀有動作的監督訊號不足。Tackle 的 F1 是 0.044,Header 與 Block 即使大幅改善,仍在 0.5 以下。作者認為要處理這一層,需要 imbalance-aware 的目標函數、針對性採樣或類別專屬的時序增強。
上游誤差無法回頭修正。 ME-DST 吃的是分別訓練好的 TAAD 分支輸出的 logits。球員偵測、動作分類或時間定位的錯誤會直接傳到序列模型,而且沒有聯合最佳化的途徑;遮擋情況下這個依賴尤其致命,因為球員與皮球的視覺證據可能同時殘缺。
Role 表示依賴 FOOTPASS 的組織方式。 Role index 要靠球衣號碼觀測(並在缺失幀之間傳播)才能轉成球員身分,遇上換人、戰術調整或長時間看不到號碼就會不可靠。戰術描述子亦是人手指定,建基於正規化的 tracking 座標。
架構效果與參數量未完全分離。 作者明言,ablation 沒有做到參數量對齊,因此無法排除部分增益來自模型容量而非結構本身。要嚴格評估「保留實體結構」的價值,需要參數量對齊的扁平與多實體編碼器、多個隨機種子,以及更多 player-centric 數據集;驗證比賽只有三場,不確定性估計在後續比較中會更加重要。
總結:改的是入口,不是解碼器
ME-DST 的定位相當克制:它是 Denoising Sequence Transduction 的實體感知擴展,不是取代它的序列解碼表述。解碼器照舊自迴歸,照舊輸出有序事件;改動集中在編碼器入口:不把 role slot 壓平,並且明示每個 slot 的身分。
從 ablation 的分布看,增益的來源相當集中。Role embedding 佔了最大一份,全域精修層是純負擔,spatial attention 的邊際貢獻反而細。這個排序本身值得記住:在多智能體的運動理解裏面,先把身分與結構交代清楚,可能比疊多一層 attention 更划算。
程式碼已公開於 GitHub,FOOTPASS 數據集則要接受 SoccerNet 的保密協議才能取用。
Reference
R. Wang, D. Yang, J. Wang. Entity-Aware Sequence Transduction for Player-Centric Ball Action Spotting. arXiv:2608.01696v1 [cs.CV], 3 Aug 2026.
J. Ochin, R. Chekroun, B. Stanciulescu, S. Manitsaris. FOOTPASS: A Multi-Modal Multi-Agent Tactical Context Dataset for Play-by-Play Action Spotting in Soccer Broadcast Videos. arXiv:2511.16183, 2025.
J. Ochin, R. Chekroun, B. Stanciulescu, S. Manitsaris. Beyond Pixels: Leveraging the Language of Soccer to Improve Spatio-Temporal Action Detection in Broadcast Videos. ACIVS 2025.
G. Singh, V. Choutas, S. Saha, F. Yu, L. Van Gool. Spatio-Temporal Action Detection Under Large Motion. WACV, 2023.
C. Feichtenhofer. X3D: Expanding Architectures for Efficient Video Recognition. CVPR, 2020.
Z. Liu et al. Video Swin Transformer. CVPR, 2022.
A. Xarles, S. Escalera, T. B. Moeslund, A. Clapés. T-DEED: Temporal-Discriminability Enhancer Encoder-Decoder for Precise Event Spotting in Sports Videos. CVPRW, 2024.
S. Giancola et al. SoccerNet 2025 Challenges Results. arXiv:2508.19182, 2025.
A. Vaswani et al. Attention Is All You Need. NeurIPS, 2017.
ME-DST 程式碼:https://github.com/WRF32-10/ME-DST
原文 Paper




