top of page

Polymarket 非散戶交易研究:為何 fill-side 數據看不到真正 quote lifecycle

  • 2天前
  • 讀畢需時 6 分鐘

Prediction market 不只靠散戶下注存在。每一個可交易市場背後,都需要有人提供流動性、承擔 adverse selection、在價格偏離時套利,或者以大額交易推動價格發現。問題是:在 Polymarket 這類 hybrid CLOB + on-chain settlement 的市場,我們到底能從公開資料看到多少「供給側」行為?

論文中提出一個很有意思的實證研究:用 2026 年 4 月 21 至 27 日的一週 Polymarket PMXT v2 archive 與 Polygon OrderFilled logs,分析 13.36M filled orders77,204 個有至少 5 次 fills 的地址43,116 個 markets,嘗試刻畫非散戶參與者與市場微觀結構。

重要聲明:本文只作研究解讀與市場微觀結構討論,不構成投資、交易、博彩或法律建議。Prediction markets 受地區法規、平台條款與風險限制約束,任何實證結果都不應直接視為可交易策略。

本文重點

這篇文最重要的地方,不是簡單說「找到了幾類 market makers」,反而是作者很清楚地撤回了某些原本想做的識別。因為 Polymarket 的 order placement 與 cancellation 事件在 off-chain CLOB 發生,公開 on-chain logs 與 PMXT v2 archive 只可靠看到 filled orders,無法做 address-level quote lifecycle attribution。

在這個限制下,研究改為分析 fill-side behavioral vector。結果顯示:密度式 clustering 沒有找出四至五個自然分離的 archetypes,而是得到一個單峰行為空間。真正穩健的識別,不是 cluster labels,而是用預先定義的 feature-tier stratification,把 whale、high-frequency operator、power trader 與 episodic retail 分開。


一、研究問題:供給側行為為何重要

Polymarket 的價格不是憑空出現。散戶想買或賣某個 outcome 時,必須有人在另一邊提供可成交流動性。這些非散戶參與者可能包括 market makers、arbitrageurs、高頻 operator、whales 或其他專業交易者。

供給側行為會影響幾件事:

  • 價格是否能快速吸收資訊;

  • spread 與 depth 是否穩定;

  • 大額 informed flow 進場時,流動性提供者如何重新定價;

  • spoofing、wash volume、集中持倉等 manipulation surface 是否可觀察;

  • prediction-market 相關槓桿或 margin engine 應如何校準。

作者把這篇定位為一個四篇研究計劃的第四篇,補足 ForesightFlow 既有「需求側 informed flow」研究的另一面:誰在提供流動性,誰在承接 informed traders 的交易。


二、資料:只可靠看到成交,不可靠看到掛單生命週期

研究使用兩類資料。

第一是 Polygon mainnet 上 CTFExchange contract 的 OrderFilled events。這部分能提供 maker 與 taker address,所以 filled orders 的 address attribution 是可靠的。論文稱這個 validity gate 為 G-FILL pass

第二是 PMXT v2 archive,提供 market metadata、resolution outcomes 與 market-level book snapshots。它可以做某些 market-window-level spread / depth diagnostics,但不能提供 address-level quote events。

最關鍵的限制是 G-QUOTE-LIFE universal failOrderPlacedOrderCancelled 不在 Polygon logs,也不在 PMXT v2 archive。這代表研究不能在公開資料範圍內知道某個地址何時掛單、撤單、掛了多久、是否兩邊報價、posted spread 是多少。

因此,作者明確撤回 address-level market-making、posted-quote liquidity provision、spoof-by-non-fill detection 等結論。這種撤回本身是很重要的研究貢獻,因為它界定了 Polymarket 公開資料能說甚麼、不能說甚麼。


三、六個 fill-side features

由於 quote lifecycle 不可得,原本預註冊的九個 features 中,有三個被刪除:quote intensity、two-sided ratio、posted spread provision。

實際執行時只用六個 fill-side features:

  • Log trade intensity:每 active hour 的成交密度;

  • Log average notional:平均每筆成交金額;

  • Directional ratio:買賣方向是否偏一邊;

  • Market HHI:成交是否集中在少數 markets;

  • Intraday entropy:一天 24 小時內活動是否分散;

  • Log market breadth:交易過多少不同 markets。

這些 features 能描述「地址成交後呈現甚麼行為」,但不能證明它曾經怎樣掛單。這個分別很重要:fill-side high-frequency activity 可以「像」某些 market-making 行為,但不是已確認的 posted-quote market making。


四、主要負結果:DBSCAN 找不到自然 archetypes

作者原本預註冊的假設,是希望從行為特徵中找出四至五種可分離 archetypes,例如 market maker、passive liquidity provider、arbitrageur、whale、class specialist。

實驗結果相反。DBSCAN 在 15 組 sensitivity configurations 下,都產生一個 dense cluster,而且 zero noise。HDBSCAN 不是 cluster 太多,就是 noise 太高,按預註冊規則被拒絕。k-means k = 5 雖然可以產生可解釋分區,但 silhouette 只有 0.227,作者只把它視為 descriptive partition,不視為自然 archetype identification。

這個結果的意思是:在這一週、這六個 fill-side features 下,Polymarket 地址行為不是幾個清楚分離的群體,而是一個連續分佈。高端 operator 只是站在同一條分佈的尾部,不是另一個密度上獨立的族群。


五、真正穩健的是 feature-tier stratification

既然 clustering 不自然,作者改用預先定義的 feature tiers 作主要識別。這些 tiers 不依賴 cluster outcome,而是根據 notional、trade intensity、market breadth 等 percentile thresholds。

主要結果很集中:

  • Whale-tier:68 個地址,只佔 0.09% population,但持有 $184.2M notional,即 28.0%

  • High-frequency operator:2,952 個地址,佔 3.82% population,持有 $154.9M notional,即 23.5%

  • Power trader:6,738 個地址,佔 8.73% population,持有 $196.8M notional,即 29.9%

  • Episodic retail:63,358 個地址,佔 82.07% population,但只持有 $45.1M notional,即 6.8%

把 whale、high-frequency operator、power trader 合計,嚴格非散戶 tiers 只有 12.6% 地址,卻佔 81.4% fill notional。整體 fill-notional Gini 達 0.932,顯示成交金額高度集中。

這是文章最有實務意義的結論:即使不能確認誰是 market maker,仍可以從 fill-side 行為穩健地分出「大額、活躍、廣泛參與」的非散戶層級與 heavy-tailed retail base。


六、k-means 只是描述工具,不是身份標籤

論文仍然報告 k-means k = 5,但反覆提醒這不是自然群體識別。五個 mnemonic labels 包括 broad-high-frequency、broad-higher-notional、specialist、retail-sell-skew、retail-buy-skew。

這些分區有描述價值。例如 high-frequency operator 幾乎都落在 broad-high-frequency partition;whale 則分散在 broad-high-frequency、broad-higher-notional、specialist 三類,反映 whale 是金額層級,而不是單一行為型態。

但 k-means 不能乾淨分開 retail 與 non-retail。episodic retail 也分散到多個 k-means partitions。因此,作者把 tier classification 放在 k-means 之上,這個取態是合理的。


七、Manipulation surface:可觀察與不可觀察要分清楚

這篇文對 manipulation detection 的寫法相當謹慎。

由於 quote lifecycle 不可得,address-level spoof-by-non-fill detection 被撤回。也就是說,若要看某地址是否掛大單引導價格、未成交前撤單、再在另一邊成交,公開資料不足以支持這種判斷。

可以做的是 fill-side wash-volume candidate detection。論文報告 3,980 個 fill-side wash-volume candidates,但也明確說這是 candidate upper bound,不等於已證實 wash trading。因為 pseudonymous addresses 之間是否同一操作者,公開鏈上資料未必能確定;合法的倉位管理也可能產生同地址短時間內雙邊成交。

這個界線很重要。很多市場監控報告容易把「可疑模式」寫成「操縱證據」,但這篇文把 evidence level 分得很清楚:observed pattern 只是 manipulation surface,不是 manipulation intent。


八、對 Polymarket 與 prediction-market 研究的啟示

第一,off-chain CLOB 架構令公開鏈上資料天然不完整。Settlement 在鏈上,不代表完整 market microstructure 在鏈上。若研究問題需要 quote placement、cancellation、queue position、order lifetime,就必須有 off-chain CLOB API、研究合作資料或交易所級別 audit trail。

第二,地址層級分析仍然有價值,但要稱為 fill-side behavioral analysis,而不是完整 market-maker identification。這對學術寫作、監管分析與資料產品都很重要。

第三,Prediction-market microstructure 可能比一般想像更集中。嚴格非散戶只佔少數地址,卻承擔絕大部分 notional。若這種結構在多週、多市場類別仍然成立,對 liquidity rewards、market surveillance、margin design 與平台風控都有直接影響。

第四,負結果本身值得保留。DBSCAN 無法分群、quote lifecycle 無法歸因,不是研究失敗,而是給後續研究設下有效邊界:哪些結論可以由公開資料支持,哪些需要更高層級資料授權。


九、限制與觀察

第一,研究窗口只有一週。該週市場組成、sports / politics / crypto 比重、活動水平,都可能影響行為分佈。是否長期單峰,需要多個非重疊窗口重複驗證。

第二,研究只限 Polymarket。Kalshi 或其他 centralized event-contract venues 如果提供完整 maker-ID tape 或 quote lifecycle,可能會得出不同結論。

第三,地址是 pseudonymous。即使某些行為看似機構或做市,也不能直接命名或推斷背後實體。

第四,fill-side features 能分辨活躍度、金額、方向與廣度,但無法直接看到掛單意圖。這限制了對 liquidity provision、spoofing、quote withdrawal 的判斷。


十、小結

文中的價值在於用一個相當誠實的方式界定 Polymarket 公開資料的能力邊界。作者不是硬把 fill-side clusters 解讀成 market makers,而是先承認 quote lifecycle attribution 缺失,再把分析收窄到可驗證的 fill-side 行為。

結論也因此更可信:在 2026 年 4 月 21 至 27 日這個窗口,Polymarket fill-side 地址行為呈單峰分佈;自然 archetypes 不明顯,但 feature-tier stratification 可以穩健分出非散戶與散戶層級。對 prediction-market 研究而言,這是一個很好的提醒:市場微觀結構研究不只要有數據,更要知道數據看不到甚麼。


Reference

  1. M. Nechepurenko. Fill-Side Non-Retail Trading on Polymarket: An Empirical Study of Behavioral Tiers and Microstructure Signatures Under Quote-Attribution Constraints. arXiv:2605.11640v1 [q-fin.TR], 12 May 2026. https://arxiv.org/abs/2605.11640

  2. ForesightFlow / event-linked-perps repository. https://github.com/ForesightFlow/event-linked-perps

  3. L. R. Glosten, P. R. Milgrom. Bid, Ask and Transaction Prices in a Specialist Market with Heterogeneously Informed Traders. Journal of Financial Economics, 1985.

  4. A. S. Kyle. Continuous Auctions and Insider Trading. Econometrica, 1985.


原文 Paper



bottom of page