倖存者偏差(Survivorship Bias)回測完整指南
倖存者偏差(Survivorship Bias)是量化回測中最嚴重、也最容易被忽視的系統性誤差。它會使回測結果看起來比實際好得多,導致策略在實盤中大幅跑輸預期。
在投資領域,倖存者偏差的經典例子是:研究 2024 年最大的 10 家公司,發現它們的共同特徵是「都在科技行業」。但這個結論忽略了同樣在科技行業卻失敗了的數百家公司的經驗。
什麼是倖存者偏差?
倖存者偏差的核心概念:
當您的數據集只包含「倖存者」(仍然存在的實體),而忽略了「失敗者」(已消失的實體),您的分析結果就會產生系統性偏差。
在量化回測中,這通常表現為:
- 數據集只包含目前仍在證券交易所上市的股票
- 已退市、被收購、破產的公司不在數據集中
- 回測結果顯示策略在歷史上的表現遠優於實際
一個具體的例子
假設您開發了一個策略,在 2000-2024 年間回測:
- 錯誤做法:數據集只包含 2024 年仍在上市的 5,000 隻股票
- 問題:2000 年網際網路泡沫時期有數千家科技公司退市,這些公司的慘烈虧損從未出現在您的回測中
- 結果:您的回測可能顯示年化收益 25%,但實際在相同時期交易可能年化收益僅為 10% 或更低
倖存者偏差的三種主要形式
形式一:股票倖存者偏差
這是最常見的倖存者偏差形式。數據集只包含目前仍在上市的股票:
影響:
| 指標 | 忽略退市的回測 | 包含退市的回測 | 誤差 |
|---|---|---|---|
| 年化收益 | +25% | +12% | 高估 13% |
| 夏普比率 | 2.5 | 1.2 | 高估 108% |
| 最大回撤 | -15% | -35% | 低估 133% |
| 勝率 | 65% | 52% | 高估 25% |
以上數據為研究文獻中的典型範圍,具體數值因市場和期間而異。
形式二:基金倖存者偏差
在回測共同基金或 ETF 策略時,只包含目前仍在運作的基金,忽略已清算或合併的基金:
- 表現差的基金更可能被关闭或合併
- 忽略這些基金的虧損會高估策略的整體表現
- 研究顯示,基金倖存者偏差可導致年化收益高估 1-2%
形式三:指數成分股倖存者偏差
在回測指數策略時,只使用當前指數成分股,忽略歷史上曾被納入但已移除的股票:
- 指數公司會定期調整成分股
- 被剔除的股票通常表現不佳
- 忽略這些股票的虧損會高估指數策略的表現
倖存者偏差的檢測方法
方法一:退市股票比例檢查
檢查數據集中退市股票的比例:
- 確定回測期間的股票總數(包含退市)
- 計算數據集中退市股票的比例
- 如果退市股票比例顯著低於歷史平均水平,可能存在倖存者偏差
參考數據:
| 市場 | 年退市率 | 說明 |
|---|---|---|
| 美國股市 | 5-10% | 包含自願退市、強制退市、破產 |
| 港股 | 3-5% | 相对较低,但也有退市情況 |
| 台股 | 2-4% | 相對穩定 |
方法二:跨數據源比對
- 使用多個數據源(如 Yahoo Finance、SEC EDGAR、CRSP)
- 比對各數據源的股票覆蓋範圍
- 如果某個數據源的股票數量顯著少於其他來源,可能缺少退市股票
方法三:歷史極端事件檢驗
檢查回測是否涵蓋了歷史上已知的退市高峰期:
- 2000-2002 年網際網路泡沫破裂
- 2008 年金融海嘯
- 2020 年疫情期間的企業破產
如果回測在這些時期的虧損幅度明顯低於歷史記載,可能存在倖存者偏差。
如何避免倖存者偏差
1. 使用包含退市標記的完整數據集
確保數據集中每隻股票都標註了:
- 上市日期
- 退市日期(如果適用)
- 退市原因(破產、合併、自願退市等)
2. 使用專業數據供應商
| 供應商 | 數據覆蓋 | 退市數據 | 價格範圍 |
|---|---|---|---|
| CRSP | 美國股市 | ✅ 完整退市數據 | 機構級 |
| Compustat | 美國股市 | ✅ 包含退市 | 機構級 |
| Wharton CRSP | 全球 | ✅ 完整 | 機構級 |
| Yahoo Finance | 美股/港股 | ⚠️ 部分退市數據 | 免費 |
| Alpha Vantage | 美股 | ⚠️ 有限退市數據 | 免費/付費 |
3. 自行收集退市數據
如果無法負擔專業數據源,可以嘗試:
- 從 SEC EDGAR 資料庫獲取退市公司的歷史 filings
- 使用歷史指數成分股記錄
- 從新聞archive中收集退市信息
4. 在回測中加入退市成本
即使數據集中缺少退市股票,也可以在回測模型中加入統計性的退市成本調整:
- 假設每年有 X% 的股票退市
- 退市股票的平均虧損為 Y%
- 在回測結果中扣除相應的預期虧損
倖存者偏差在 Algo Lab 的處理方式
Algo Lab 的每一個策略都使用包含完整退市數據的數據集進行回測:
- 數據源:使用 CRSP + Compustat 組合,覆蓋 1990 年至今的完整美股歷史
- 退市標記:每隻股票均標註上市和退市日期
- 回測範圍:1990-2024 年,包含所有已退市股票
- 定期驗證:每季度檢查數據集完整性,確保沒有遺漏新增的退市股票
結論:忽略失敗者,就無法理解成功
倖存者偏差的本質是只看到成功者,忽略了失敗者。在量化交易中,忽略已退市股票的回測結果就像是只研究贏家而忽略輸家的賭博策略——它看起來完美,但實戰中必然失敗。
確保您的回測使用包含退市數據的完整數據集,是量化策略開發的基本功。Algo Lab 的每一個策略都基於完整數據集回測,確保您面對的是經過嚴謹驗證的策略邏輯。
深入了解 Algo Lab 策略驗證 | 深入了解 AI 量化選股 | [加入 VIP 獲取每日量化信號]
常見問題
什麼是倖存者偏差?
倖存者偏差是指回測數據集中只包含目前仍然上市的股票,而忽略了已經退市的公司。這就像只研究活著的人的特徵來推斷成功的秘訣,卻忽略了失敗者的經驗。倖存者偏差會導致回測結果嚴重高估策略的真實表現。
倖存者偏差對回測結果的影響有多大?
研究顯示,忽略退市股票可能導致年化收益被高估 2-5%,最大回撤被低估 10-30%。在極端情況下(如科技股泡沫時期),誤差可能更大。對於高頻交易策略,誤差可能更加顯著。
如何獲取包含退市股票的完整數據集?
主要途徑:(1) 使用專業金融數據供應商(如 CRSP、Compustat、Yahoo Finance 的退市數據);(2) 使用包含退市標記的數據庫(如 Wharton Research Data Services);(3) 自行收集退市公司的歷史數據,雖然成本較高但最精確。
如果沒有預算購買專業數據,該怎麼辦?
可以嘗試以下免費或低成本方案:(1) 使用 Yahoo Finance 的歷史數據,部分退市股票仍可查詢;(2) 從 SEC EDGAR 資料庫獲取退市公司的歷史 filings;(3) 使用 Alpha Vantage 等免費 API(有限覆蓋);(4) 在回測中加入統計性的退市成本調整。