Самая опасная цифра в бэктесте может быть той, которая выглядит лучше всего.
В 2014 году David Bailey и Marcos López de Prado
опубликовали paper про Deflated Sharpe Ratio. Их тезис довольно жесткий:
если исследователь не раскрывает, сколько попыток стояло за итоговым бэктестом, оценить его значимость практически невозможно. Можно получить отличный Sharpe просто потому, что до этого вы перебрали достаточно параметров, стратегий и конфигураций.
Представьте, что вы тестируете одну идею. Sharpe 2 выглядит интересно. Теперь протестируйте сотни вариаций той же идеи: разные stop-loss, holding periods, окна входа, фильтры. Даже если реального edge нет, максимум среди всех этих результатов будет расти. Авторы называют это "winner's curse": вы выбираете победителя именно потому, что ему повезло сильнее остальных.
И paper идет дальше. Обычный out-of-sample тест тоже не является волшебной защитой. Если достаточно много раз менять модель и снова проверять ее на holdout, рано или поздно ложный сигнал пройдет и этот фильтр. В какой-то момент вы уже оптимизируете не стратегию, а собственный процесс проверки.
Отсюда Deflated Sharpe Ratio. Вместо вопроса "насколько высокий Sharpe?" он фактически задает другой: "насколько необычен этот Sharpe с учетом всего поиска, который был проведен до него?" DSR учитывает число независимых попыток, разброс Sharpe между ними, длину выборки, skewness и kurtosis доходностей. Чем больше вы искали, тем выше становится статистическая планка.
В самом paper есть отличный пример. Исследователь получает Sharpe 2.5 на пяти годах дневных данных. На бумаге выглядит роскошно. Но после учета истории поиска и свойств доходностей авторы показывают, что результат не проходит их 95% уровень статистической значимости.
Вот почему красивый Sharpe без истории того, как вы его получили, почти ничего не говорит.
Иногда Sharpe 2.5 означает, что вы нашли edge. А иногда только то, что вы очень долго его искали.