Тысяча вариантов стратегии. Измеренный Sharpe победителя — 2.0. Частота ложноположительных результатов — 5%. Эти цифры звучат как убедительный результат, пока не спросишь, сколько попыток потребовалось, чтобы его найти. При достаточном числе попыток убедительный бэктест может возникнуть из одного лишь шума.
Удивляет не значение Sharpe, а число попыток. Каждое окно индикатора, порог входа, выбор набора инструментов и отброшенная идея дают ещё один шанс отобрать удачный результат. Если в исследовательском процессе эти попытки не учитываются, расчёт уверенности тоже их не учитывает.
Почему чем больше стратегий мы пробуем, тем лучше выглядит победитель?
Представьте, что мы тестируем 1,000 стратегий без реального преимущества. У каждой есть 5% шанс показаться статистически значимой при стандартном тесте. В реальных исследованиях попытки не полностью независимы, но основная идея остаётся верной: чем больше кандидатов мы проверяем, тем выше вероятность, что один из них случайно покажется выдающимся.
Даже если бы все кандидаты были независимы, вероятность того, что хотя бы один преодолеет порог в 5%, составила бы около 99.4%. На практике близкие значения параметров часто дают похожие результаты, поэтому 1,000 вариантов — это не 1,000 независимых подбрасываний монеты. Но и эффективное число попыток редко равно одной.
Вот небольшую ловушку я замечал в исследовательских ноутбуках: исследователь проверяет периоды ретроспективы от 5 до 100, строит график зависимости Sharpe от параметров, а затем публикует аккуратный пик. Поверхность полезна для оценки чувствительности. Но пик — тоже результат поиска, и он заслуживает меньше доверия, чем порог, выбранный до эксперимента.
Что считать исследовательской попыткой?
Учитывайте решения, на которые повлияли уже полученные результаты. Попыткой может быть бэктест с кодом, но ею может стать и ручное изменение после просмотра кривой капитала. Если вы расширили стоп, потому что прежняя настройка не позволила заработать на ралли, при пересмотре вы использовали информацию из тестового периода.
| Действие в ходе исследования | Обычно считать попыткой? | Почему |
|---|---|---|
| Проверка другого порога сигнала | Да | Результат помогает выбрать кандидата |
| Изменение диапазона дат после просадки | Да | Период выборки изменён в ответ на результаты |
| Исправление задокументированной ошибки в данных | Обычно нет | Изменение восстанавливает задуманную постановку эксперимента |
| Запуск той же зафиксированной стратегии на новом отложенном периоде | Пока это не новая попытка отбора | Она станет попыткой, если вы начнёте подстраивать стратегию под этот результат |
Граница здесь определяется здравым смыслом. Исправить опечатку — не то же самое, что изменить признак после того, как вы заметили, где он подвёл. Ведите краткий журнал попыток: гипотеза, изменение, период данных и результат. Он не обязан быть образцовым: датированный CSV лучше, чем попытка через 3 месяца восстановить поиск по памяти.
Можно ли скорректировать Sharpe с учётом множественного тестирования?
Такие методы, как Deflated Sharpe Ratio, оценивают, насколько наблюдаемая доходность могла возникнуть из-за отбора среди множества кандидатов, учитывая такие факторы, как распределение доходности и зависимость между попытками. Это полезные диагностические инструменты, но не механизм, который превращает хаотичный исследовательский процесс в достоверное доказательство. Их результаты зависят от допущений и от того, насколько правдоподобно указано число попыток.
Для грубой оценки представьте: исследователь проверил 400 вариантов, получил Sharpe 1.8 и считает, что доходность имеет выраженную асимметрию и тяжёлые хвосты. К такому результату следует предъявлять более высокие требования, чем к Sharpe 1.8, полученному в одном заранее зарегистрированном тесте. Коррекция может существенно ослабить доказательства, но не покажет, что преимущество действительно существует.
Фиксируйте историю поиска до того, как придётся её обосновывать: число кандидатов, диапазоны параметров, изученные периоды данных и все ручные изменения. Если эти сведения неизвестны, называйте бэктест поисковым.
Что нужно сделать до бумажной торговли?
Зафиксируйте одного кандидата и заранее определите следующую проверку. Полезная последовательность: выбрать стратегию на обучающих данных, изучить её на валидационных данных, а затем оставить финальный период или окно бумажной торговли, результаты которого не будут влиять на разработку. Каждый этап отвечает на свой вопрос; если снова и снова менять стратегию по результатам финального этапа, он превратится в дополнительные обучающие данные.
Также проверьте, дают ли близкие настройки ту же картину. Широкая область умеренно положительных результатов обычно убедительнее одного острого пика, хотя устойчивость не исправит несовершенную модель исполнения. Комиссии, funding, влияние на рынок и доступность инструментов всё равно должны соответствовать условиям, с которыми могла столкнуться стратегия.
Бумажная торговля даёт дополнительные данные об операционном соответствии: сроках, обработке ордеров и том, работает ли исследовательский конвейер на реальных условиях так, как ожидалось. Но она не отменяет уже состоявшийся отбор. Тысяча удачных случайностей в бэктестах остаётся тысячей попыток, когда отправляется первый бумажный ордер.
Поэтому, когда в бэктесте указан Sharpe 2, попросите показать историю исследования рядом с кривой капитала. Сколько идей проверили? Какие результаты повлияли на следующий эксперимент? Возможно, именно этот ответ — самая важная статистика в отчёте.
← Все статьи


