Тисяча варіантів стратегії. Виміряний коефіцієнт Шарпа переможця — 2.0. Частота хибнопозитивних результатів — 5%. На перший погляд це переконливий результат, аж поки не запитаєш, скільки спроб знадобилося, щоб його знайти. Достатньо спроб — і переконливий бектест може виникнути з самого лише шуму.
Найдивовижніше тут — не коефіцієнт Шарпа. А кількість спроб. Кожне вікно індикатора, поріг входу, вибір набору інструментів і відкинута ідея — це ще один шанс випадково відібрати вдалий результат. Якщо в дослідницькому процесі ці спроби не враховані, то й розрахунок упевненості їх не врахує.
Чому що більше стратегій ми пробуємо, то кращим здається переможець?
Уявімо, що ми тестуємо 1,000 стратегій, які насправді не мають переваги. У кожної є 5% шансів виявитися статистично значущою за звичайного тесту. У реальних дослідженнях ці спроби не цілком незалежні, але основна інтуїція правильна: що більше кандидатів ви розглядаєте, то ймовірніше, що один із них випадково виглядатиме винятковим.
Навіть якби всі кандидати були незалежними, імовірність того, що принаймні один перевищить цей поріг у 5%, становила б близько 99.4%. На практиці близькі налаштування параметрів часто дають схожі результати, тож 1,000 варіантів — це не 1,000 незалежних підкидань монети. Але й ефективна кількість спроб рідко дорівнює одній.
Ось невелика пастка, яку я бачив у ноутбуках: дослідник тестує періоди ретроспективного аналізу від 5 до 100, будує поверхню коефіцієнта Шарпа, а потім звітує про чітко виражений пік. Така поверхня допомагає зрозуміти чутливість результатів. Але пік — це також наслідок пошуку, і заслуговує на меншу довіру, ніж поріг, обраний до експерименту.
Що вважати дослідницькою спробою?
Рахуйте рішення, на які вплинули побачені результати. Спробою може бути запуск бектесту з кодом, але нею також може бути ручна зміна після перегляду кривої капіталу. Якщо ви розширили стоп після того, як побачили, що попереднє налаштування не дало скористатися ралі, ця зміна вже використала інформацію з тестового періоду.
| Дослідницька дія | Зазвичай вважається спробою? | Чому |
|---|---|---|
| Тестування іншого порога сигналу | Так | Результат допомагає відібрати кандидата |
| Зміна діапазону дат після просадки | Так | Вибірку визначили з огляду на результати торгівлі |
| Виправлення задокументованої помилки в даних | Зазвичай ні | Зміна повертає експеримент до початкового задуму |
| Запуск тієї самої зафіксованої стратегії на новому відкладеному періоді | Поки що це не нова спроба відбору | Вона стане нею, якщо ви будете підлаштовувати стратегію під цей результат |
Межа тут не завжди чітка. Виправлення одруку — це одне, а зміна ознаки після того, як ви помітили, де вона підвела, — інше. Ведіть короткий журнал спроб із гіпотезою, зміною, періодом даних і результатом. Він не мусить бути бездоганним: CSV із датами кращий, ніж спроба відновити пошук із пам’яті через три місяці.
Чи можу я скоригувати коефіцієнт Шарпа з урахуванням множинного тестування?
Такі методи, як Deflated Sharpe Ratio, оцінюють, наскільки уявні результати могли виникнути через відбір серед багатьох кандидатів, враховуючи такі чинники, як розподіл дохідності та залежність між спробами. Це корисні діагностичні інструменти, а не механізм, що перетворює неохайний дослідницький процес на певність. Їхні результати залежать від припущень і від того, наскільки достовірно ви оцінили кількість спроб.
Для приблизного уявлення припустімо, що дослідник протестував 400 варіантів, отримав коефіцієнт Шарпа 1.8 і вважає, що дохідність має значну асиметрію та важкі хвости. До такого результату слід висувати вищі вимоги, ніж до коефіцієнта Шарпа 1.8, отриманого в одному заздалегідь зареєстрованому тесті. Корекція може суттєво послабити докази, але вона не скаже вам, чи реальна ця перевага.
Зафіксуйте пошук, перш ніж доведеться його обґрунтовувати: кількість кандидатів, діапазони параметрів, переглянуті періоди даних і всі ручні зміни. Якщо ці деталі невідомі, називайте бектест дослідницьким.
Що потрібно зробити перед паперовою торгівлею?
Зафіксуйте одного кандидата й визначте наступну оцінку до її проведення. Корисна послідовність така: вибрати стратегію на тренувальних даних, оцінити її на валідаційних, а потім зарезервувати фінальний період або вікно паперової торгівлі, результати яких не впливатимуть на розробку. Кожен етап відповідає на окреме запитання; повторне налаштування стратегії на фінальному етапі перетворює його на додаткові тренувальні дані.
Також перевірте, чи дають близькі налаштування схожу картину. Широка ділянка помірно позитивних результатів зазвичай переконливіша за один голкоподібний пік, хоча стійкість результатів не виправить хибну модель виконання. Комісії, funding, вплив на ринок і доступність інструментів усе одно мають відповідати умовам, із якими могла зіткнутися стратегія.
Паперова торгівля додає докази операційної відповідності: щодо таймінгу, обробки ордерів і того, чи поводиться робочий дослідницький конвеєр так, як очікувалося. Вона не скасовує вже здійснений відбір. Коли буде надіслано перший паперовий ордер, тисяча вдалих випадковостей у бектестах усе ще означатиме тисячу спроб.
Тож коли бектест показує коефіцієнт Шарпа 2, попросіть показати історію досліджень разом із кривою капіталу. Скільки ідей випробували? Які результати вплинули на наступний експеримент? Відповідь може виявитися найважливішою статистикою у звіті.
← Усі статті


