هزار گونه از یک استراتژی. Sharpe اندازهگیریشده 2.0 برای گزینه برنده. نرخ مثبت کاذب 5%. این اعداد تا وقتی محکم به نظر میرسند که نپرسید برای پیدا کردن این نتیجه چند بار تلاش کردهاید. با تلاشهای کافی، حتی یک بکتست قانعکننده هم میتواند صرفاً از دل نویز بیرون بیاید.
عدد غافلگیرکننده Sharpe نیست؛ تعداد آزمونهاست. هر پنجره اندیکاتور، آستانه ورود، انتخاب مجموعه داراییها و ایده کنارگذاشتهشده، فرصتی دیگر برای انتخاب نتیجهای خوششانس است. اگر فرایند پژوهش این تلاشها را از قلم بیندازد، محاسبه اطمینان شما هم آنها را نادیده میگیرد.
چرا آزمودن استراتژیهای بیشتر باعث میشود گزینه برنده بهتر به نظر برسد؟
تصور کنید 1,000 استراتژی را میآزمایید که هیچکدام واقعاً مزیتی ندارند. هرکدام 5% احتمال دارد در یک آزمون متداول از نظر آماری معنادار به نظر برسد. این آزمونها در پژوهش واقعی کاملاً مستقل نیستند، اما شهود اصلی پابرجاست: هرچه گزینههای بیشتری را بررسی کنید، احتمال اینکه یکی از آنها تصادفاً استثنایی به نظر برسد بیشتر میشود.
حتی اگر همه گزینهها مستقل بودند، احتمال اینکه دستکم یکی از آستانه 5% عبور کند حدود 99.4% است. در عمل، تنظیمات پارامترهای نزدیک اغلب رفتار مشابهی دارند؛ بنابراین 1,000 گونه، 1,000 پرتاب سکه مستقل نیستند. اما تعداد مؤثر تلاشها هم بهندرت فقط 1 است.
یک دام کوچک که در نوتبوکها دیدهام این است: پژوهشگر دورههای بازنگری از 5 تا 100 را میآزماید، سطح Sharpe را رسم میکند و بعد قلهای را گزارش میکند که تمیز به نظر میرسد. این سطح برای درک حساسیت مفید است. اما قله حاصل یک جستوجو هم هست و باید کمتر از آستانهای اعتبار بگیرد که پیش از آزمایش انتخاب شده باشد.
چه چیزی یک آزمون پژوهشی به شمار میآید؟
تصمیمهایی را بشمارید که نتایج مشاهدهشده بر آنها اثر گذاشتهاند. آزمون میتواند یک بکتست کدنویسیشده باشد، اما تغییر دستی پس از دیدن منحنی ارزش حساب هم میتواند آزمون محسوب شود. اگر حد ضرر را گسترش دادید چون تنظیم قبلی باعث شد از یک رالی جا بمانید، از اطلاعات دوره آزمون استفاده کردهاید.
| اقدام پژوهشی | معمولاً یک آزمون محسوب میشود؟ | دلیل |
|---|---|---|
| آزمودن آستانه سیگنال دیگری | بله | نتیجه به انتخاب گزینه کمک میکند |
| تغییر بازه زمانی پس از مشاهده افت سرمایه | بله | نمونه در واکنش به عملکرد انتخاب شده است |
| رفع یک اشکال مستند در دادهها | معمولاً خیر | این تغییر آزمایش موردنظر را به وضعیت اصلی برمیگرداند |
| اجرای همان استراتژی ثابتشده روی یک دوره نگهداشتهشده جدید | هنوز آزمون انتخابی جدیدی نیست | اگر بر اساس آن نتیجه تنظیمش کنید، یک آزمون به شمار میآید |
مرز میان این موارد به قضاوت نیاز دارد. اصلاح غلط تایپی با تغییر یک ویژگی پس از دیدن جایی که استراتژی شکست خورده فرق دارد. گزارشی کوتاه از آزمونها تهیه کنید و فرضیه، تغییر، دوره داده و نتیجه را در آن بنویسید. لازم نیست بینقص باشد؛ یک فایل CSV تاریخدار بهتر از آن است که سه ماه بعد بخواهید جستوجوی خود را از حافظه بازسازی کنید.
آیا میتوانم Sharpe را برای آزمونهای چندگانه اصلاح کنم؟
روشهایی مانند نسبت Sharpe تعدیلشده برآورد میکنند که چه میزان از عملکرد ظاهری ممکن است حاصل انتخاب از میان گزینههای متعدد باشد و عواملی مانند توزیع بازده و وابستگی میان آزمونها را نیز در نظر میگیرند. این روشها ابزارهای تشخیصی مفیدی هستند، اما دستگاهی نیستند که فرایند پژوهشی آشفته را به قطعیت تبدیل کنند. خروجی آنها به فرضها و قابلاعتمادبودن تعداد آزمونهای شما بستگی دارد.
برای درک تقریبی موضوع، فرض کنید پژوهشگری 400 گونه را آزموده، به Sharpe برابر 1.8 رسیده و تخمین میزند بازدهها چولگی و دنبالههای سنگین قابلتوجهی دارند. این نتیجه باید با آستانه سختگیرانهتری سنجیده شود تا Sharpe برابر 1.8 حاصل از یک آزمون ازپیشثبتشده. اصلاح میتواند شواهد را بهطور محسوسی تضعیف کند، اما نمیتواند به شما بگوید که این مزیت واقعی است.
پیش از آنکه مجبور شوید از جستوجوی خود دفاع کنید، آن را ثبت کنید: تعداد گزینهها، بازههای پارامتر، دورههای دادهای که دیدهاید و هرگونه بازنگری دستی. اگر این جزئیات را نمیدانید، بکتست را اکتشافی توصیف کنید.
پیش از معامله آزمایشی چه باید کرد؟
یک گزینه را ثابت کنید و پیش از اجرا، ارزیابی بعدی را تعریف کنید. یک توالی مفید این است که استراتژی را با دادههای آموزشی انتخاب کنید، آن را روی دادههای اعتبارسنجی بررسی کنید و سپس یک دوره نهایی یا بازه معامله آزمایشی را کنار بگذارید که نتیجهاش وارد طراحی نشود. هر مرحله به پرسش متفاوتی پاسخ میدهد؛ تنظیم مکرر استراتژی بر اساس مرحله نهایی، آن را به داده آموزشی بیشتری تبدیل میکند.
همچنین بررسی کنید که تنظیمات نزدیک به هم روایت مشابهی دارند یا نه. مجموعهای گسترده از نتایج نسبتاً مثبت معمولاً باورپذیرتر از یک قله سوزنیشکل است، هرچند پایداری، مدل اجرای معیوب را جبران نمیکند. کارمزدها، فاندینگ، اثر بازار و در دسترسبودن ابزارها همچنان باید با شرایطی که استراتژی ممکن بود با آنها روبهرو شود همخوان باشند.
معامله آزمایشی شواهدی درباره همخوانی عملیاتی اضافه میکند: زمانبندی، مدیریت سفارش و اینکه آیا خط لوله پژوهشی زنده طبق انتظار عمل میکند یا نه. اما انتخابهایی را که پیشتر انجام شدهاند پاک نمیکند. وقتی نخستین سفارش آزمایشی ارسال میشود، هزار بکتست خوششانس همچنان هزار تلاش باقی میمانند.
پس وقتی بکتستی Sharpe برابر 2 گزارش میکند، سابقه پژوهش را هم کنار منحنی ارزش حساب بخواهید. چند ایده آزموده شد؟ کدام نتایج آزمایش بعدی را تغییر دادند؟ پاسخ شاید مهمترین آماره گزارش باشد.
← همهٔ مطالب


