কৌশলের 1,000টি বৈচিত্র। বিজয়ীটির মাপা Sharpe 2.0। মিথ্যা ইতিবাচক ফলের হার 5%। কতবার চেষ্টা করে ফলটি পেয়েছেন, তা জিজ্ঞেস না করা পর্যন্ত এই সংখ্যাগুলোকে বেশ শক্তিশালী ফল মনে হয়। যথেষ্ট চেষ্টা করলে নিছক নয়েজ থেকেও বিশ্বাসযোগ্য ব্যাকটেস্ট পাওয়া যেতে পারে।
বিস্ময়কর সংখ্যাটি Sharpe নয়। এটি পরীক্ষার সংখ্যা। প্রতিটি ইন্ডিকেটর উইন্ডো, এন্ট্রি থ্রেশহোল্ড, ইউনিভার্স নির্বাচন এবং বাদ দেওয়া ধারণা—সবই ভাগ্যক্রমে ভালো ফল বেছে নেওয়ার আরেকটি সুযোগ। আপনার গবেষণা প্রক্রিয়া যদি সেই চেষ্টাগুলো ভুলে যায়, তাহলে আপনার আত্মবিশ্বাসের হিসাবও সেগুলো উপেক্ষা করবে।
আরও বেশি কৌশল চেষ্টা করলে বিজয়ীকে ভালো দেখায় কেন?
ভাবুন, বাস্তবে কোনো এজ নেই এমন 1,000টি কৌশল পরীক্ষা করছেন। প্রচলিত পরীক্ষায় প্রতিটির পরিসংখ্যানগতভাবে তাৎপর্যপূর্ণ দেখানোর সম্ভাবনা 5%। বাস্তব গবেষণায় পরীক্ষাগুলো পুরোপুরি স্বাধীন নয়, তবে মূল ধারণাটি ঠিক থাকে: যত বেশি প্রার্থী দেখবেন, নিছক দৈবক্রমে তাদের কোনো একটিকে অসাধারণ মনে হওয়ার সম্ভাবনা তত বাড়ে।
প্রতিটি প্রার্থী স্বাধীন হলেও, অন্তত একটি 5% সীমা অতিক্রম করার সম্ভাবনা প্রায় 99.4%। বাস্তবে কাছাকাছি প্যারামিটার সেটিংগুলো প্রায়ই একইভাবে কাজ করে, তাই 1,000টি বৈচিত্র মানে 1,000টি স্বাধীন কয়েন টস নয়। তবে কার্যকর চেষ্টার সংখ্যা সাধারণত 1-ও হয় না।
নোটবুকে আমি একটি ছোট ফাঁদ দেখেছি: একজন গবেষক 5 থেকে 100 পর্যন্ত লুকব্যাক পরীক্ষা করেন, Sharpe-এর সারফেস প্লট করেন, তারপর পরিচ্ছন্ন দেখানো সর্বোচ্চ বিন্দুটি রিপোর্ট করেন। সংবেদনশীলতা বোঝার জন্য সারফেসটি কাজে লাগে। তবে সর্বোচ্চ বিন্দুটিও একটি অনুসন্ধানের ফল, তাই পরীক্ষার আগে বেছে নেওয়া থ্রেশহোল্ডের তুলনায় সেটিকে কম কৃতিত্ব দেওয়া উচিত।
গবেষণার পরীক্ষা হিসেবে কী গণ্য হয়?
পর্যবেক্ষিত ফলাফলের প্রভাবে নেওয়া সিদ্ধান্তগুলো গণনা করুন। একটি পরীক্ষা কোড করা ব্যাকটেস্ট হতে পারে, আবার ইকুইটি কার্ভ দেখার পর হাতে করা পরিবর্তনও হতে পারে। আগের সেটিংয়ে র্যালি ধরা পড়েনি বলে যদি স্টপ প্রশস্ত করে থাকেন, তাহলে পরীক্ষার সময়কালের তথ্য সেই সংশোধনে কাজে লেগেছে।
| গবেষণার পদক্ষেপ | সাধারণত পরীক্ষা হিসেবে গণ্য হয়? | কারণ |
|---|---|---|
| আরেকটি সিগন্যাল থ্রেশহোল্ড পরীক্ষা করা | হ্যাঁ | ফলাফলটি প্রার্থী বাছাইয়ে সাহায্য করে |
| ড্রডাউন দেখার পর তারিখের পরিসর বদলানো | হ্যাঁ | পারফরম্যান্সের প্রতিক্রিয়ায় নমুনা বেছে নেওয়া হয়েছে |
| নথিভুক্ত ডেটা বাগ ঠিক করা | সাধারণত না | পরিবর্তনটি নির্ধারিত পরীক্ষাকে ঠিকঠাক ফিরিয়ে আনে |
| নতুন হোল্ডআউট সময়কালে একই অপরিবর্তিত কৌশল চালানো | এখনও নতুন কোনো নির্বাচনমূলক পরীক্ষা নয় | ওই ফলের ভিত্তিতে টিউন করলেই এটি একটি পরীক্ষায় পরিণত হয় |
কোথায় সীমা টানবেন, তাতে বিচারবোধের দরকার আছে। টাইপো ঠিক করা আর ব্যর্থতার জায়গা দেখে কোনো ফিচার বদলানো এক বিষয় নয়। অনুমান, পরিবর্তন, ডেটার সময়কাল এবং ফলাফল লিখে ছোট একটি পরীক্ষার লগ রাখুন। সেটি নিখুঁত হতে হবে না; 3 মাস পরে স্মৃতি থেকে অনুসন্ধান পুনর্গঠন করার চেয়ে তারিখসহ একটি CSV-ও ভালো।
একাধিক পরীক্ষার জন্য কি Sharpe সংশোধন করা যায়?
Deflated Sharpe Ratio-এর মতো পদ্ধতি রিটার্নের বণ্টন ও পরীক্ষাগুলোর পারস্পরিক নির্ভরতার মতো বিষয় বিবেচনায় রেখে অনুমান করে, অনেক প্রার্থীর মধ্যে বাছাইয়ের ফলে আপাত পারফরম্যান্স কতটা হতে পারে। এগুলো কার্যকর ডায়াগনস্টিক, অগোছালো গবেষণা প্রক্রিয়াকে নিশ্চিততায় বদলে দেওয়ার কোনো যন্ত্র নয়। এদের ফল অনুমানের ওপর এবং পরীক্ষার সংখ্যা বিশ্বাসযোগ্য কি না, তার ওপর নির্ভর করে।
মোটামুটি ধারণার জন্য ধরুন, একজন গবেষক 400টি বৈচিত্র পরীক্ষা করে 1.8 Sharpe পেয়েছেন এবং অনুমান করেছেন যে রিটার্নে উল্লেখযোগ্য স্কিউ ও ফ্যাট টেইল আছে। আগে থেকে নিবন্ধিত একটি পরীক্ষায় পাওয়া 1.8 Sharpe-এর তুলনায় এই ফলের জন্য আরও কঠিন মানদণ্ড রাখা উচিত। সংশোধনে প্রমাণের জোর অনেকটাই কমে যেতে পারে; তবে এজটি সত্যি কি না, তা সংশোধন বলে দিতে পারে না।
সমর্থন করতে হবে—এমন পরিস্থিতি আসার আগেই অনুসন্ধানের তথ্য লিখে রাখুন: প্রার্থীর সংখ্যা, প্যারামিটারের পরিসর, দেখা ডেটার সময়কাল এবং হাতে করা সংশোধন। এসব জানা না থাকলে ব্যাকটেস্টটিকে অনুসন্ধানমূলক হিসেবে বর্ণনা করুন।
পেপার ট্রেডিংয়ের আগে কী করা উচিত?
একটি প্রার্থী চূড়ান্ত করে পরের মূল্যায়ন চালানোর আগেই তার নিয়ম নির্ধারণ করুন। একটি কার্যকর ধাপক্রম হলো: প্রশিক্ষণ ডেটা দিয়ে কৌশল বেছে নিন, ভ্যালিডেশন ডেটায় তা পরীক্ষা করুন, তারপর এমন একটি চূড়ান্ত সময়কাল বা পেপার ট্রেডিং উইন্ডো সংরক্ষণ করুন যার ফল নকশায় ফিরে প্রভাব ফেলবে না। প্রতিটি ধাপ আলাদা প্রশ্নের উত্তর দেয়; চূড়ান্ত ধাপে বারবার কৌশল বদলালে সেটিও আরও প্রশিক্ষণ ডেটায় পরিণত হয়।
কাছাকাছি সেটিংগুলো একই ইঙ্গিত দেয় কি না, সেটিও দেখুন। মাঝারি মাত্রায় ইতিবাচক ফলের বিস্তৃত পরিসর সাধারণত সূচালো একটিমাত্র সর্বোচ্চ বিন্দুর চেয়ে বেশি বিশ্বাসযোগ্য, যদিও দৃঢ়তা ত্রুটিপূর্ণ এক্সিকিউশন মডেলকে ঠিক করে দেয় না। ফি, ফান্ডিং, মার্কেট ইমপ্যাক্ট এবং ইন্সট্রুমেন্টের প্রাপ্যতা—কৌশলটি বাস্তবে যেসব পরিস্থিতির মুখোমুখি হতে পারত, সেগুলোর সঙ্গে মিলতে হবে।
পেপার ট্রেডিং কার্যক্রমের সামঞ্জস্য সম্পর্কে প্রমাণ যোগ করে: সময় নির্ধারণ, অর্ডার পরিচালনা এবং লাইভ গবেষণা পাইপলাইন প্রত্যাশামতো কাজ করছে কি না। ইতিমধ্যে ঘটে যাওয়া নির্বাচনজনিত প্রভাব এটি মুছে দিতে পারে না। প্রথম পেপার অর্ডার পাঠানোর সময়ও 1,000টি ভাগ্যবান ব্যাকটেস্ট মানে 1,000টি চেষ্টা।
তাই ব্যাকটেস্টে Sharpe 2 দেখালে ইকুইটি কার্ভের পাশাপাশি গবেষণার ইতিহাসও চান। কতগুলো ধারণা চেষ্টা করা হয়েছিল? কোন ফল পরের পরীক্ষাকে বদলেছে? প্রতিবেদনের সবচেয়ে গুরুত্বপূর্ণ পরিসংখ্যান হতে পারে এই উত্তরটাই।
← সব পোস্ট


