กลยุทธ์ 1,000 รูปแบบ ผู้ชนะมี Sharpe ที่วัดได้ 2.0 และมีอัตราผลบวกลวง 5% ตัวเลขเหล่านี้ฟังดูเหมือนผลลัพธ์ที่แข็งแกร่ง จนกว่าคุณจะถามว่าต้องลองกี่ครั้งกว่าจะหาเจอ เมื่อทดลองมากพอ แบ็กเทสต์ที่ดูน่าเชื่อถือก็อาจเกิดจากสัญญาณรบกวนล้วนๆ
ตัวเลขที่น่าประหลาดใจไม่ใช่ Sharpe แต่เป็นจำนวนครั้งที่ทดลอง ทุกช่วงเวลาของอินดิเคเตอร์ ทุกเกณฑ์เข้าออเดอร์ ทุกการเลือกสินทรัพย์ และทุกแนวคิดที่ตัดทิ้ง ล้วนเพิ่มโอกาสที่จะเลือกผลลัพธ์ที่โชคดี หากกระบวนการวิจัยของคุณไม่นับความพยายามเหล่านั้น การคำนวณความเชื่อมั่นของคุณก็ไม่นับเช่นกัน
ทำไมการลองกลยุทธ์มากขึ้นจึงทำให้กลยุทธ์ที่ชนะดูดีกว่าความเป็นจริง?
ลองนึกภาพว่าทดสอบกลยุทธ์ 1,000 แบบที่ไม่มีความได้เปรียบจริง แต่ละแบบมีโอกาส 5% ที่จะดูมีนัยสำคัญทางสถิติภายใต้การทดสอบทั่วไป การทดลองเหล่านี้ไม่ได้เป็นอิสระจากกันอย่างสมบูรณ์ในการวิจัยจริง แต่หลักคิดยังเหมือนเดิม: ยิ่งตรวจดูตัวเลือกมาก ก็ยิ่งมีโอกาสที่สักตัวจะดูโดดเด่นเพราะความบังเอิญ
แม้ผู้สมัครแต่ละรายจะเป็นอิสระจากกัน ความน่าจะเป็นที่อย่างน้อย 1 รายจะผ่านเกณฑ์ 5% นั้นอยู่ที่ประมาณ 99.4% ในทางปฏิบัติ การตั้งค่าพารามิเตอร์ที่อยู่ใกล้กันมักให้พฤติกรรมคล้ายกัน ดังนั้นรูปแบบ 1,000 แบบจึงไม่ใช่การโยนเหรียญอิสระ 1,000 ครั้ง แต่จำนวนครั้งที่ทดลองอย่างมีประสิทธิผลก็แทบไม่เคยมีแค่ 1 ครั้งเช่นกัน
ผมเคยเห็นกับดักเล็กๆ ในโน้ตบุ๊กแบบนี้: นักวิจัยทดสอบช่วง lookback ตั้งแต่ 5 ถึง 100 วาดกราฟพื้นผิว Sharpe แล้วรายงานจุดสูงสุดที่ดูสวยงาม พื้นผิวนี้มีประโยชน์ต่อการทำความเข้าใจความอ่อนไหวของผลลัพธ์ แต่จุดสูงสุดก็เป็นผลจากการค้นหาเช่นกัน จึงควรได้รับความเชื่อถือน้อยกว่าเกณฑ์ที่กำหนดไว้ก่อนเริ่มการทดลอง
อะไรบ้างที่นับเป็นการทดลองวิจัย?
ให้นับการตัดสินใจที่ได้รับอิทธิพลจากผลลัพธ์ที่สังเกตเห็น การทดลองอาจเป็นแบ็กเทสต์ที่เขียนโค้ดไว้ แต่ก็อาจเป็นการปรับด้วยตนเองหลังเห็นเส้น equity curve หากคุณขยาย stop เพราะการตั้งค่าเดิมพลาดช่วงตลาดขึ้น การแก้ไขนั้นก็ใช้ข้อมูลจากช่วงทดสอบแล้ว
| การดำเนินการวิจัย | โดยทั่วไปนับเป็นการทดลองหรือไม่? | เหตุผล |
|---|---|---|
| ทดสอบเกณฑ์สัญญาณอีกค่า | ใช่ | ผลลัพธ์ช่วยคัดเลือกตัวเลือก |
| เปลี่ยนช่วงวันที่หลังเห็นการขาดทุนสะสม | ใช่ | เลือกชุดข้อมูลตามผลการดำเนินงาน |
| แก้บั๊กข้อมูลที่มีการบันทึกไว้ | โดยมากไม่นับ | การเปลี่ยนแปลงนี้ทำให้การทดลองกลับมาตรงตามที่ตั้งใจไว้ |
| รันกลยุทธ์เดิมที่ตรึงการตั้งค่าไว้กับช่วง holdout ใหม่ | ยังไม่นับเป็นการทดลองคัดเลือกครั้งใหม่ | จะนับเมื่อคุณปรับแต่งโดยอิงผลลัพธ์นั้น |
การกำหนดขอบเขตนี้ต้องใช้วิจารณญาณ การแก้คำผิดต่างจากการเปลี่ยนฟีเจอร์หลังสังเกตเห็นว่ามันล้มเหลวอย่างไร จดบันทึกการทดลองสั้นๆ โดยระบุสมมติฐาน การเปลี่ยนแปลง ช่วงข้อมูล และผลลัพธ์ ไม่ต้องทำให้สวยงาม แค่ไฟล์ CSV ที่ลงวันที่ไว้ก็ดีกว่าพยายามนึกย้อนว่าค้นหาอะไรไปบ้างเมื่อ 3 เดือนก่อน
ฉันปรับ Sharpe เพื่อชดเชยการทดสอบหลายครั้งได้ไหม?
วิธีอย่าง Deflated Sharpe Ratio ใช้ประเมินว่าผลงานที่ดูดีอาจเกิดจากการคัดเลือกผู้สมัครจำนวนมากเพียงใด โดยคำนึงถึงปัจจัยอย่างการกระจายตัวของผลตอบแทนและความเกี่ยวเนื่องกันของการทดลอง วิธีเหล่านี้เป็นเครื่องมือวินิจฉัยที่มีประโยชน์ ไม่ใช่เครื่องจักรที่เปลี่ยนกระบวนการวิจัยที่ยุ่งเหยิงให้กลายเป็นความแน่นอน ผลลัพธ์ขึ้นอยู่กับสมมติฐานและความน่าเชื่อถือของจำนวนครั้งที่ทดลอง
ลองดูตัวอย่างคร่าวๆ สมมตินักวิจัยทดสอบ 400 รูปแบบ พบ Sharpe ที่ 1.8 และประเมินว่าผลตอบแทนมีความเบ้และหางหนามาก ผลลัพธ์นี้ควรผ่านเกณฑ์ที่เข้มงวดกว่า Sharpe 1.8 จากการทดสอบที่ลงทะเบียนแผนไว้ล่วงหน้าเพียงครั้งเดียว การปรับแก้อาจทำให้หลักฐานอ่อนลงมาก แต่ก็ยืนยันไม่ได้ว่าความได้เปรียบนั้นมีอยู่จริง
บันทึกกระบวนการค้นหาไว้ก่อนที่จะต้องชี้แจง: จำนวนตัวเลือก ช่วงพารามิเตอร์ ช่วงข้อมูลที่ตรวจดู และการแก้ไขด้วยตนเองทั้งหมด หากไม่ทราบรายละเอียดเหล่านี้ ให้ระบุว่าแบ็กเทสต์เป็นการสำรวจเบื้องต้น
ควรทำอะไรบ้างก่อนเริ่ม paper trading?
ตรึงการตั้งค่าของตัวเลือก 1 ราย แล้วกำหนดการประเมินครั้งถัดไปก่อนเริ่มรัน ลำดับที่ใช้ได้คือเลือกกลยุทธ์ด้วยข้อมูลฝึก ตรวจสอบด้วยข้อมูล validation แล้วกันช่วงเวลาสุดท้ายหรือช่วง paper trading ไว้โดยไม่ให้ผลลัพธ์ย้อนกลับไปมีผลต่อการออกแบบ แต่ละขั้นตอบคำถามต่างกัน การปรับกลยุทธ์ซ้ำๆ โดยอิงผลลัพธ์จากขั้นสุดท้ายจะทำให้ข้อมูลช่วงนั้นกลายเป็นข้อมูลฝึกเพิ่ม
ตรวจดูด้วยว่าการตั้งค่าที่อยู่ใกล้กันให้ภาพเดียวกันหรือไม่ โดยทั่วไป กลุ่มผลลัพธ์เชิงบวกที่ไม่สูงมากมักน่าเชื่อถือกว่าจุดสูงสุดแหลมๆ จุดเดียว แม้ความทนทานของผลลัพธ์จะชดเชยแบบจำลองการส่งคำสั่งที่มีข้อบกพร่องไม่ได้ ค่าธรรมเนียม funding ผลกระทบต่อตลาด และความพร้อมในการซื้อขายของสินทรัพย์ก็ยังต้องสอดคล้องกับเงื่อนไขที่กลยุทธ์จะพบจริง
Paper trading เพิ่มหลักฐานเกี่ยวกับความสอดคล้องในการปฏิบัติงาน ทั้งเรื่องจังหวะเวลา การจัดการคำสั่ง และการทำงานของ pipeline วิจัยจริง แต่ไม่อาจลบล้างการคัดเลือกที่เกิดขึ้นไปแล้ว แบ็กเทสต์ที่โชคดี 1,000 ครั้งก็ยังคงเป็นความพยายาม 1,000 ครั้งเมื่อส่งคำสั่ง paper ครั้งแรก
ดังนั้น เมื่อแบ็กเทสต์รายงาน Sharpe ที่ 2 ให้ขอดูประวัติการวิจัยควบคู่กับเส้น equity curve ด้วย ลองแนวคิดไปกี่แบบ? ผลลัพธ์ใดทำให้เปลี่ยนการทดลองครั้งถัดไป? คำตอบอาจเป็นสถิติที่สำคัญที่สุดในรายงาน
← บทความทั้งหมด


