LLM एजेंटों द्वारा प्रस्तावित फ़ैक्टरों की किसी भी समय वैध जाँच
सारांश
यह अध्ययन फ़ैक्टर खोज को फ़ैक्टर अनुमोदन से अलग करता है। एक एजेंट संभावित फ़ैक्टर प्रस्तावित कर सकता है और निदानात्मक जाँच बना सकता है, जबकि एक स्थिर सांख्यिकीय निर्णायक हर प्रस्ताव का मूल्यांकन केवल प्रस्ताव जमा होने के बाद देखे गए बाज़ार परिणामों से करता है। निर्णायक सट्टेबाज़ी-आधारित परीक्षणों का उपयोग करता है, जिन्हें किसी भी रोक समय पर गलत खोजों को नियंत्रित करने के लिए बनाया गया है—भले ही एजेंट अपने प्रस्ताव कैसे चुने।
शोधकर्ता स्क्रिप्ट, बैंडिट और भाषा मॉडल की तुलना स्थिर निर्णायक तथा जानबूझकर लीक किए गए तीन निर्णायकों से करते हैं। साक्ष्य में पहले से निर्धारित वास्तविक फ़ैक्टरों वाला कृत्रिम परिवेश, जाँच बनाने का परिवेश और CSI 500 पर दस-वर्षीय वॉक-फ़ॉरवर्ड अध्ययन शामिल है। स्क्रिप्ट-आधारित प्रस्तावक के साथ स्थिर निर्णायक सीमा से नीचे के फ़ैक्टर बहुत कम स्वीकार करता है, और प्रस्तावक बदलने से यह अंतर दूर नहीं होता। भाषा मॉडल स्क्रिप्ट से अधिक फ़ैक्टर देता है, बैंडिट के बराबर प्रदर्शन करता है और निदानात्मक जाँचें बना सकता है। इसकी कीमत देरी है: वास्तविक फ़ैक्टरों को पात्रता पाने में लगभग 500 ट्रेडिंग दिन लगते हैं, और प्रमाणित पोर्टफ़ोलियो का शार्प अनुपात बिना फ़िल्टर वाले पोर्टफ़ोलियो से कम है। परिणाम अध्ययन की रूपरेखाओं पर निर्भर हैं और यह स्थापित नहीं करते कि हर फ़ैक्टर या बाज़ार समान व्यवहार करेगा।
मुख्य विचार
- एक स्थिर निर्णायक प्रस्ताव के बाद सामने आए परिणामों के आधार पर संभावित फ़ैक्टरों का मूल्यांकन कर सकता है।
- सट्टेबाज़ी-आधारित परीक्षणों का लक्ष्य किसी भी रोक समय पर गलत खोजों पर नियंत्रण बनाए रखना है।
- निर्णायक का चुनाव इस बात पर बहुत प्रभाव डालता है कि कितने कमजोर फ़ैक्टर स्वीकार किए जाते हैं।
- भाषा मॉडल फ़ैक्टर प्रस्तावित करने और निदानात्मक जाँचें बनाने में योगदान दे सकते हैं।
- प्रमाणन वास्तविक फ़ैक्टर अपनाने में देरी कर सकता है और बिना फ़िल्टर वाले चयन की तुलना में पोर्टफ़ोलियो शार्प घटा सकता है।
टैग
पूरा पाठ
# Propose, Don't Judge: An Anytime-Valid Referee for LLM Agents That Mine Investment Factors # Propose, Don't Judge: An Anytime-Valid Referee for LLM Agents That Mine Investment Factors Language-model agents now run the whole of quantitative factor research: they propose investment factors, backtest them, select the survivors and retire them. We ask which of those jobs an agent should keep. Our answer is governed self-evolution: the agent may propose, and a frozen statistical referee that the agent cannot touch must judge. The referee scores each candidate only on market outcomes revealed after submission, by betting, so its false-discovery guarantee holds at every stopping time for any proposal policy. We cross three proposers (a script, a bandit and a language model) with this referee and with three deliberately leaky ones, in a synthetic world with planted truth, a probe-authoring environment and a ten-year walk-forward on the CSI 500. Who judges sets the number of false admissions: the frozen referee admits 5-11 times fewer sub-threshold factors than the leaky referees under a scripted proposer, and no proposer closes that gap. Who proposes sets the yield: the language model beats the script, matches the bandit, and adds the one capability a bandit lacks, writing its own diagnostic probes. The certificate's price is time: an admitted true factor waits about 500 trading days, and the certified portfolio's Sharpe ratio therefore trails an ungated one. Judging belongs to the procedure; proposing and instrument-making belong to the agent.
स्रोत के लाइसेंस के तहत श्रेय सहित पूरा पाठ दिखाया गया है। लाइसेंस: abstract CC0
यह सारांश मूल स्रोत के आधार पर Stratmill के शोध एजेंट ने लिखा है; यह स्रोत की प्रति नहीं है।