آزمون معتبر در هر زمان برای عوامل پیشنهادی از سوی عاملهای LLM
خلاصه
این پژوهش کشف عامل را از تأیید آن جدا میکند. یک عامل میتواند نامزدهایی پیشنهاد دهد و آزمونهای تشخیصی بسازد، درحالیکه داور آماریِ ثابت هر پیشنهاد را با استفاده از پیامدهای بازاری ارزیابی میکند که فقط پس از ارسال پیشنهاد مشاهده شدهاند. داور از آزمونهای مبتنی بر شرطبندی استفاده میکند که برای کنترل کشفهای کاذب در هر زمان توقف طراحی شدهاند، فارغ از اینکه عامل چگونه پیشنهادهایش را انتخاب میکند.
پژوهشگران یک اسکریپت، یک الگوریتم چنددستهای و یک مدل زبانی را با داور ثابت و سه داورِ عمداً نشتپذیر مقایسه میکنند. شواهد از محیطی مصنوعی با عوامل واقعیِ کاشتهشده، محیطی برای ساخت آزمون و مطالعهای دهساله با اعتبارسنجی پیشرونده روی CSI 500 به دست میآیند. با پیشنهاددهنده اسکریپتی، داور ثابت عوامل بسیار کمتری را که پایینتر از آستانهاند میپذیرد و تغییر پیشنهاددهنده این فاصله را از بین نمیبرد. مدل زبانی عوامل بیشتری از اسکریپت تولید میکند، با الگوریتم چنددستهای برابری میکند و میتواند آزمونهای تشخیصی بسازد. بدهبستان، تأخیر است: حدود 500 روز معاملاتی طول میکشد تا عوامل واقعی تأیید شوند و نسبت شارپ سبد تأییدشده از سبد بدون دروازه پایینتر است. نتایج به طراحیهای پژوهش وابستهاند و نشان نمیدهند که همه عوامل یا بازارها به شکل مشابهی رفتار میکنند.
ایدههای کلیدی
- داور ثابت میتواند نامزدها را بر پایه پیامدهایی ارزیابی کند که پس از ارسال آشکار میشوند.
- آزمونهای مبتنی بر شرطبندی برای حفظ کنترل کشف کاذب در هر زمان توقف طراحی شدهاند.
- انتخاب داور بهشدت بر تعداد عوامل ضعیفی که پذیرفته میشوند اثر میگذارد.
- مدلهای زبانی میتوانند با پیشنهاد عوامل و ساخت آزمونهای تشخیصی مشارکت کنند.
- تأیید ممکن است پذیرش عوامل واقعی را به تأخیر بیندازد و شارپ سبد را در مقایسه با انتخاب بدون دروازه کاهش دهد.
برچسبها
متن کامل
# Propose, Don't Judge: An Anytime-Valid Referee for LLM Agents That Mine Investment Factors # Propose, Don't Judge: An Anytime-Valid Referee for LLM Agents That Mine Investment Factors Language-model agents now run the whole of quantitative factor research: they propose investment factors, backtest them, select the survivors and retire them. We ask which of those jobs an agent should keep. Our answer is governed self-evolution: the agent may propose, and a frozen statistical referee that the agent cannot touch must judge. The referee scores each candidate only on market outcomes revealed after submission, by betting, so its false-discovery guarantee holds at every stopping time for any proposal policy. We cross three proposers (a script, a bandit and a language model) with this referee and with three deliberately leaky ones, in a synthetic world with planted truth, a probe-authoring environment and a ten-year walk-forward on the CSI 500. Who judges sets the number of false admissions: the frozen referee admits 5-11 times fewer sub-threshold factors than the leaky referees under a scripted proposer, and no proposer closes that gap. Who proposes sets the yield: the language model beats the script, matches the bandit, and adds the one capability a bandit lacks, writing its own diagnostic probes. The certificate's price is time: an admitted true factor waits about 500 trading days, and the certified portfolio's Sharpe ratio therefore trails an ungated one. Judging belongs to the procedure; proposing and instrument-making belong to the agent.
با ذکر منبع و مطابق مجوز اثر، بهطور کامل نمایش داده میشود. مجوز: abstract CC0
این خلاصه را عامل پژوهشی Stratmill بر پایه متن اصلی نوشته است؛ نسخهای از اثر منبع نیست.