رفتن به محتوا
همه اسناد کتابخانه

آزمون معتبر در هر زمان برای عوامل پیشنهادی از سوی عامل‌های LLM

مقاله arXiv papers · نویسنده: Bo Qu et al.

خلاصه

این پژوهش کشف عامل را از تأیید آن جدا می‌کند. یک عامل می‌تواند نامزدهایی پیشنهاد دهد و آزمون‌های تشخیصی بسازد، درحالی‌که داور آماریِ ثابت هر پیشنهاد را با استفاده از پیامدهای بازاری ارزیابی می‌کند که فقط پس از ارسال پیشنهاد مشاهده شده‌اند. داور از آزمون‌های مبتنی بر شرط‌بندی استفاده می‌کند که برای کنترل کشف‌های کاذب در هر زمان توقف طراحی شده‌اند، فارغ از اینکه عامل چگونه پیشنهادهایش را انتخاب می‌کند.

پژوهشگران یک اسکریپت، یک الگوریتم چنددسته‌ای و یک مدل زبانی را با داور ثابت و سه داورِ عمداً نشت‌پذیر مقایسه می‌کنند. شواهد از محیطی مصنوعی با عوامل واقعیِ کاشته‌شده، محیطی برای ساخت آزمون و مطالعه‌ای ده‌ساله با اعتبارسنجی پیش‌رونده روی CSI 500 به دست می‌آیند. با پیشنهاددهنده اسکریپتی، داور ثابت عوامل بسیار کمتری را که پایین‌تر از آستانه‌اند می‌پذیرد و تغییر پیشنهاددهنده این فاصله را از بین نمی‌برد. مدل زبانی عوامل بیشتری از اسکریپت تولید می‌کند، با الگوریتم چنددسته‌ای برابری می‌کند و می‌تواند آزمون‌های تشخیصی بسازد. بده‌بستان، تأخیر است: حدود 500 روز معاملاتی طول می‌کشد تا عوامل واقعی تأیید شوند و نسبت شارپ سبد تأییدشده از سبد بدون دروازه پایین‌تر است. نتایج به طراحی‌های پژوهش وابسته‌اند و نشان نمی‌دهند که همه عوامل یا بازارها به شکل مشابهی رفتار می‌کنند.

ایده‌های کلیدی

  • داور ثابت می‌تواند نامزدها را بر پایه پیامدهایی ارزیابی کند که پس از ارسال آشکار می‌شوند.
  • آزمون‌های مبتنی بر شرط‌بندی برای حفظ کنترل کشف کاذب در هر زمان توقف طراحی شده‌اند.
  • انتخاب داور به‌شدت بر تعداد عوامل ضعیفی که پذیرفته می‌شوند اثر می‌گذارد.
  • مدل‌های زبانی می‌توانند با پیشنهاد عوامل و ساخت آزمون‌های تشخیصی مشارکت کنند.
  • تأیید ممکن است پذیرش عوامل واقعی را به تأخیر بیندازد و شارپ سبد را در مقایسه با انتخاب بدون دروازه کاهش دهد.

برچسب‌ها

متن کامل
# Propose, Don't Judge: An Anytime-Valid Referee for LLM Agents That Mine Investment Factors


# Propose, Don't Judge: An Anytime-Valid Referee for LLM Agents That Mine Investment Factors









Language-model agents now run the whole of quantitative factor research: they propose investment factors, backtest them, select the survivors and retire them. We ask which of those jobs an agent should keep. Our answer is governed self-evolution: the agent may propose, and a frozen statistical referee that the agent cannot touch must judge. The referee scores each candidate only on market outcomes revealed after submission, by betting, so its false-discovery guarantee holds at every stopping time for any proposal policy. We cross three proposers (a script, a bandit and a language model) with this referee and with three deliberately leaky ones, in a synthetic world with planted truth, a probe-authoring environment and a ten-year walk-forward on the CSI 500. Who judges sets the number of false admissions: the frozen referee admits 5-11 times fewer sub-threshold factors than the leaky referees under a scripted proposer, and no proposer closes that gap. Who proposes sets the yield: the language model beats the script, matches the bandit, and adds the one capability a bandit lacks, writing its own diagnostic probes. The certificate's price is time: an admitted true factor waits about 500 trading days, and the certified portfolio's Sharpe ratio therefore trails an ungated one. Judging belongs to the procedure; proposing and instrument-making belong to the agent.

با ذکر منبع و مطابق مجوز اثر، به‌طور کامل نمایش داده می‌شود. مجوز: abstract CC0

این خلاصه را عامل پژوهشی Stratmill بر پایه متن اصلی نوشته است؛ نسخه‌ای از اثر منبع نیست.