مواد پر جائیں
لائبریری کی تمام دستاویزات

LLM ایجنٹس کے تجویز کردہ عوامل کی ہر وقت معتبر جانچ

مضمون arXiv papers · مصنف: Bo Qu et al.

خلاصہ

مطالعہ عامل کی دریافت اور منظوری کو الگ کرتا ہے۔ ایک ایجنٹ امیدوار عوامل تجویز کر سکتا ہے اور تشخیصی آزمائشیں بنا سکتا ہے، جبکہ ایک غیر تبدیل شدہ شماریاتی ریفری ہر تجویز کو جمع کرانے کے بعد مشاہدہ ہونے والے مارکیٹ نتائج سے جانچتا ہے۔ ریفری شرط پر مبنی ایسے ٹیسٹ استعمال کرتا ہے جن کا مقصد ہر ممکنہ روکنے کے وقت پر غلط دریافتوں کو قابو میں رکھنا ہے، چاہے ایجنٹ اپنی تجاویز کسی بھی طریقے سے منتخب کرے۔

محققین ایک اسکرپٹ، ایک بینڈیٹ اور ایک لسانی ماڈل کا منجمد ریفری کے ساتھ اور دانستہ طور پر رسنے والے تین ریفریوں کے ساتھ موازنہ کرتے ہیں۔ شواہد ایک مصنوعی ماحول سے آتے ہیں جس میں حقیقی عوامل شامل کیے گئے، ایک پروب لکھنے کے ماحول، اور CSI 500 پر دس سالہ واک فارورڈ مطالعے سے۔ اسکرپٹ کے ذریعے امیدوار پیش کرنے پر منجمد ریفری حد سے کم عوامل کو بہت کم قبول کرتا ہے، اور امیدوار پیش کرنے والے کو بدلنے سے یہ فرق ختم نہیں ہوتا۔ لسانی ماڈل اسکرپٹ سے زیادہ عوامل پیدا کرتا ہے، بینڈیٹ کے برابر رہتا ہے اور تشخیصی پروب بھی لکھ سکتا ہے۔ اس کے عوض تاخیر ہوتی ہے: حقیقی عوامل کی منظوری میں تقریباً 500 ٹریڈنگ دن لگتے ہیں، اور تصدیق شدہ پورٹ فولیو کا شارپ تناسب بغیر پابندی والے پورٹ فولیو سے کم ہوتا ہے۔ نتائج مطالعے کے ڈیزائن پر منحصر ہیں اور یہ ثابت نہیں کرتے کہ ہر عامل یا مارکیٹ کا رویہ بھی ایسا ہی ہوگا۔

اہم خیالات

  • ایک غیر تبدیل شدہ ریفری جمع کرانے کے بعد ظاہر ہونے والے نتائج کی بنیاد پر امیدواروں کا جائزہ لے سکتا ہے۔
  • شرط لگانے پر مبنی ٹیسٹوں کا مقصد ہر ممکنہ روکنے کے وقت پر غلط دریافتوں کو قابو میں رکھنا ہے۔
  • منصف کا انتخاب اس بات پر نمایاں اثر ڈالتا ہے کہ کتنے کمزور عوامل منظور کیے جاتے ہیں۔
  • لینگویج ماڈلز عوامل تجویز کرکے اور تشخیصی آزمائشیں بنا کر حصہ ڈال سکتے ہیں۔
  • تصدیق سے حقیقی عوامل اپنانے میں تاخیر ہو سکتی ہے اور تصدیقی فلٹر کے بغیر انتخاب کے مقابلے میں پورٹ فولیو شارپ ریشو گھٹ سکتا ہے۔

ٹیگز

مکمل متن
# Propose, Don't Judge: An Anytime-Valid Referee for LLM Agents That Mine Investment Factors


# Propose, Don't Judge: An Anytime-Valid Referee for LLM Agents That Mine Investment Factors









Language-model agents now run the whole of quantitative factor research: they propose investment factors, backtest them, select the survivors and retire them. We ask which of those jobs an agent should keep. Our answer is governed self-evolution: the agent may propose, and a frozen statistical referee that the agent cannot touch must judge. The referee scores each candidate only on market outcomes revealed after submission, by betting, so its false-discovery guarantee holds at every stopping time for any proposal policy. We cross three proposers (a script, a bandit and a language model) with this referee and with three deliberately leaky ones, in a synthetic world with planted truth, a probe-authoring environment and a ten-year walk-forward on the CSI 500. Who judges sets the number of false admissions: the frozen referee admits 5-11 times fewer sub-threshold factors than the leaky referees under a scripted proposer, and no proposer closes that gap. Who proposes sets the yield: the language model beats the script, matches the bandit, and adds the one capability a bandit lacks, writing its own diagnostic probes. The certificate's price is time: an admitted true factor waits about 500 trading days, and the certified portfolio's Sharpe ratio therefore trails an ungated one. Judging belongs to the procedure; proposing and instrument-making belong to the agent.

ماخذ کا حوالہ دیتے ہوئے مکمل متن دکھایا گیا ہے، ماخذ کے لائسنس کے تحت۔ لائسنس: abstract CC0

یہ خلاصہ اصل ماخذ سے Stratmill کے تحقیقی ایجنٹ نے لکھا ہے؛ یہ ماخذ کی نقل نہیں۔