رفتن به محتوا
همه اسناد کتابخانه

MARKET-BENCH: آزمون LLMها در بک‌تست‌های معاملات کمّی

مقاله arXiv papers · نویسنده: Abhay Srivastava et al.

خلاصه

MARKET-BENCH ارزیابی می‌کند که آیا مدل‌های زبانی بزرگ می‌توانند توصیف راهبردها و فرض‌های بازار به زبان طبیعی را به بک‌تسترهای اجرایی تبدیل کنند. وظایف آن شامل معامله زمان‌بندی‌شده در Microsoft، معامله جفتی در Coca-Cola و Pepsi و پوشش ریسک دلتا در Microsoft است. معیارسنجی، سود و زیان تولیدشده، افت سرمایه و مسیرهای موقعیت را با پیاده‌سازی مرجع مقایسه می‌کند و هم اجراشدن بک‌تست مدل و هم میزان تطابق نتایج آن را می‌سنجد.

ارزیابی چندمرحله‌ای سیزده مدل نشان می‌دهد بیشتر آن‌ها می‌توانند ساده‌ترین راهبرد را به‌شکلی قابل‌اعتماد اجرا کنند، اما خطاهای عددی میان مدل‌ها و وظایف تفاوت چشمگیری دارند. مقاله نتایج قوی چند مدل، از جمله اجرای‌پذیری کامل GPT-5.2 را گزارش می‌کند و در کنار آن مواردی را نشان می‌دهد که خروجی‌های قابل‌اجرا همچنان مسیرهای نادقیقی تولید می‌کنند. یافته‌ها می‌گویند موفقیت در اجرا به‌تنهایی منطق معاملاتی درست را تضمین نمی‌کند. نتایج به وظایف مقدماتی و فرض‌های معیارسنجی محدودند و عملکرد در راهبردهای پیچیده‌تر یا بازارهای زنده را اثبات نمی‌کنند.

ایده‌های کلیدی

  • معیارسنجی تولید کد برای معامله زمان‌بندی‌شده، معامله جفتی و پوشش ریسک دلتا را می‌آزماید.
  • به‌طور جداگانه اجراشدن بک‌تست و میزان تطابق خروجی آن با مرجع را می‌سنجد.
  • سیزده مدل در چندین دور ارزیابی می‌شوند.
  • بک‌تست‌های قابل‌اجرا همچنان ممکن است مسیرهای سود و زیان یا موقعیت نادقیقی داشته باشند.
  • نتایج وظایف مقدماتی معیارسنجی را پوشش می‌دهند و توانایی معامله زنده را اثبات نمی‌کنند.

برچسب‌ها

متن کامل
# Market-Bench: Evaluating Large Language Models on Introductory Quantitative Trading and Market Dynamics


# Market-Bench: Evaluating Large Language Models on Introductory Quantitative Trading and Market Dynamics









We introduce MARKET-BENCH, a benchmark that evaluates large language models (LLMs) on introductory quantitative trading tasks by asking them to construct executable backtesters from natural language strategy descriptions and market assumptions. Each instance specifies one of three canonical strategies: scheduled trading on Microsoft (NASDAQ: MSFT), pairs trading on Coca-Cola (NASDAQ: KO) and Pepsi (NASDAQ: PEP), or delta hedging on MSFT. Models must produce code whose profit and loss (P and L), drawdown, and position paths match a verifiable reference implementation. We assess thirteen state-of-the-art models using a multi-round evaluation that separates structural reliability (whether the backtest runs) from numerical accuracy (mean absolute error of the backtest metrics), assigning failed outputs a duplicated-metrics baseline MAE. While most models reliably execute the simplest strategy (average executable passes of 4.08 out of 5 rounds), errors vary by orders of magnitude across models and tasks. Gemini 3 Pro and Claude 4.5 Sonnet combine strong reliability with low error on simpler strategies. GPT-5.2 achieves strong overall performance with perfect executability. GPT-5.1 Codex-Max achieves the lowest best-run error on the easiest task. Qwen3 Max attains perfect executability yet sometimes produces inaccurate profit and loss paths. These results show that current LLMs can scaffold basic trading infrastructure but still struggle to reason robustly about prices, inventory, and risk. We release MARKET-BENCH and a public leaderboard at https://marketbench.ai.

با ذکر منبع و مطابق مجوز اثر، به‌طور کامل نمایش داده می‌شود. مجوز: abstract CC0

این خلاصه را عامل پژوهشی Stratmill بر پایه متن اصلی نوشته است؛ نسخه‌ای از اثر منبع نیست.