رفتن به محتوا
همه اسناد کتابخانه

بک‌تست عامل‌های معامله با بازپخش دفتر سفارش بازار پیش‌بینی

مقاله arXiv papers · نویسنده: Avi Arora et al.

خلاصه

این سند معیارسنجی‌ای برای ارزیابی عامل‌های معاملاتی الگوریتمی و مبتنی بر مدل زبانی در بازارهای پیش‌بینی ارائه می‌کند. از به‌روزرسانی‌های دفتر سفارش، معاملات، رویدادهای چرخه عمر قرارداد و تسویه‌ها، دوره‌های تاریخی می‌سازد و سپس آن‌ها را به‌شکل قطعی بازپخش می‌کند تا راهبردها با دنباله‌ای یکسان از شرایط بازار روبه‌رو شوند. رابط عامل به الگوریتم‌های متعارف و مدل‌های زبانیِ استفاده‌کننده از ابزار اجازه می‌دهد با شبیه‌سازی تعامل کنند.

شبیه‌ساز اجرای بازارسازی و بازارگیری را همراه با کارمزدها مدل می‌کند و امکان ارزیابی پیامدها را با اصطکاک‌های معاملاتی و ریسک تسویه فراهم می‌سازد. چهار دوره مبتنی بر بازارهای ارز دیجیتال، آب‌وهوا و ورزش توصیف شده‌اند. یافته‌های مبنا نشان می‌دهند عامل‌های ساده ممکن است به‌دلیل هزینه‌های معامله یا پیامدهای تسویه زیان کنند، درحالی‌که راهبردهای لحاظ‌کننده کارمزد می‌توانند در دوره‌های پرنوسان رقابتی بمانند. شواهد به همان چهار دوره و مبناهای ذکرشده محدودند؛ خلاصه رقم عملکرد دقیق یا ادعای گسترده‌تری درباره نتایج در بازارهای دیگر ارائه نمی‌کند.

ایده‌های کلیدی

  • جریان‌های تاریخی بازار را می‌توان به‌شکل قطعی بازپخش کرد تا عامل‌ها در شرایط یکسان مقایسه شوند.
  • معیارسنجی، داده دفتر سفارش، معاملات، رویدادهای چرخه عمر قرارداد و تسویه‌ها را در دوره‌هایی ترکیب می‌کند.
  • شبیه‌ساز آن رفتار بازارساز و بازارگیر و نیز کارمزدها را مدل می‌کند.
  • معامله‌گری ساده‌لوحانه ممکن است بر اثر هزینه‌ها و زیان‌های تسویه تضعیف شود.
  • گزارش شده الگوریتم‌های آگاه از کارمزد در دوره‌های پرنوسان رقابتی‌اند؛ شواهد به چهار بازار محدود است.

برچسب‌ها

متن کامل
# PredictionMarketBench: A SWE-bench-Style Framework for Backtesting Trading Agents on Prediction Markets


# PredictionMarketBench: A SWE-bench-Style Framework for Backtesting Trading Agents on Prediction Markets









Prediction markets offer a natural testbed for trading agents: contracts have binary payoffs, prices can be interpreted as probabilities, and realized performance depends critically on market microstructure, fees, and settlement risk. We introduce PredictionMarketBench, a SWE-bench-style benchmark for evaluating algorithmic and LLM-based trading agents on prediction markets via deterministic, event-driven replay of historical limit-order-book and trade data. PredictionMarketBench standardizes (i) episode construction from raw exchange streams (orderbooks, trades, lifecycle, settlement), (ii) an execution-realistic simulator with maker/taker semantics and fee modeling, and (iii) a tool-based agent interface that supports both classical strategies and tool-calling LLM agents with reproducible trajectories. We release four Kalshi-based episodes spanning cryptocurrency, weather, and sports. Baseline results show that naive trading agents can underperform due to transaction costs and settlement losses, while fee-aware algorithmic strategies remain competitive in volatile episodes.

با ذکر منبع و مطابق مجوز اثر، به‌طور کامل نمایش داده می‌شود. مجوز: abstract CC0

این خلاصه را عامل پژوهشی Stratmill بر پایه متن اصلی نوشته است؛ نسخه‌ای از اثر منبع نیست.