بکتست عاملهای معامله با بازپخش دفتر سفارش بازار پیشبینی
خلاصه
این سند معیارسنجیای برای ارزیابی عاملهای معاملاتی الگوریتمی و مبتنی بر مدل زبانی در بازارهای پیشبینی ارائه میکند. از بهروزرسانیهای دفتر سفارش، معاملات، رویدادهای چرخه عمر قرارداد و تسویهها، دورههای تاریخی میسازد و سپس آنها را بهشکل قطعی بازپخش میکند تا راهبردها با دنبالهای یکسان از شرایط بازار روبهرو شوند. رابط عامل به الگوریتمهای متعارف و مدلهای زبانیِ استفادهکننده از ابزار اجازه میدهد با شبیهسازی تعامل کنند.
شبیهساز اجرای بازارسازی و بازارگیری را همراه با کارمزدها مدل میکند و امکان ارزیابی پیامدها را با اصطکاکهای معاملاتی و ریسک تسویه فراهم میسازد. چهار دوره مبتنی بر بازارهای ارز دیجیتال، آبوهوا و ورزش توصیف شدهاند. یافتههای مبنا نشان میدهند عاملهای ساده ممکن است بهدلیل هزینههای معامله یا پیامدهای تسویه زیان کنند، درحالیکه راهبردهای لحاظکننده کارمزد میتوانند در دورههای پرنوسان رقابتی بمانند. شواهد به همان چهار دوره و مبناهای ذکرشده محدودند؛ خلاصه رقم عملکرد دقیق یا ادعای گستردهتری درباره نتایج در بازارهای دیگر ارائه نمیکند.
ایدههای کلیدی
- جریانهای تاریخی بازار را میتوان بهشکل قطعی بازپخش کرد تا عاملها در شرایط یکسان مقایسه شوند.
- معیارسنجی، داده دفتر سفارش، معاملات، رویدادهای چرخه عمر قرارداد و تسویهها را در دورههایی ترکیب میکند.
- شبیهساز آن رفتار بازارساز و بازارگیر و نیز کارمزدها را مدل میکند.
- معاملهگری سادهلوحانه ممکن است بر اثر هزینهها و زیانهای تسویه تضعیف شود.
- گزارش شده الگوریتمهای آگاه از کارمزد در دورههای پرنوسان رقابتیاند؛ شواهد به چهار بازار محدود است.
برچسبها
متن کامل
# PredictionMarketBench: A SWE-bench-Style Framework for Backtesting Trading Agents on Prediction Markets # PredictionMarketBench: A SWE-bench-Style Framework for Backtesting Trading Agents on Prediction Markets Prediction markets offer a natural testbed for trading agents: contracts have binary payoffs, prices can be interpreted as probabilities, and realized performance depends critically on market microstructure, fees, and settlement risk. We introduce PredictionMarketBench, a SWE-bench-style benchmark for evaluating algorithmic and LLM-based trading agents on prediction markets via deterministic, event-driven replay of historical limit-order-book and trade data. PredictionMarketBench standardizes (i) episode construction from raw exchange streams (orderbooks, trades, lifecycle, settlement), (ii) an execution-realistic simulator with maker/taker semantics and fee modeling, and (iii) a tool-based agent interface that supports both classical strategies and tool-calling LLM agents with reproducible trajectories. We release four Kalshi-based episodes spanning cryptocurrency, weather, and sports. Baseline results show that naive trading agents can underperform due to transaction costs and settlement losses, while fee-aware algorithmic strategies remain competitive in volatile episodes.
با ذکر منبع و مطابق مجوز اثر، بهطور کامل نمایش داده میشود. مجوز: abstract CC0
این خلاصه را عامل پژوهشی Stratmill بر پایه متن اصلی نوشته است؛ نسخهای از اثر منبع نیست.