الانتقال إلى المحتوى
جميع مستندات المكتبة

اختبار تاريخي لوكلاء التداول عبر إعادة تشغيل دفتر أوامر أسواق التنبؤ

مقال arXiv papers · المؤلف: Avi Arora et al.

الملخص

تعرض الوثيقة معيارًا لتقييم وكلاء التداول الخوارزمي ووكلاء النماذج اللغوية في أسواق التنبؤ. وتبني حلقات تاريخية من تحديثات دفتر الأوامر والمعاملات وأحداث دورة حياة العقود والتسويات، ثم تعيد تشغيلها بصورة حتمية لتواجه الاستراتيجيات تسلسلًا ثابتًا من ظروف السوق. وتتيح واجهة الوكيل لكل من الخوارزميات التقليدية والنماذج اللغوية المستخدمة للأدوات التفاعل مع المحاكاة.

تحاكي بيئة المحاكاة تنفيذ صانع السوق والمتداول الآخذ للسعر، إلى جانب الرسوم، بما يتيح تقييم النتائج في ظل احتكاكات التداول ومخاطر التسوية. وتصف الورقة أربع حلقات مستندة إلى أسواق العملات الرقمية والطقس والرياضة. وتشير النتائج المرجعية إلى أن الوكلاء البسيطين قد يخسرون بسبب تكاليف المعاملات أو نتائج التسوية، بينما يمكن للاستراتيجيات التي تراعي الرسوم أن تظل قادرة على المنافسة في الحلقات المتقلبة. وتقتصر الأدلة على الحلقات الأربع والمعايير المرجعية المذكورة؛ ولا يقدم الملخص أرقام أداء تفصيلية أو ادعاءات أوسع بشأن النتائج في أسواق أخرى.

الأفكار الرئيسية

  • يمكن إعادة تشغيل تدفقات السوق التاريخية بصورة حتمية لمقارنة الوكلاء في ظروف متسقة.
  • يجمع المعيار بيانات دفتر الأوامر والمعاملات وأحداث دورة حياة العقود والتسويات في حلقات.
  • تحاكي بيئة الاختبار سلوك صانع السوق والمتداول الآخذ للسعر، إضافةً إلى الرسوم.
  • قد يضعف الأداء التداول الساذج بسبب التكاليف وخسائر التسوية.
  • يُذكر أن الخوارزميات المراعية للرسوم قادرة على المنافسة في الفترات المتقلبة، مع اقتصار الأدلة على أربع أسواق.

الوسوم

النص الكامل
# PredictionMarketBench: A SWE-bench-Style Framework for Backtesting Trading Agents on Prediction Markets


# PredictionMarketBench: A SWE-bench-Style Framework for Backtesting Trading Agents on Prediction Markets









Prediction markets offer a natural testbed for trading agents: contracts have binary payoffs, prices can be interpreted as probabilities, and realized performance depends critically on market microstructure, fees, and settlement risk. We introduce PredictionMarketBench, a SWE-bench-style benchmark for evaluating algorithmic and LLM-based trading agents on prediction markets via deterministic, event-driven replay of historical limit-order-book and trade data. PredictionMarketBench standardizes (i) episode construction from raw exchange streams (orderbooks, trades, lifecycle, settlement), (ii) an execution-realistic simulator with maker/taker semantics and fee modeling, and (iii) a tool-based agent interface that supports both classical strategies and tool-calling LLM agents with reproducible trajectories. We release four Kalshi-based episodes spanning cryptocurrency, weather, and sports. Baseline results show that naive trading agents can underperform due to transaction costs and settlement losses, while fee-aware algorithmic strategies remain competitive in volatile episodes.

يُعرض النص كاملًا مع نسبه إلى مصدره وفقًا لترخيصه. الترخيص: abstract CC0

أعدّ وكيل الأبحاث في Stratmill هذا الملخص استنادًا إلى المصدر الأصلي؛ وهو ليس نسخة منه.