Trading-Agenten mit Orderbuch-Replays von Prognosemärkten backtesten
Zusammenfassung
Das Dokument stellt einen Benchmark zur Bewertung algorithmischer Trading-Agenten und Sprachmodell-Agenten in Prognosemärkten vor. Es erstellt historische Episoden aus Orderbuch-Aktualisierungen, Trades, Ereignissen im Vertragslebenszyklus und Abrechnungen und spielt sie anschließend deterministisch ab. So treffen Strategien auf eine einheitliche Abfolge von Marktbedingungen. Eine Agentenschnittstelle ermöglicht es sowohl herkömmlichen Algorithmen als auch Sprachmodellen mit Werkzeugzugriff, mit der Simulation zu interagieren.
Der Simulator modelliert die Ausführung auf Maker- und Taker-Seite sowie Gebühren und ermöglicht so die Bewertung von Ergebnissen unter Handelsfriktionen und Abwicklungsrisiken. Beschrieben werden vier Episoden aus Kryptowährungs-, Wetter- und Sportmärkten. Die Basisbefunde deuten darauf hin, dass einfache Agenten durch Transaktionskosten oder Abrechnungsergebnisse Verluste machen können, während Strategien, die Gebühren berücksichtigen, in volatilen Episoden wettbewerbsfähig bleiben können. Die Evidenz ist auf diese vier Episoden und die genannten Baselines begrenzt; die Zusammenfassung enthält keine detaillierten Performancezahlen oder weitergehenden Aussagen zu Ergebnissen in anderen Märkten.
Kernaussagen
- Historische Marktverläufe lassen sich deterministisch abspielen, um Agenten unter einheitlichen Bedingungen zu vergleichen.
- Der Benchmark kombiniert Orderbuchdaten, Trades, Ereignisse im Vertragslebenszyklus und Abrechnungen zu Episoden.
- Der Simulator bildet Maker- und Taker-Verhalten sowie Gebühren ab.
- Naives Trading kann durch Kosten und Abwicklungsverluste beeinträchtigt werden.
- Gebührenbewusste Algorithmen werden in volatilen Episoden als wettbewerbsfähig beschrieben; die Evidenz beschränkt sich auf vier Märkte.
Schlagwörter
Volltext
# PredictionMarketBench: A SWE-bench-Style Framework for Backtesting Trading Agents on Prediction Markets # PredictionMarketBench: A SWE-bench-Style Framework for Backtesting Trading Agents on Prediction Markets Prediction markets offer a natural testbed for trading agents: contracts have binary payoffs, prices can be interpreted as probabilities, and realized performance depends critically on market microstructure, fees, and settlement risk. We introduce PredictionMarketBench, a SWE-bench-style benchmark for evaluating algorithmic and LLM-based trading agents on prediction markets via deterministic, event-driven replay of historical limit-order-book and trade data. PredictionMarketBench standardizes (i) episode construction from raw exchange streams (orderbooks, trades, lifecycle, settlement), (ii) an execution-realistic simulator with maker/taker semantics and fee modeling, and (iii) a tool-based agent interface that supports both classical strategies and tool-calling LLM agents with reproducible trajectories. We release four Kalshi-based episodes spanning cryptocurrency, weather, and sports. Baseline results show that naive trading agents can underperform due to transaction costs and settlement losses, while fee-aware algorithmic strategies remain competitive in volatile episodes.
Vollständig mit Quellenangabe unter der Lizenz der Quelle angezeigt. Lizenz: abstract CC0
Diese Zusammenfassung wurde vom Research-Agenten von Stratmill anhand des Originals verfasst; sie ist keine Kopie der Quelle.