Backtesting d’agents de trading par rejeu du carnet d’ordres de marchés prédictifs
Résumé
Le document présente un benchmark pour évaluer des agents de trading algorithmiques et des modèles de langage sur les marchés prédictifs. Il construit des épisodes historiques à partir des mises à jour des carnets d’ordres, des transactions, des événements du cycle de vie des contrats et des règlements, puis les rejoue de manière déterministe afin que les stratégies rencontrent une séquence cohérente de conditions de marché. Une interface d’agent permet aux algorithmes classiques comme aux modèles de langage utilisant des outils d’interagir avec la simulation.
Le simulateur modélise l’exécution côté teneur de marché et preneur de liquidité, ainsi que les frais, ce qui permet d’évaluer les résultats en tenant compte des frictions de trading et du risque de règlement. Quatre épisodes fondés sur des marchés de cryptomonnaies, de météo et de sport sont décrits. Les résultats de référence indiquent que des agents simples peuvent subir les coûts de transaction ou les conséquences des règlements, tandis que les stratégies qui tiennent compte des frais peuvent rester compétitives lors d’épisodes volatils. Les éléments se limitent à ces quatre épisodes et aux références indiquées ; le résumé ne fournit ni chiffres de performance détaillés ni conclusions générales sur d’autres marchés.
Idées clés
- Les flux historiques de marché peuvent être rejoués de façon déterministe pour comparer des agents dans des conditions cohérentes.
- Le benchmark combine données de carnet, transactions, événements du cycle de vie des contrats et règlements dans des épisodes.
- Son simulateur modélise le comportement des teneurs de marché et des preneurs de liquidité, ainsi que les frais.
- Un trading naïf peut être pénalisé par les coûts et les pertes au règlement.
- Les algorithmes tenant compte des frais sont décrits comme compétitifs lors d’épisodes volatils, sur la base d’éléments limités à quatre marchés.
Étiquettes
Texte intégral
# PredictionMarketBench: A SWE-bench-Style Framework for Backtesting Trading Agents on Prediction Markets # PredictionMarketBench: A SWE-bench-Style Framework for Backtesting Trading Agents on Prediction Markets Prediction markets offer a natural testbed for trading agents: contracts have binary payoffs, prices can be interpreted as probabilities, and realized performance depends critically on market microstructure, fees, and settlement risk. We introduce PredictionMarketBench, a SWE-bench-style benchmark for evaluating algorithmic and LLM-based trading agents on prediction markets via deterministic, event-driven replay of historical limit-order-book and trade data. PredictionMarketBench standardizes (i) episode construction from raw exchange streams (orderbooks, trades, lifecycle, settlement), (ii) an execution-realistic simulator with maker/taker semantics and fee modeling, and (iii) a tool-based agent interface that supports both classical strategies and tool-calling LLM agents with reproducible trajectories. We release four Kalshi-based episodes spanning cryptocurrency, weather, and sports. Baseline results show that naive trading agents can underperform due to transaction costs and settlement losses, while fee-aware algorithmic strategies remain competitive in volatile episodes.
Reproduit dans son intégralité avec attribution, conformément à la licence de la source. Licence: abstract CC0
Ce résumé a été rédigé par l’agent de recherche de Stratmill à partir de la source originale ; il n’en est pas une copie.