Backtesting de agentes de trading com replay do livro de ofertas de mercados de previsão
Resumo
O documento apresenta um benchmark para avaliar agentes de trading algorítmico e baseados em modelos de linguagem em mercados de previsão. Ele cria episódios históricos a partir de atualizações do livro de ofertas, negociações, eventos do ciclo de vida de contratos e liquidações, e então os reproduz de forma determinística para que as estratégias enfrentem uma sequência consistente de condições de mercado. Uma interface de agente permite que algoritmos convencionais e modelos de linguagem que usam ferramentas interajam com a simulação.
O simulador modela execuções de maker e taker, além de taxas, permitindo avaliar resultados diante de fricções de trading e risco de liquidação. São descritos quatro episódios baseados em mercados de criptomoedas, clima e esportes. Os resultados de referência indicam que agentes simples podem perder devido aos custos de transação ou aos resultados de liquidação, enquanto estratégias que consideram as taxas podem se manter competitivas em episódios voláteis. As evidências se limitam a esses quatro episódios e às referências indicadas; o resumo não apresenta números detalhados de desempenho nem afirmações mais amplas sobre resultados em outros mercados.
Ideias principais
- Fluxos históricos de mercado podem ser reproduzidos de forma determinística para comparar agentes em condições consistentes.
- O benchmark reúne dados do livro de ofertas, negociações, eventos do ciclo de vida dos contratos e liquidações em episódios.
- O simulador modela o comportamento de maker e taker, além das taxas.
- O trading ingênuo pode ser prejudicado por custos e perdas na liquidação.
- Algoritmos que consideram as taxas são relatados como competitivos em episódios voláteis, com evidências limitadas a quatro mercados.
Tags
Texto completo
# PredictionMarketBench: A SWE-bench-Style Framework for Backtesting Trading Agents on Prediction Markets # PredictionMarketBench: A SWE-bench-Style Framework for Backtesting Trading Agents on Prediction Markets Prediction markets offer a natural testbed for trading agents: contracts have binary payoffs, prices can be interpreted as probabilities, and realized performance depends critically on market microstructure, fees, and settlement risk. We introduce PredictionMarketBench, a SWE-bench-style benchmark for evaluating algorithmic and LLM-based trading agents on prediction markets via deterministic, event-driven replay of historical limit-order-book and trade data. PredictionMarketBench standardizes (i) episode construction from raw exchange streams (orderbooks, trades, lifecycle, settlement), (ii) an execution-realistic simulator with maker/taker semantics and fee modeling, and (iii) a tool-based agent interface that supports both classical strategies and tool-calling LLM agents with reproducible trajectories. We release four Kalshi-based episodes spanning cryptocurrency, weather, and sports. Baseline results show that naive trading agents can underperform due to transaction costs and settlement losses, while fee-aware algorithmic strategies remain competitive in volatile episodes.
Exibido na íntegra, com atribuição conforme a licença da fonte. Licença: abstract CC0
Este resumo foi escrito pelo agente de pesquisa da Stratmill com base no original; não é uma cópia da fonte.