Evaluación de agentes de trading LLM en mercados reales de criptomonedas y acciones
Resumen
Este artículo presenta Agent Market Arena, un benchmark continuo y en tiempo real para evaluar agentes de trading basados en modelos de lenguaje grandes en mercados de criptomonedas y acciones. El marco combina datos de trading verificados con noticias revisadas por expertos y distintos diseños de agentes, con el objetivo de comparar sistemas en condiciones reales. La motivación es que las evaluaciones anteriores suelen abarcar pocos activos o periodos, prueban modelos en lugar de agentes completos o se basan en datos que no se han verificado de forma independiente.
El benchmark incluye agentes con distintos perfiles de riesgo y uno que utiliza razonamiento basado en memoria, y los evalúa con varios modelos de lenguaje como base. En los experimentos en vivo descritos, se observa más variación de comportamiento entre los marcos de agentes —desde decisiones agresivas hasta conservadoras— que entre los modelos subyacentes. El resumen presenta AMA como una infraestructura para evaluaciones continuas y reproducibles; no ofrece cifras de rendimiento, duración del benchmark ni controles detallados para comparar estrategias. Sus conclusiones se refieren a diferencias de comportamiento observadas y no demuestran que ningún agente sea rentable de forma constante.
Ideas clave
- Agent Market Arena es un benchmark en tiempo real para agentes de trading LLM en mercados de criptomonedas y acciones.
- El marco combina datos de trading verificados, noticias revisadas y arquitecturas de agentes diversas.
- La evaluación incluye agentes con distintos perfiles de riesgo y razonamiento basado en memoria.
- Los experimentos en vivo indican mayores diferencias de comportamiento entre marcos de agentes que entre modelos base.
- El resumen describe una aportación de evaluación comparativa, pero no ofrece cifras de rentabilidad ni controles detallados de evaluación.
Etiquetas
Texto completo
# When Agents Trade: Live Multi-Market Trading Benchmark for LLM Agents # When Agents Trade: Live Multi-Market Trading Benchmark for LLM Agents Although Large Language Model (LLM)-based agents are increasingly used in financial trading, it remains unclear whether they can reason and adapt in live markets, as most studies test models instead of agents, cover limited periods and assets, and rely on unverified data. To address these gaps, we introduce Agent Market Arena (AMA), the first lifelong, real-time benchmark for evaluating LLM-based trading agents across multiple markets. AMA integrates verified trading data, expert-checked news, and diverse agent architectures within a unified trading framework, enabling fair and continuous comparison under real conditions. It implements four agents, including InvestorAgent as a single-agent baseline, TradeAgent and HedgeFundAgent with different risk styles, and DeepFundAgent with memory-based reasoning, and evaluates them across GPT-4o, GPT-4.1, Claude-3.5-haiku, Claude-sonnet-4, and Gemini-2.0-flash. Live experiments on both cryptocurrency and stock markets demonstrate that agent frameworks display markedly distinct behavioral patterns, spanning from aggressive risk-taking to conservative decision-making, whereas model backbones contribute less to outcome variation. AMA thus establishes a foundation for rigorous, reproducible, and continuously evolving evaluation of financial reasoning and trading intelligence in LLM-based agents.
Se muestra íntegramente con atribución según la licencia de la fuente. Licencia: abstract CC0
Este resumen lo redactó el agente de investigación de Stratmill a partir del original; no es una copia de la fuente.