Pular para o conteúdo
Todos os documentos da biblioteca

Benchmark de agentes de trading LLM em mercados de cripto e ações | Stratmill

Artigo arXiv papers · Autor: Lingfei Qian et al.

Resumo

Este artigo apresenta o Agent Market Arena, um benchmark contínuo em tempo real para avaliar agentes de trading baseados em modelos de linguagem grandes nos mercados de criptomoedas e ações. A estrutura combina dados de trading verificados, notícias conferidas por especialistas e vários desenhos de agentes para comparar sistemas em condições de mercado em tempo real. A motivação é que avaliações anteriores frequentemente usam poucos ativos ou períodos, testam modelos em vez de agentes completos ou dependem de dados que não foram verificados de forma independente.

A referência inclui agentes com diferentes perfis de risco e um que usa raciocínio baseado em memória, além de avaliá-los com várias arquiteturas-base de modelos de linguagem. Os experimentos ao vivo relatados encontram mais variação de comportamento entre as estruturas dos agentes, de decisões agressivas a conservadoras, do que entre os modelos subjacentes. O resumo apresenta AMA como uma infraestrutura para avaliação contínua e reproduzível; não informa métricas de desempenho, duração da avaliação ou controles detalhados para comparar estratégias. Suas conclusões dizem respeito às diferenças de comportamento observadas e não estabelecem que algum agente seja consistentemente lucrativo.

Ideias principais

  • O Agent Market Arena é um benchmark em tempo real para agentes de trading LLM nos mercados de cripto e ações.
  • A estrutura combina dados de trading verificados, notícias conferidas e arquiteturas diversas de agentes.
  • A avaliação inclui agentes com diferentes perfis de risco e raciocínio baseado em memória.
  • Experimentos ao vivo relatam diferenças comportamentais maiores entre estruturas de agentes do que entre arquiteturas-base dos modelos.
  • O resumo descreve uma contribuição para avaliação comparativa, mas não apresenta números de rentabilidade nem controles detalhados de avaliação.

Tags

Texto completo
# When Agents Trade: Live Multi-Market Trading Benchmark for LLM Agents


# When Agents Trade: Live Multi-Market Trading Benchmark for LLM Agents









Although Large Language Model (LLM)-based agents are increasingly used in financial trading, it remains unclear whether they can reason and adapt in live markets, as most studies test models instead of agents, cover limited periods and assets, and rely on unverified data. To address these gaps, we introduce Agent Market Arena (AMA), the first lifelong, real-time benchmark for evaluating LLM-based trading agents across multiple markets. AMA integrates verified trading data, expert-checked news, and diverse agent architectures within a unified trading framework, enabling fair and continuous comparison under real conditions. It implements four agents, including InvestorAgent as a single-agent baseline, TradeAgent and HedgeFundAgent with different risk styles, and DeepFundAgent with memory-based reasoning, and evaluates them across GPT-4o, GPT-4.1, Claude-3.5-haiku, Claude-sonnet-4, and Gemini-2.0-flash. Live experiments on both cryptocurrency and stock markets demonstrate that agent frameworks display markedly distinct behavioral patterns, spanning from aggressive risk-taking to conservative decision-making, whereas model backbones contribute less to outcome variation. AMA thus establishes a foundation for rigorous, reproducible, and continuously evolving evaluation of financial reasoning and trading intelligence in LLM-based agents.

Exibido na íntegra, com atribuição conforme a licença da fonte. Licença: abstract CC0

Este resumo foi escrito pelo agente de pesquisa da Stratmill com base no original; não é uma cópia da fonte.