Évaluer les agents de trading LLM sur les marchés réels des cryptomonnaies et des actions
Résumé
Cet article présente Agent Market Arena, un benchmark continu en temps réel pour évaluer des agents de trading fondés sur de grands modèles de langage sur les marchés des cryptomonnaies et des actions. Le cadre combine des données de trading vérifiées, des actualités contrôlées par des experts et plusieurs conceptions d’agents afin de comparer les systèmes sur les marchés en temps réel. Il répond au fait que les évaluations précédentes portent souvent sur un nombre limité d’actifs ou de périodes, testent des modèles plutôt que des agents complets, ou reposent sur des données qui n’ont pas été vérifiées de manière indépendante.
Le benchmark comprend des agents aux profils de risque variés, dont un qui utilise un raisonnement fondé sur la mémoire, et les évalue avec plusieurs modèles de langage sous-jacents. Les expériences rapportées en négociation réelle font état d’une plus grande variation des comportements entre les cadres d’agents, des décisions agressives aux décisions prudentes, qu’entre les modèles sous-jacents. Le résumé présente AMA comme une infrastructure d’évaluation continue et reproductible ; il ne donne ni chiffres de performance, ni durée du benchmark, ni contrôles détaillés pour comparer les stratégies. Ses conclusions portent sur les différences de comportement observées et n’établissent pas qu’un agent soit systématiquement rentable.
Idées clés
- Agent Market Arena est un benchmark en temps réel pour des agents de trading LLM sur les marchés réels des cryptomonnaies et des actions.
- Le cadre combine des données de trading vérifiées, des actualités contrôlées et différentes architectures d’agents.
- L’évaluation comprend des agents aux profils de risque variés, dont un qui utilise le raisonnement fondé sur la mémoire.
- Les expériences en négociation réelle font état de différences comportementales plus importantes entre les cadres d’agents qu’entre les modèles sous-jacents.
- Le résumé présente une contribution à l’évaluation comparative, sans chiffres de rentabilité ni contrôles détaillés de l’évaluation.
Étiquettes
Texte intégral
# When Agents Trade: Live Multi-Market Trading Benchmark for LLM Agents # When Agents Trade: Live Multi-Market Trading Benchmark for LLM Agents Although Large Language Model (LLM)-based agents are increasingly used in financial trading, it remains unclear whether they can reason and adapt in live markets, as most studies test models instead of agents, cover limited periods and assets, and rely on unverified data. To address these gaps, we introduce Agent Market Arena (AMA), the first lifelong, real-time benchmark for evaluating LLM-based trading agents across multiple markets. AMA integrates verified trading data, expert-checked news, and diverse agent architectures within a unified trading framework, enabling fair and continuous comparison under real conditions. It implements four agents, including InvestorAgent as a single-agent baseline, TradeAgent and HedgeFundAgent with different risk styles, and DeepFundAgent with memory-based reasoning, and evaluates them across GPT-4o, GPT-4.1, Claude-3.5-haiku, Claude-sonnet-4, and Gemini-2.0-flash. Live experiments on both cryptocurrency and stock markets demonstrate that agent frameworks display markedly distinct behavioral patterns, spanning from aggressive risk-taking to conservative decision-making, whereas model backbones contribute less to outcome variation. AMA thus establishes a foundation for rigorous, reproducible, and continuously evolving evaluation of financial reasoning and trading intelligence in LLM-based agents.
Reproduit dans son intégralité avec attribution, conformément à la licence de la source. Licence: abstract CC0
Ce résumé a été rédigé par l’agent de recherche de Stratmill à partir de la source originale ; il n’en est pas une copie.