Перейти к содержимому
Все документы библиотеки

Оценка торговых агентов LLM на реальных рынках криптовалют и акций

Статья arXiv papers · Автор: Lingfei Qian et al.

Сводка

В статье представлена Agent Market Arena — непрерывный бенчмарк в реальном времени для оценки торговых агентов на основе больших языковых моделей на рынках криптовалют и акций. Система объединяет проверенные торговые данные, новости, проверенные экспертами, и несколько вариантов архитектуры агентов, чтобы сравнивать системы в реальных условиях. Разработка вызвана тем, что в прежних оценках часто использовался ограниченный набор активов или периодов, проверялись модели, а не полноценные агенты, либо брались данные без независимой проверки.

В бенчмарк входят агенты с разными стилями управления риском, в том числе агент с рассуждениями на основе памяти; их оценивают с несколькими базовыми языковыми моделями. В описанных экспериментах в реальном времени различия в поведении между архитектурами агентов — от агрессивных до консервативных решений — оказались заметнее, чем различия между базовыми моделями. В аннотации AMA представлен как инфраструктура для непрерывной воспроизводимой оценки; показатели эффективности, длительность бенчмарка и подробные способы контроля сравнения стратегий не приводятся. Выводы касаются наблюдаемых различий в поведении и не доказывают, что какой-либо агент стабильно получает прибыль.

Ключевые идеи

  • Agent Market Arena — бенчмарк в реальном времени для торговых агентов LLM на криптовалютном и фондовом рынках.
  • Система объединяет проверенные торговые данные, проверенные новости и разные архитектуры агентов.
  • В оценке участвуют агенты с разным отношением к риску и рассуждениями на основе памяти.
  • В экспериментах в реальном времени различия в поведении архитектур агентов оказались больше, чем различия между базовыми моделями.
  • В аннотации описан вклад в бенчмаркинг, но нет показателей прибыльности или подробных правил оценки.

Теги

Полный текст
# When Agents Trade: Live Multi-Market Trading Benchmark for LLM Agents


# When Agents Trade: Live Multi-Market Trading Benchmark for LLM Agents









Although Large Language Model (LLM)-based agents are increasingly used in financial trading, it remains unclear whether they can reason and adapt in live markets, as most studies test models instead of agents, cover limited periods and assets, and rely on unverified data. To address these gaps, we introduce Agent Market Arena (AMA), the first lifelong, real-time benchmark for evaluating LLM-based trading agents across multiple markets. AMA integrates verified trading data, expert-checked news, and diverse agent architectures within a unified trading framework, enabling fair and continuous comparison under real conditions. It implements four agents, including InvestorAgent as a single-agent baseline, TradeAgent and HedgeFundAgent with different risk styles, and DeepFundAgent with memory-based reasoning, and evaluates them across GPT-4o, GPT-4.1, Claude-3.5-haiku, Claude-sonnet-4, and Gemini-2.0-flash. Live experiments on both cryptocurrency and stock markets demonstrate that agent frameworks display markedly distinct behavioral patterns, spanning from aggressive risk-taking to conservative decision-making, whereas model backbones contribute less to outcome variation. AMA thus establishes a foundation for rigorous, reproducible, and continuously evolving evaluation of financial reasoning and trading intelligence in LLM-based agents.

Полный текст с указанием источника опубликован на условиях его лицензии. Лицензия: abstract CC0

Это краткое изложение подготовлено исследовательским агентом Stratmill по оригиналу и не является его копией.