رفتن به محتوا
همه اسناد کتابخانه

معیارسنجی عامل‌های معاملاتی LLM در بازارهای زنده رمزارز و سهام

مقاله arXiv papers · نویسنده: Lingfei Qian et al.

خلاصه

این مقاله Agent Market Arena را معرفی می‌کند؛ معیاری پیوسته و بلادرنگ برای ارزیابی عامل‌های معاملاتی مبتنی بر مدل‌های زبانی بزرگ در بازارهای رمزارز و سهام. این چارچوب داده‌های معاملاتی تأییدشده را با اخبار بررسی‌شده توسط متخصصان و طراحی‌های گوناگون عامل ترکیب می‌کند تا سامانه‌ها را در شرایط زنده مقایسه کند. انگیزه آن این است که ارزیابی‌های پیشین اغلب از دارایی‌ها یا دوره‌های محدودی استفاده می‌کردند، مدل‌ها را به‌جای عامل‌های کامل می‌سنجیدند یا به داده‌هایی متکی بودند که مستقلانه تأیید نشده بودند.

این معیار شامل عامل‌هایی با سبک‌های ریسک متفاوت و یک عامل با استدلال مبتنی بر حافظه است و آن‌ها را با چندین مدل پایه زبانی ارزیابی می‌کند. آزمایش‌های زنده گزارش‌شده تفاوت رفتاری بیشتری را میان چارچوب‌های عامل، از تصمیم‌های تهاجمی تا محافظه‌کارانه، نسبت به تفاوت میان مدل‌های زیربنایی نشان می‌دهند. چکیده AMA را زیرساختی برای ارزیابی مستمر و بازتولیدپذیر معرفی می‌کند؛ اما ارقام عملکرد، مدت معیارسنجی یا کنترل‌های دقیق مقایسه راهبردها را ارائه نمی‌دهد. نتیجه‌گیری‌ها به تفاوت‌های رفتاری مشاهده‌شده مربوط‌اند و ثابت نمی‌کنند که عاملی به‌طور مستمر سودآور است.

ایده‌های کلیدی

  • Agent Market Arena معیاری بلادرنگ برای عامل‌های معاملاتی LLM در بازارهای رمزارز و سهام است.
  • این چارچوب داده معاملاتی تأییدشده، اخبار بررسی‌شده و معماری‌های متنوع عامل را ترکیب می‌کند.
  • ارزیابی، عامل‌هایی با سبک‌های ریسک متفاوت و استدلال مبتنی بر حافظه را دربرمی‌گیرد.
  • آزمایش‌های زنده تفاوت رفتاری بیشتری میان چارچوب‌های عامل نسبت به مدل‌های پایه گزارش می‌کنند.
  • چکیده از دستاوردی در معیارسنجی می‌گوید، اما ارقام سودآوری یا کنترل‌های دقیق ارزیابی را ارائه نمی‌کند.

برچسب‌ها

متن کامل
# When Agents Trade: Live Multi-Market Trading Benchmark for LLM Agents


# When Agents Trade: Live Multi-Market Trading Benchmark for LLM Agents









Although Large Language Model (LLM)-based agents are increasingly used in financial trading, it remains unclear whether they can reason and adapt in live markets, as most studies test models instead of agents, cover limited periods and assets, and rely on unverified data. To address these gaps, we introduce Agent Market Arena (AMA), the first lifelong, real-time benchmark for evaluating LLM-based trading agents across multiple markets. AMA integrates verified trading data, expert-checked news, and diverse agent architectures within a unified trading framework, enabling fair and continuous comparison under real conditions. It implements four agents, including InvestorAgent as a single-agent baseline, TradeAgent and HedgeFundAgent with different risk styles, and DeepFundAgent with memory-based reasoning, and evaluates them across GPT-4o, GPT-4.1, Claude-3.5-haiku, Claude-sonnet-4, and Gemini-2.0-flash. Live experiments on both cryptocurrency and stock markets demonstrate that agent frameworks display markedly distinct behavioral patterns, spanning from aggressive risk-taking to conservative decision-making, whereas model backbones contribute less to outcome variation. AMA thus establishes a foundation for rigorous, reproducible, and continuously evolving evaluation of financial reasoning and trading intelligence in LLM-based agents.

با ذکر منبع و مطابق مجوز اثر، به‌طور کامل نمایش داده می‌شود. مجوز: abstract CC0

این خلاصه را عامل پژوهشی Stratmill بر پایه متن اصلی نوشته است؛ نسخه‌ای از اثر منبع نیست.