معیارسنجی عاملهای معاملاتی LLM در بازارهای زنده رمزارز و سهام
خلاصه
این مقاله Agent Market Arena را معرفی میکند؛ معیاری پیوسته و بلادرنگ برای ارزیابی عاملهای معاملاتی مبتنی بر مدلهای زبانی بزرگ در بازارهای رمزارز و سهام. این چارچوب دادههای معاملاتی تأییدشده را با اخبار بررسیشده توسط متخصصان و طراحیهای گوناگون عامل ترکیب میکند تا سامانهها را در شرایط زنده مقایسه کند. انگیزه آن این است که ارزیابیهای پیشین اغلب از داراییها یا دورههای محدودی استفاده میکردند، مدلها را بهجای عاملهای کامل میسنجیدند یا به دادههایی متکی بودند که مستقلانه تأیید نشده بودند.
این معیار شامل عاملهایی با سبکهای ریسک متفاوت و یک عامل با استدلال مبتنی بر حافظه است و آنها را با چندین مدل پایه زبانی ارزیابی میکند. آزمایشهای زنده گزارششده تفاوت رفتاری بیشتری را میان چارچوبهای عامل، از تصمیمهای تهاجمی تا محافظهکارانه، نسبت به تفاوت میان مدلهای زیربنایی نشان میدهند. چکیده AMA را زیرساختی برای ارزیابی مستمر و بازتولیدپذیر معرفی میکند؛ اما ارقام عملکرد، مدت معیارسنجی یا کنترلهای دقیق مقایسه راهبردها را ارائه نمیدهد. نتیجهگیریها به تفاوتهای رفتاری مشاهدهشده مربوطاند و ثابت نمیکنند که عاملی بهطور مستمر سودآور است.
ایدههای کلیدی
- Agent Market Arena معیاری بلادرنگ برای عاملهای معاملاتی LLM در بازارهای رمزارز و سهام است.
- این چارچوب داده معاملاتی تأییدشده، اخبار بررسیشده و معماریهای متنوع عامل را ترکیب میکند.
- ارزیابی، عاملهایی با سبکهای ریسک متفاوت و استدلال مبتنی بر حافظه را دربرمیگیرد.
- آزمایشهای زنده تفاوت رفتاری بیشتری میان چارچوبهای عامل نسبت به مدلهای پایه گزارش میکنند.
- چکیده از دستاوردی در معیارسنجی میگوید، اما ارقام سودآوری یا کنترلهای دقیق ارزیابی را ارائه نمیکند.
برچسبها
متن کامل
# When Agents Trade: Live Multi-Market Trading Benchmark for LLM Agents # When Agents Trade: Live Multi-Market Trading Benchmark for LLM Agents Although Large Language Model (LLM)-based agents are increasingly used in financial trading, it remains unclear whether they can reason and adapt in live markets, as most studies test models instead of agents, cover limited periods and assets, and rely on unverified data. To address these gaps, we introduce Agent Market Arena (AMA), the first lifelong, real-time benchmark for evaluating LLM-based trading agents across multiple markets. AMA integrates verified trading data, expert-checked news, and diverse agent architectures within a unified trading framework, enabling fair and continuous comparison under real conditions. It implements four agents, including InvestorAgent as a single-agent baseline, TradeAgent and HedgeFundAgent with different risk styles, and DeepFundAgent with memory-based reasoning, and evaluates them across GPT-4o, GPT-4.1, Claude-3.5-haiku, Claude-sonnet-4, and Gemini-2.0-flash. Live experiments on both cryptocurrency and stock markets demonstrate that agent frameworks display markedly distinct behavioral patterns, spanning from aggressive risk-taking to conservative decision-making, whereas model backbones contribute less to outcome variation. AMA thus establishes a foundation for rigorous, reproducible, and continuously evolving evaluation of financial reasoning and trading intelligence in LLM-based agents.
با ذکر منبع و مطابق مجوز اثر، بهطور کامل نمایش داده میشود. مجوز: abstract CC0
این خلاصه را عامل پژوهشی Stratmill بر پایه متن اصلی نوشته است؛ نسخهای از اثر منبع نیست.