الانتقال إلى المحتوى
جميع مستندات المكتبة

قياس أداء وكلاء تداول LLM في أسواق العملات الرقمية والأسهم الفعلية

مقال arXiv papers · المؤلف: Lingfei Qian et al.

الملخص

تقدم هذه الورقة ساحة سوق الوكلاء، وهي معيار مستمر وآني لتقييم وكلاء التداول القائمين على النماذج اللغوية الكبيرة في أسواق العملات الرقمية والأسهم. ويجمع الإطار بيانات تداول موثقة وأخباراً راجعها خبراء وتصاميم متعددة للوكلاء، بهدف مقارنة الأنظمة في ظروف فعلية. وينبع الدافع من أن التقييمات السابقة كثيراً ما تستخدم أصولاً أو فترات محدودة، أو تختبر النماذج بدلاً من الوكلاء الكاملين، أو تعتمد على بيانات لم يتم التحقق منها بشكل مستقل.

يشمل المعيار وكلاء بأساليب مختلفة للمخاطر، وأحدهم يستخدم استدلالاً قائماً على الذاكرة، ويقيّمهم باستخدام عدة نماذج أساسية لغوية. وتجد التجارب الفعلية المذكورة تبايناً أكبر في السلوك بين أطر الوكلاء، من قرارات هجومية إلى محافظة، مقارنة بالتباين بين النماذج الأساسية. وتعرض الخلاصة AMA كبنية تحتية للتقييم المستمر والقابل لإعادة الإنتاج؛ لكنها لا تقدم أرقام أداء أو مدة المعيار أو ضوابط مفصلة لمقارنة الاستراتيجيات. وتتعلق استنتاجاتها باختلافات السلوك المرصودة ولا تثبت أن أي وكيل يحقق ربحاً باستمرار.

الأفكار الرئيسية

  • ساحة سوق الوكلاء معيار آني لوكلاء تداول LLM في أسواق العملات الرقمية والأسهم.
  • يجمع الإطار بيانات تداول موثقة وأخباراً مدققة وبنى متنوعة للوكلاء.
  • يشمل التقييم وكلاء بأساليب مختلفة للمخاطر واستدلال قائم على الذاكرة.
  • تفيد التجارب الفعلية بوجود اختلافات سلوكية أكبر بين أطر الوكلاء منها بين النماذج الأساسية.
  • تصف الخلاصة مساهمة في القياس المعياري، لكنها لا تقدم أرقاماً للربحية أو ضوابط تقييم مفصلة.

الوسوم

النص الكامل
# When Agents Trade: Live Multi-Market Trading Benchmark for LLM Agents


# When Agents Trade: Live Multi-Market Trading Benchmark for LLM Agents









Although Large Language Model (LLM)-based agents are increasingly used in financial trading, it remains unclear whether they can reason and adapt in live markets, as most studies test models instead of agents, cover limited periods and assets, and rely on unverified data. To address these gaps, we introduce Agent Market Arena (AMA), the first lifelong, real-time benchmark for evaluating LLM-based trading agents across multiple markets. AMA integrates verified trading data, expert-checked news, and diverse agent architectures within a unified trading framework, enabling fair and continuous comparison under real conditions. It implements four agents, including InvestorAgent as a single-agent baseline, TradeAgent and HedgeFundAgent with different risk styles, and DeepFundAgent with memory-based reasoning, and evaluates them across GPT-4o, GPT-4.1, Claude-3.5-haiku, Claude-sonnet-4, and Gemini-2.0-flash. Live experiments on both cryptocurrency and stock markets demonstrate that agent frameworks display markedly distinct behavioral patterns, spanning from aggressive risk-taking to conservative decision-making, whereas model backbones contribute less to outcome variation. AMA thus establishes a foundation for rigorous, reproducible, and continuously evolving evaluation of financial reasoning and trading intelligence in LLM-based agents.

يُعرض النص كاملًا مع نسبه إلى مصدره وفقًا لترخيصه. الترخيص: abstract CC0

أعدّ وكيل الأبحاث في Stratmill هذا الملخص استنادًا إلى المصدر الأصلي؛ وهو ليس نسخة منه.