MARKET-BENCH: בדיקת מודלי שפה גדולים בבקטסטינג של מסחר כמותי
סיכום
MARKET-BENCH בוחן אם מודלי שפה גדולים יכולים להפוך תיאורי אסטרטגיות והנחות שוק בשפה טבעית למערכות בקטסטינג ניתנות להרצה. המשימות כוללות מסחר מתוזמן ב-Microsoft, מסחר בזוגות ב-Coca-Cola וב-Pepsi, וגידור דלתא ב-Microsoft. אמת המידה משווה את נתיבי הרווח וההפסד, הדרואודאון והפוזיציות שנוצרו למימוש ייחוס, ומודדת גם אם הבקטסט של מודל רץ וגם עד כמה תוצאותיו תואמות לייחוס.
הערכה רב־סבבית של שלושה עשר מודלים מראה שרובם יכולים לבצע באופן אמין את האסטרטגיה הפשוטה ביותר, בעוד שהשגיאות המספריות שונות מאוד בין מודלים ומשימות. המאמר מדווח על תוצאות חזקות של כמה מודלים, לרבות יכולת הרצה מושלמת של GPT-5.2, לצד מקרים שבהם פלטים הניתנים להרצה עדיין יוצרים נתיבים לא מדויקים. הממצאים מצביעים על כך שהצלחה בהרצה לבדה אינה מבטיחה היגיון מסחר נכון. התוצאות מוגבלות למשימות המבוא ולהנחות של אמת המידה, ולכן אינן מבססות ביצועים באסטרטגיות מורכבות יותר או בשווקים חיים.
רעיונות מרכזיים
- אמת המידה בוחנת יצירת קוד למסחר מתוזמן, למסחר בזוגות ולגידור דלתא.
- היא מודדת בנפרד אם הבקטסטים רצים ועד כמה הפלטים שלהם תואמים לייחוס.
- שלושה עשר מודלים נבדקים בכמה סבבים.
- גם בקטסטים שניתנים להרצה עלולים להציג נתיבי רווח והפסד או פוזיציות לא מדויקים.
- התוצאות מכסות משימות מבוא באמת המידה ואינן מבססות יכולת מסחר חי.
תגיות
הטקסט המלא
# Market-Bench: Evaluating Large Language Models on Introductory Quantitative Trading and Market Dynamics # Market-Bench: Evaluating Large Language Models on Introductory Quantitative Trading and Market Dynamics We introduce MARKET-BENCH, a benchmark that evaluates large language models (LLMs) on introductory quantitative trading tasks by asking them to construct executable backtesters from natural language strategy descriptions and market assumptions. Each instance specifies one of three canonical strategies: scheduled trading on Microsoft (NASDAQ: MSFT), pairs trading on Coca-Cola (NASDAQ: KO) and Pepsi (NASDAQ: PEP), or delta hedging on MSFT. Models must produce code whose profit and loss (P and L), drawdown, and position paths match a verifiable reference implementation. We assess thirteen state-of-the-art models using a multi-round evaluation that separates structural reliability (whether the backtest runs) from numerical accuracy (mean absolute error of the backtest metrics), assigning failed outputs a duplicated-metrics baseline MAE. While most models reliably execute the simplest strategy (average executable passes of 4.08 out of 5 rounds), errors vary by orders of magnitude across models and tasks. Gemini 3 Pro and Claude 4.5 Sonnet combine strong reliability with low error on simpler strategies. GPT-5.2 achieves strong overall performance with perfect executability. GPT-5.1 Codex-Max achieves the lowest best-run error on the easiest task. Qwen3 Max attains perfect executability yet sometimes produces inaccurate profit and loss paths. These results show that current LLMs can scaffold basic trading infrastructure but still struggle to reason robustly about prices, inventory, and risk. We release MARKET-BENCH and a public leaderboard at https://marketbench.ai.
מוצג במלואו בציון המקור ובהתאם לרישיון שלו. רישיון: abstract CC0
הסיכום נכתב בידי סוכן המחקר של Stratmill על סמך המקור; הוא אינו העתק של המקור.