עבור לתוכן
כל מסמכי הספרייה

בדיקת סוכני מסחר באמצעות שחזור ספר פקודות בשוקי תחזיות

מאמר arXiv papers · מחבר: Avi Arora et al.

סיכום

המסמך מציג אמת מידה להערכת סוכני מסחר אלגוריתמיים וסוכני מודלי שפה בשוקי תחזיות. הוא בונה אפיזודות היסטוריות מעדכוני ספר פקודות, עסקאות, אירועי מחזור חיים של חוזים וסילוקים, ואז משחזר אותן באופן דטרמיניסטי כדי שהאסטרטגיות ייתקלו ברצף עקבי של תנאי שוק. ממשק סוכן מאפשר גם לאלגוריתמים רגילים וגם למודלי שפה המשתמשים בכלים לפעול בסימולציה.

הסימולטור מדמה ביצועי עושה שוק ולוקח נזילות, לצד עמלות, וכך מאפשר להעריך תוצאות בנוכחות חיכוכי מסחר וסיכון סילוק. מתוארות ארבע אפיזודות המבוססות על שוקי מטבעות קריפטוגרפיים, מזג אוויר וספורט. ממצאי הבסיס מצביעים על כך שסוכנים פשוטים עלולים להפסיד בגלל עלויות עסקה או תוצאות סילוק, בעוד שאסטרטגיות המביאות בחשבון עמלות יכולות להישאר תחרותיות באפיזודות תנודתיות. הראיות מוגבלות לארבע האפיזודות ולממצאי הבסיס שצוינו; התקציר אינו מספק נתוני ביצועים מפורטים או טענות רחבות יותר על תוצאות בשווקים אחרים.

רעיונות מרכזיים

  • אפשר לשחזר זרמי שוק היסטוריים באופן דטרמיניסטי כדי להשוות סוכנים בתנאים עקביים.
  • אמת המידה משלבת נתוני ספר פקודות, עסקאות, אירועי מחזור חיים של חוזים וסילוקים באפיזודות.
  • הסימולטור מדמה את התנהגותם של עושי שוק ולוקחי נזילות, וכן עמלות.
  • עלויות והפסדים מסילוק עלולים לפגוע במסחר נאיבי.
  • לפי הדיווח, אלגוריתמים המביאים בחשבון עמלות תחרותיים באפיזודות תנודתיות, אך הראיות מוגבלות לארבעה שווקים.

תגיות

הטקסט המלא
# PredictionMarketBench: A SWE-bench-Style Framework for Backtesting Trading Agents on Prediction Markets


# PredictionMarketBench: A SWE-bench-Style Framework for Backtesting Trading Agents on Prediction Markets









Prediction markets offer a natural testbed for trading agents: contracts have binary payoffs, prices can be interpreted as probabilities, and realized performance depends critically on market microstructure, fees, and settlement risk. We introduce PredictionMarketBench, a SWE-bench-style benchmark for evaluating algorithmic and LLM-based trading agents on prediction markets via deterministic, event-driven replay of historical limit-order-book and trade data. PredictionMarketBench standardizes (i) episode construction from raw exchange streams (orderbooks, trades, lifecycle, settlement), (ii) an execution-realistic simulator with maker/taker semantics and fee modeling, and (iii) a tool-based agent interface that supports both classical strategies and tool-calling LLM agents with reproducible trajectories. We release four Kalshi-based episodes spanning cryptocurrency, weather, and sports. Baseline results show that naive trading agents can underperform due to transaction costs and settlement losses, while fee-aware algorithmic strategies remain competitive in volatile episodes.

מוצג במלואו בציון המקור ובהתאם לרישיון שלו. רישיון: abstract CC0

הסיכום נכתב בידי סוכן המחקר של Stratmill על סמך המקור; הוא אינו העתק של המקור.