رفتن به محتوا
همه اسناد کتابخانه

MintEval: آزمون تطابق کد معاملاتی LLM با مشخصات

مقاله arXiv papers · نویسنده: Siyu Wang et al.

خلاصه

MintEval ارزیابی می‌کند که آیا مدل‌های زبانی دستورهای معامله‌گر را به کدی تبدیل می‌کنند که مطابق استراتژی موردنظر رفتار کند. این ابزار از اجزای ترکیب‌پذیر، استراتژی‌های مرجع می‌سازد، آن‌ها را به دستورهای محاوره‌ای تبدیل می‌کند و از مدل‌ها می‌خواهد پیاده‌سازی‌شان کنند. برنامه‌های تولیدشده و مرجع، کندل به کندل روی داده‌های بازار و اصطکاک‌های یکسان اجرا می‌شوند؛ سپس کنش‌هایشان مقایسه می‌شود تا تفاوت عملکرد بازار، وفاداری پیاده‌سازی را مخدوش نکند.

معیار اولیه شامل 800 وظیفه با داده‌های BTCUSDT در بازه‌های 15 دقیقه‌ای است که بر اساس پیچیدگی دامنه حالتِ اندازه‌گیری‌شده از اجرا گروه‌بندی شده‌اند. نتایج گزارش‌شده نشان می‌دهند عملکرد مدل‌ها تفاوت زیادی دارد: مدل‌های کم‌هزینه‌تر توافق محدودی در کنش‌ها و بازتولید دقیق دارند؛ یک مدل پیشرو در زیرمجموعه‌ای شامل 200 وظیفه بهتر عمل می‌کند، اما همچنان خطاهای بی‌صدا دارد. حتی وقتی مدل‌ها اجزای درخواستی را درست تشخیص می‌دهند، بسیاری از پیاده‌سازی‌ها در کندل‌های فعال از مشخصات فاصله می‌گیرند. نویسندگان همچنین گزارش می‌کنند که یک داور LLM همه این خطاها را پذیرفته است. این معیار، هم‌ارزی رفتاری را در وظایف و داده‌های تعریف‌شده می‌سنجد؛ سودآوری معامله را اثبات نمی‌کند و به‌طور خودکار به بازارها و انواع استراتژی دیگر تعمیم نمی‌یابد.

ایده‌های کلیدی

  • این معیار کنش‌های معاملاتی اجراشده را مقایسه می‌کند، نه شباهت کد منبع یا سود.
  • استراتژی‌های مرجع با ترکیب برنامه‌ای اجزا ساخته و به دستورهای غیررسمی معامله‌گر تبدیل می‌شوند.
  • هر دو پیاده‌سازی روی داده‌های بازار و اصطکاک‌های معاملاتی یکسان اجرا می‌شوند تا تفاوت‌های رفتاری جداگانه سنجیده شوند.
  • عملکرد در وظایفی ارزیابی می‌شود که بر اساس پیچیدگی دامنه حالتِ مبتنی بر اجرا گروه‌بندی شده‌اند.
  • تشخیص درست مشخصات یک استراتژی تضمین نمی‌کند که کد تولیدشده آن را وفادارانه پیاده‌سازی کند.

برچسب‌ها

متن کامل
# 2610.03080


# MintEval: Do LLMs Implement the Trading Strategy You Asked For? A Behavioural-Equivalence Benchmark for Natural-Language-to-Strategy Code









Large language models are moving from producing trading signals to writing the code that executes them. The failure mode of the second role is silent: generated code runs, a backtest plots, yet the risk logic that the trader described is not the logic being executed. Existing code benchmarks test functional correctness on unit tests and finance benchmarks test forecasting; neither measures whether an implementation behaves like the strategy that was asked for. We introduce MintEval, a benchmark in which reference strategies are generated programmatically from a library of composable building blocks, back-translated into colloquial trader instructions, and re-implemented by the model under test. Generated and reference programs are executed bar by bar on identical market data and frictions, and compared on their actions rather than on code similarity or profit: alpha is differenced away. MintEval v0 contains 800 tasks on BTCUSDT 15-minute data, stratified by an execution-measured state-span complexity tau that is decoupled from description length. Low-cost models reach a mean ActionMatch of at most 0.544 and reproduce at most 0.087 of tasks exactly; on a stratified subset of 200 tasks a frontier model (Claude Opus 5.5) reaches 0.889 and reproduces 0.575 exactly, yet still fails silently on 0.275 of tasks. Given a menu of building blocks, models identify the strategy almost perfectly, yet 79.2% of the implementations whose specification was read correctly diverge on more than 10% of active bars. The LLM judge of a recent strategy-generation benchmark, applied verbatim, accepts every one of these silent failures.

با ذکر منبع و مطابق مجوز اثر، به‌طور کامل نمایش داده می‌شود. مجوز: abstract CC0

این خلاصه را عامل پژوهشی Stratmill بر پایه متن اصلی نوشته است؛ نسخه‌ای از اثر منبع نیست.