MintEval: آزمون تطابق کد معاملاتی LLM با مشخصات
خلاصه
MintEval ارزیابی میکند که آیا مدلهای زبانی دستورهای معاملهگر را به کدی تبدیل میکنند که مطابق استراتژی موردنظر رفتار کند. این ابزار از اجزای ترکیبپذیر، استراتژیهای مرجع میسازد، آنها را به دستورهای محاورهای تبدیل میکند و از مدلها میخواهد پیادهسازیشان کنند. برنامههای تولیدشده و مرجع، کندل به کندل روی دادههای بازار و اصطکاکهای یکسان اجرا میشوند؛ سپس کنشهایشان مقایسه میشود تا تفاوت عملکرد بازار، وفاداری پیادهسازی را مخدوش نکند.
معیار اولیه شامل 800 وظیفه با دادههای BTCUSDT در بازههای 15 دقیقهای است که بر اساس پیچیدگی دامنه حالتِ اندازهگیریشده از اجرا گروهبندی شدهاند. نتایج گزارششده نشان میدهند عملکرد مدلها تفاوت زیادی دارد: مدلهای کمهزینهتر توافق محدودی در کنشها و بازتولید دقیق دارند؛ یک مدل پیشرو در زیرمجموعهای شامل 200 وظیفه بهتر عمل میکند، اما همچنان خطاهای بیصدا دارد. حتی وقتی مدلها اجزای درخواستی را درست تشخیص میدهند، بسیاری از پیادهسازیها در کندلهای فعال از مشخصات فاصله میگیرند. نویسندگان همچنین گزارش میکنند که یک داور LLM همه این خطاها را پذیرفته است. این معیار، همارزی رفتاری را در وظایف و دادههای تعریفشده میسنجد؛ سودآوری معامله را اثبات نمیکند و بهطور خودکار به بازارها و انواع استراتژی دیگر تعمیم نمییابد.
ایدههای کلیدی
- این معیار کنشهای معاملاتی اجراشده را مقایسه میکند، نه شباهت کد منبع یا سود.
- استراتژیهای مرجع با ترکیب برنامهای اجزا ساخته و به دستورهای غیررسمی معاملهگر تبدیل میشوند.
- هر دو پیادهسازی روی دادههای بازار و اصطکاکهای معاملاتی یکسان اجرا میشوند تا تفاوتهای رفتاری جداگانه سنجیده شوند.
- عملکرد در وظایفی ارزیابی میشود که بر اساس پیچیدگی دامنه حالتِ مبتنی بر اجرا گروهبندی شدهاند.
- تشخیص درست مشخصات یک استراتژی تضمین نمیکند که کد تولیدشده آن را وفادارانه پیادهسازی کند.
برچسبها
متن کامل
# 2610.03080 # MintEval: Do LLMs Implement the Trading Strategy You Asked For? A Behavioural-Equivalence Benchmark for Natural-Language-to-Strategy Code Large language models are moving from producing trading signals to writing the code that executes them. The failure mode of the second role is silent: generated code runs, a backtest plots, yet the risk logic that the trader described is not the logic being executed. Existing code benchmarks test functional correctness on unit tests and finance benchmarks test forecasting; neither measures whether an implementation behaves like the strategy that was asked for. We introduce MintEval, a benchmark in which reference strategies are generated programmatically from a library of composable building blocks, back-translated into colloquial trader instructions, and re-implemented by the model under test. Generated and reference programs are executed bar by bar on identical market data and frictions, and compared on their actions rather than on code similarity or profit: alpha is differenced away. MintEval v0 contains 800 tasks on BTCUSDT 15-minute data, stratified by an execution-measured state-span complexity tau that is decoupled from description length. Low-cost models reach a mean ActionMatch of at most 0.544 and reproduce at most 0.087 of tasks exactly; on a stratified subset of 200 tasks a frontier model (Claude Opus 5.5) reaches 0.889 and reproduces 0.575 exactly, yet still fails silently on 0.275 of tasks. Given a menu of building blocks, models identify the strategy almost perfectly, yet 79.2% of the implementations whose specification was read correctly diverge on more than 10% of active bars. The LLM judge of a recent strategy-generation benchmark, applied verbatim, accepts every one of these silent failures.
با ذکر منبع و مطابق مجوز اثر، بهطور کامل نمایش داده میشود. مجوز: abstract CC0
این خلاصه را عامل پژوهشی Stratmill بر پایه متن اصلی نوشته است؛ نسخهای از اثر منبع نیست.