MintEval: آیا LLM ٹریڈنگ کوڈ اپنی تفصیل سے مطابقت رکھتا ہے
خلاصہ
MintEval جانچتا ہے کہ آیا زبان کے ماڈل ٹریڈر کی ہدایات کو ایسے کوڈ میں بدلتے ہیں جو مطلوبہ اسٹریٹیجی کے مطابق برتاؤ کرے۔ یہ قابلِ ترکیب اجزا سے حوالہ جاتی اسٹریٹیجیاں بناتا، انہیں عام فہم ہدایات میں ڈھالتا اور ماڈلز سے انہیں نافذ کرنے کو کہتا ہے۔ تیار کردہ اور حوالہ جاتی پروگرام ایک ہی مارکیٹ ڈیٹا اور یکساں لین دین کے اخراجات و رکاوٹوں کے ساتھ ہر بار پر چلائے جاتے ہیں؛ ان کے اعمال کا موازنہ کیا جاتا ہے، تاکہ مارکیٹ کی کارکردگی کے فرق نفاذ کی وفاداری کے جائزے پر اثرانداز نہ ہوں۔
ابتدائی معیار میں 800 کام شامل ہیں، جن میں BTCUSDT کے 15 منٹ کے ڈیٹا کو عمل درآمد کی بنیاد پر ناپی گئی حالتوں کے دائرۂ کار کی پیچیدگی کے مطابق گروہ بند کیا گیا ہے۔ رپورٹ شدہ نتائج کے مطابق ماڈلز کی کارکردگی میں نمایاں فرق ہے: کم لاگت والے ماڈلز کے اعمال میں محدود مطابقت اور عین بازتولید ہے، جبکہ ایک فرنٹیئر ماڈل 200 کاموں کے ذیلی مجموعے پر بہتر کارکردگی دکھاتا ہے، مگر پھر بھی خاموش ناکامیاں پیدا کرتا ہے۔ ماڈلز مطلوبہ اجزا درست طور پر شناخت کر لیں تب بھی بہت سے نفاذ فعال بارز میں تصریح سے ہٹ جاتے ہیں۔ مصنفین یہ بھی رپورٹ کرتے ہیں کہ ایک LLM جج نے ایسی تمام ناکامیوں کو قبول کر لیا۔ یہ معیار اپنے متعین کاموں اور ڈیٹا پر رویے کی مساوات ناپتا ہے؛ یہ ٹریڈنگ کا منافع ثابت نہیں کرتا اور نہ ہی خود بخود دوسری مارکیٹوں اور اسٹریٹیجی کی اقسام پر لاگو ہوتا ہے۔
اہم خیالات
- معیار ماخذ کوڈ کی مماثلت یا منافع کے بجائے عمل درآمد شدہ ٹریڈنگ اعمال کا موازنہ کرتا ہے۔
- حوالہ جاتی اسٹریٹیجیاں پروگرام کے ذریعے ترکیب دی جاتی ہیں اور غیر رسمی ٹریڈر ہدایات میں بدلی جاتی ہیں۔
- رویے کے فرق کو الگ جانچنے کے لیے دونوں نفاذ یکساں مارکیٹ ڈیٹا اور لین دین کے اخراجات و رکاوٹوں کے ساتھ چلائے جاتے ہیں۔
- کارکردگی کا جائزہ ان کاموں میں لیا جاتا ہے جنہیں عمل درآمد کی بنیاد پر ناپی گئی حالتوں کے دائرۂ کار کی پیچیدگی کے مطابق گروہ بند کیا گیا ہے۔
- اسٹریٹیجی کی تفصیل کو درست سمجھ لینا اس بات کی ضمانت نہیں کہ تیار کردہ کوڈ اسے وفاداری سے نافذ کرے گا۔
ٹیگز
مکمل متن
# 2610.03080 # MintEval: Do LLMs Implement the Trading Strategy You Asked For? A Behavioural-Equivalence Benchmark for Natural-Language-to-Strategy Code Large language models are moving from producing trading signals to writing the code that executes them. The failure mode of the second role is silent: generated code runs, a backtest plots, yet the risk logic that the trader described is not the logic being executed. Existing code benchmarks test functional correctness on unit tests and finance benchmarks test forecasting; neither measures whether an implementation behaves like the strategy that was asked for. We introduce MintEval, a benchmark in which reference strategies are generated programmatically from a library of composable building blocks, back-translated into colloquial trader instructions, and re-implemented by the model under test. Generated and reference programs are executed bar by bar on identical market data and frictions, and compared on their actions rather than on code similarity or profit: alpha is differenced away. MintEval v0 contains 800 tasks on BTCUSDT 15-minute data, stratified by an execution-measured state-span complexity tau that is decoupled from description length. Low-cost models reach a mean ActionMatch of at most 0.544 and reproduce at most 0.087 of tasks exactly; on a stratified subset of 200 tasks a frontier model (Claude Opus 5.5) reaches 0.889 and reproduces 0.575 exactly, yet still fails silently on 0.275 of tasks. Given a menu of building blocks, models identify the strategy almost perfectly, yet 79.2% of the implementations whose specification was read correctly diverge on more than 10% of active bars. The LLM judge of a recent strategy-generation benchmark, applied verbatim, accepts every one of these silent failures.
ماخذ کا حوالہ دیتے ہوئے مکمل متن دکھایا گیا ہے، ماخذ کے لائسنس کے تحت۔ لائسنس: abstract CC0
یہ خلاصہ اصل ماخذ سے Stratmill کے تحقیقی ایجنٹ نے لکھا ہے؛ یہ ماخذ کی نقل نہیں۔