Passer au contenu
Tous les documents de la bibliothèque

MintEval : vérifier si le code de trading LLM respecte sa spécification

Article arXiv papers · Auteur: Siyu Wang et al.

Résumé

MintEval évalue si les modèles de langage traduisent les instructions des traders en code dont le comportement correspond à la stratégie voulue. Il construit des stratégies de référence à partir de composants combinables, les transforme en instructions courantes et demande aux modèles de les implémenter. Les programmes générés et de référence sont exécutés barre par barre sur les mêmes données de marché et avec les mêmes frictions ; leurs actions sont comparées afin que les écarts de performance du marché ne faussent pas l’évaluation de la fidélité de l’implémentation.

Le benchmark initial contient 800 tâches utilisant les données BTCUSDT en intervalle de 15 minutes, regroupées selon la complexité de l’étendue d’état mesurée à l’exécution. Les résultats rapportés montrent que les performances des modèles varient fortement : les modèles moins coûteux présentent un accord limité sur les actions et reproduisent rarement les résultats exactement, tandis qu’un modèle de pointe obtient de meilleurs résultats sur un sous-ensemble de 200 tâches, mais produit encore des échecs silencieux. Même lorsque les modèles identifient correctement les éléments demandés, de nombreuses implémentations s’écartent de la spécification sur les barres actives. Les auteurs indiquent également qu’un évaluateur LLM a accepté tous ces échecs. Le benchmark mesure l’équivalence comportementale pour les tâches et données définies ; il n’établit pas la rentabilité du trading et ne se généralise pas automatiquement à d’autres marchés et types de stratégie.

Idées clés

  • Le benchmark compare les actions de trading exécutées, et non la similarité du code source ou les profits.
  • Les stratégies de référence sont composées par programme puis traduites en instructions informelles destinées aux traders.
  • Les deux implémentations utilisent les mêmes données de marché et frictions de trading afin d’isoler les différences de comportement.
  • Les performances sont évaluées sur des tâches regroupées selon la complexité de l’étendue d’état mesurée à l’exécution.
  • Reconnaître correctement une spécification de stratégie ne garantit pas que le code généré la mette fidèlement en œuvre.

Étiquettes

Texte intégral
# 2610.03080


# MintEval: Do LLMs Implement the Trading Strategy You Asked For? A Behavioural-Equivalence Benchmark for Natural-Language-to-Strategy Code









Large language models are moving from producing trading signals to writing the code that executes them. The failure mode of the second role is silent: generated code runs, a backtest plots, yet the risk logic that the trader described is not the logic being executed. Existing code benchmarks test functional correctness on unit tests and finance benchmarks test forecasting; neither measures whether an implementation behaves like the strategy that was asked for. We introduce MintEval, a benchmark in which reference strategies are generated programmatically from a library of composable building blocks, back-translated into colloquial trader instructions, and re-implemented by the model under test. Generated and reference programs are executed bar by bar on identical market data and frictions, and compared on their actions rather than on code similarity or profit: alpha is differenced away. MintEval v0 contains 800 tasks on BTCUSDT 15-minute data, stratified by an execution-measured state-span complexity tau that is decoupled from description length. Low-cost models reach a mean ActionMatch of at most 0.544 and reproduce at most 0.087 of tasks exactly; on a stratified subset of 200 tasks a frontier model (Claude Opus 5.5) reaches 0.889 and reproduces 0.575 exactly, yet still fails silently on 0.275 of tasks. Given a menu of building blocks, models identify the strategy almost perfectly, yet 79.2% of the implementations whose specification was read correctly diverge on more than 10% of active bars. The LLM judge of a recent strategy-generation benchmark, applied verbatim, accepts every one of these silent failures.

Reproduit dans son intégralité avec attribution, conformément à la licence de la source. Licence: abstract CC0

Ce résumé a été rédigé par l’agent de recherche de Stratmill à partir de la source originale ; il n’en est pas une copie.