MintEval: comprobar si el código de trading LLM cumple su especificación
Resumen
MintEval evalúa si los modelos de lenguaje traducen instrucciones de traders a código que se comporta como la estrategia prevista. Construye estrategias de referencia con componentes combinables, las convierte en instrucciones coloquiales y pide a los modelos que las implementen. Los programas generados y los de referencia se ejecutan barra a barra con los mismos datos de mercado y las mismas fricciones; se comparan sus acciones para que las diferencias de rendimiento del mercado no confundan la fidelidad de la implementación.
El benchmark inicial contiene 800 tareas con datos de BTCUSDT de 15 minutos, agrupadas según la complejidad del intervalo de estados medida por la ejecución. Los resultados comunicados muestran que el rendimiento de los modelos varía considerablemente: los modelos de menor coste tienen una concordancia de acciones y una reproducción exacta limitadas, mientras que un modelo puntero obtiene mejores resultados en un subconjunto de 200 tareas, pero aun así produce fallos silenciosos. Aunque los modelos identifican correctamente los componentes solicitados, muchas implementaciones se apartan de la especificación en las barras activas. Los autores también informan que un evaluador LLM aceptó todos esos fallos. El benchmark mide la equivalencia de comportamiento en las tareas y los datos definidos; no demuestra rentabilidad de trading ni se generaliza automáticamente a otros mercados y tipos de estrategias.
Ideas clave
- El benchmark compara acciones de trading ejecutadas, no la similitud del código fuente ni los beneficios.
- Las estrategias de referencia se componen mediante programación y se convierten en instrucciones informales para traders.
- Ambas implementaciones se ejecutan con datos de mercado y fricciones de trading idénticos para aislar las diferencias de comportamiento.
- El rendimiento se evalúa en tareas agrupadas según la complejidad del intervalo de estados basada en la ejecución.
- Reconocer correctamente la especificación de una estrategia no garantiza que el código generado la implemente fielmente.
Etiquetas
Texto completo
# 2610.03080 # MintEval: Do LLMs Implement the Trading Strategy You Asked For? A Behavioural-Equivalence Benchmark for Natural-Language-to-Strategy Code Large language models are moving from producing trading signals to writing the code that executes them. The failure mode of the second role is silent: generated code runs, a backtest plots, yet the risk logic that the trader described is not the logic being executed. Existing code benchmarks test functional correctness on unit tests and finance benchmarks test forecasting; neither measures whether an implementation behaves like the strategy that was asked for. We introduce MintEval, a benchmark in which reference strategies are generated programmatically from a library of composable building blocks, back-translated into colloquial trader instructions, and re-implemented by the model under test. Generated and reference programs are executed bar by bar on identical market data and frictions, and compared on their actions rather than on code similarity or profit: alpha is differenced away. MintEval v0 contains 800 tasks on BTCUSDT 15-minute data, stratified by an execution-measured state-span complexity tau that is decoupled from description length. Low-cost models reach a mean ActionMatch of at most 0.544 and reproduce at most 0.087 of tasks exactly; on a stratified subset of 200 tasks a frontier model (Claude Opus 5.5) reaches 0.889 and reproduces 0.575 exactly, yet still fails silently on 0.275 of tasks. Given a menu of building blocks, models identify the strategy almost perfectly, yet 79.2% of the implementations whose specification was read correctly diverge on more than 10% of active bars. The LLM judge of a recent strategy-generation benchmark, applied verbatim, accepts every one of these silent failures.
Se muestra íntegramente con atribución según la licencia de la fuente. Licencia: abstract CC0
Este resumen lo redactó el agente de investigación de Stratmill a partir del original; no es una copia de la fuente.