MintEval: testando se o código de trading de LLM corresponde à especificação
Resumo
MintEval avalia se modelos de linguagem traduzem instruções de traders em código que se comporta como a estratégia pretendida. Ele cria estratégias de referência com componentes combináveis, transforma-as em instruções coloquiais e pede aos modelos que as implementem. Os programas gerados e os de referência são executados barra a barra com os mesmos dados de mercado e as mesmas fricções; suas ações são comparadas para que diferenças de desempenho no mercado não confundam a fidelidade da implementação.
O benchmark inicial contém 800 tarefas com dados de BTCUSDT em intervalos de 15 minutos, agrupadas pela complexidade do intervalo de estados medida pela execução. Os resultados relatados mostram grande variação no desempenho dos modelos: modelos de menor custo têm concordância limitada nas ações e reprodução exata limitada, enquanto um modelo de fronteira tem desempenho melhor em um subconjunto de 200 tarefas, mas ainda produz falhas silenciosas. Mesmo quando identificam corretamente os componentes solicitados, muitas implementações divergem da especificação nas barras ativas. Os autores também relatam que um avaliador LLM aceitou todas essas falhas. O benchmark mede equivalência comportamental nas tarefas e nos dados definidos; não estabelece lucratividade de trading nem se generaliza automaticamente a outros mercados e tipos de estratégia.
Ideias principais
- O benchmark compara ações de trading executadas, e não similaridade do código-fonte ou lucro.
- Estratégias de referência são compostas programaticamente e traduzidas em instruções informais para traders.
- As duas implementações usam dados de mercado e fricções de trading idênticos para isolar diferenças comportamentais.
- O desempenho é avaliado em tarefas agrupadas pela complexidade do intervalo de estados baseada na execução.
- Identificar corretamente uma especificação de estratégia não garante que o código gerado a implemente com fidelidade.
Tags
Texto completo
# 2610.03080 # MintEval: Do LLMs Implement the Trading Strategy You Asked For? A Behavioural-Equivalence Benchmark for Natural-Language-to-Strategy Code Large language models are moving from producing trading signals to writing the code that executes them. The failure mode of the second role is silent: generated code runs, a backtest plots, yet the risk logic that the trader described is not the logic being executed. Existing code benchmarks test functional correctness on unit tests and finance benchmarks test forecasting; neither measures whether an implementation behaves like the strategy that was asked for. We introduce MintEval, a benchmark in which reference strategies are generated programmatically from a library of composable building blocks, back-translated into colloquial trader instructions, and re-implemented by the model under test. Generated and reference programs are executed bar by bar on identical market data and frictions, and compared on their actions rather than on code similarity or profit: alpha is differenced away. MintEval v0 contains 800 tasks on BTCUSDT 15-minute data, stratified by an execution-measured state-span complexity tau that is decoupled from description length. Low-cost models reach a mean ActionMatch of at most 0.544 and reproduce at most 0.087 of tasks exactly; on a stratified subset of 200 tasks a frontier model (Claude Opus 5.5) reaches 0.889 and reproduces 0.575 exactly, yet still fails silently on 0.275 of tasks. Given a menu of building blocks, models identify the strategy almost perfectly, yet 79.2% of the implementations whose specification was read correctly diverge on more than 10% of active bars. The LLM judge of a recent strategy-generation benchmark, applied verbatim, accepts every one of these silent failures.
Exibido na íntegra, com atribuição conforme a licença da fonte. Licença: abstract CC0
Este resumo foi escrito pelo agente de pesquisa da Stratmill com base no original; não é uma cópia da fonte.