Перейти к содержимому
Все документы библиотеки

MintEval: проверка соответствия торгового кода LLM спецификации

Статья arXiv papers · Автор: Siyu Wang et al.

Сводка

MintEval оценивает, переводят ли языковые модели инструкции трейдера в код, который действует согласно задуманной стратегии. Эталонные стратегии собираются из комбинируемых компонентов, затем формулируются разговорным языком и передаются моделям для реализации. Сгенерированные и эталонные программы запускаются бар за баром на одних и тех же рыночных данных с одинаковыми издержками и ограничениями; сравниваются их действия, поэтому различия в результатах рынка не искажают оценку точности реализации.

Первоначальный бенчмарк включает 800 задач на данных BTCUSDT с интервалом 15 минут; задачи сгруппированы по сложности диапазона состояний, измеренной по исполнению. Согласно результатам, качество моделей существенно различается: более дешёвые модели редко совпадают по действиям и точно воспроизводят стратегии, а передовая модель показывает лучшие результаты на подмножестве из 200 задач, но всё ещё допускает незаметные сбои. Даже когда модели правильно распознают запрошенные элементы, многие реализации расходятся со спецификацией на активных барах. Авторы также сообщают, что судья LLM принял все такие ошибочные реализации. Бенчмарк измеряет поведенческую эквивалентность в рамках заданных задач и данных; он не доказывает прибыльность торговли и автоматически не распространяется на другие рынки и типы стратегий.

Ключевые идеи

  • Бенчмарк сравнивает исполненные торговые действия, а не сходство исходного кода или прибыль.
  • Эталонные стратегии программно собираются из компонентов и переводятся в неформальные инструкции для трейдера.
  • Обе реализации запускаются на одинаковых рыночных данных с одинаковыми торговыми издержками, чтобы выделить поведенческие различия.
  • Результаты оцениваются по задачам, сгруппированным по сложности диапазона состояний, измеренной на основе исполнения.
  • Правильное распознавание спецификации стратегии не гарантирует, что сгенерированный код реализует её точно.

Теги

Полный текст
# 2610.03080


# MintEval: Do LLMs Implement the Trading Strategy You Asked For? A Behavioural-Equivalence Benchmark for Natural-Language-to-Strategy Code









Large language models are moving from producing trading signals to writing the code that executes them. The failure mode of the second role is silent: generated code runs, a backtest plots, yet the risk logic that the trader described is not the logic being executed. Existing code benchmarks test functional correctness on unit tests and finance benchmarks test forecasting; neither measures whether an implementation behaves like the strategy that was asked for. We introduce MintEval, a benchmark in which reference strategies are generated programmatically from a library of composable building blocks, back-translated into colloquial trader instructions, and re-implemented by the model under test. Generated and reference programs are executed bar by bar on identical market data and frictions, and compared on their actions rather than on code similarity or profit: alpha is differenced away. MintEval v0 contains 800 tasks on BTCUSDT 15-minute data, stratified by an execution-measured state-span complexity tau that is decoupled from description length. Low-cost models reach a mean ActionMatch of at most 0.544 and reproduce at most 0.087 of tasks exactly; on a stratified subset of 200 tasks a frontier model (Claude Opus 5.5) reaches 0.889 and reproduces 0.575 exactly, yet still fails silently on 0.275 of tasks. Given a menu of building blocks, models identify the strategy almost perfectly, yet 79.2% of the implementations whose specification was read correctly diverge on more than 10% of active bars. The LLM judge of a recent strategy-generation benchmark, applied verbatim, accepts every one of these silent failures.

Полный текст с указанием источника опубликован на условиях его лицензии. Лицензия: abstract CC0

Это краткое изложение подготовлено исследовательским агентом Stratmill по оригиналу и не является его копией.