Перейти к содержимому
Все документы библиотеки

MARKET-BENCH: тестирование LLM на бэктестах количественных стратегий

Статья arXiv papers · Автор: Abhay Srivastava et al.

Сводка

MARKET-BENCH оценивает, могут ли большие языковые модели преобразовывать описания стратегий и рыночные предположения на естественном языке в исполняемый код бэктестов. Задания включают торговлю по расписанию акциями Microsoft, парную торговлю акциями Coca-Cola и Pepsi, а также дельта-хеджирование акций Microsoft. Бенчмарк сравнивает с эталонной реализацией рассчитанные прибыль и убыток, просадку и траектории позиций, проверяя, запускается ли бэктест модели и насколько близки его результаты к эталону.

Многоэтапная оценка тринадцати моделей показывает, что большинство из них надёжно выполняют простейшую стратегию, а численные ошибки существенно различаются в зависимости от модели и задания. В статье сообщается о хороших результатах нескольких моделей; все результаты GPT-5.2 успешно запускались. При этом встречаются случаи, когда запускаемый результат всё равно даёт неточные траектории. Результаты показывают, что успешного запуска недостаточно для подтверждения корректной торговой логики. Выводы ограничены начальными заданиями и предположениями бенчмарка, поэтому не доказывают работоспособность более сложных стратегий или торговли на реальных рынках.

Ключевые идеи

  • Бенчмарк проверяет генерацию кода для торговли по расписанию, парной торговли и дельта-хеджирования.
  • Отдельно оцениваются запуск бэктестов и степень совпадения их результатов с эталоном.
  • Тринадцать моделей оцениваются в нескольких раундах.
  • Запускаемые бэктесты всё равно могут содержать неточные траектории прибыли, убытка или позиций.
  • Результаты охватывают начальные задания бенчмарка и не доказывают способность торговать на реальном рынке.

Теги

Полный текст
# Market-Bench: Evaluating Large Language Models on Introductory Quantitative Trading and Market Dynamics


# Market-Bench: Evaluating Large Language Models on Introductory Quantitative Trading and Market Dynamics









We introduce MARKET-BENCH, a benchmark that evaluates large language models (LLMs) on introductory quantitative trading tasks by asking them to construct executable backtesters from natural language strategy descriptions and market assumptions. Each instance specifies one of three canonical strategies: scheduled trading on Microsoft (NASDAQ: MSFT), pairs trading on Coca-Cola (NASDAQ: KO) and Pepsi (NASDAQ: PEP), or delta hedging on MSFT. Models must produce code whose profit and loss (P and L), drawdown, and position paths match a verifiable reference implementation. We assess thirteen state-of-the-art models using a multi-round evaluation that separates structural reliability (whether the backtest runs) from numerical accuracy (mean absolute error of the backtest metrics), assigning failed outputs a duplicated-metrics baseline MAE. While most models reliably execute the simplest strategy (average executable passes of 4.08 out of 5 rounds), errors vary by orders of magnitude across models and tasks. Gemini 3 Pro and Claude 4.5 Sonnet combine strong reliability with low error on simpler strategies. GPT-5.2 achieves strong overall performance with perfect executability. GPT-5.1 Codex-Max achieves the lowest best-run error on the easiest task. Qwen3 Max attains perfect executability yet sometimes produces inaccurate profit and loss paths. These results show that current LLMs can scaffold basic trading infrastructure but still struggle to reason robustly about prices, inventory, and risk. We release MARKET-BENCH and a public leaderboard at https://marketbench.ai.

Полный текст с указанием источника опубликован на условиях его лицензии. Лицензия: abstract CC0

Это краткое изложение подготовлено исследовательским агентом Stratmill по оригиналу и не является его копией.