Chuyển đến nội dung
Tất cả tài liệu trong thư viện

MARKET-BENCH: Kiểm thử lịch sử giao dịch định lượng với LLM

Bài viết arXiv papers · Tác giả: Abhay Srivastava et al.

Tóm tắt

MARKET-BENCH đánh giá liệu mô hình ngôn ngữ lớn có thể chuyển mô tả chiến lược bằng ngôn ngữ tự nhiên và giả định thị trường thành công cụ kiểm thử lịch sử có thể thực thi hay không. Các nhiệm vụ bao gồm giao dịch theo lịch với Microsoft, giao dịch cặp Coca-Cola và Pepsi, cùng phòng hộ delta với Microsoft. Bộ chuẩn so sánh các đường lợi nhuận và thua lỗ, drawdown và vị thế được tạo ra với một triển khai tham chiếu, đồng thời đo cả việc kiểm thử lịch sử của mô hình có chạy được hay không lẫn mức độ khớp của kết quả.

Đánh giá nhiều vòng trên mười ba mô hình cho thấy phần lớn có thể thực thi đáng tin cậy chiến lược đơn giản nhất, trong khi sai lệch định lượng khác biệt đáng kể giữa các mô hình và nhiệm vụ. Bài báo báo cáo kết quả tốt ở một số mô hình, bao gồm khả năng thực thi hoàn hảo của GPT-5.2, đồng thời cũng nêu các trường hợp đầu ra chạy được nhưng vẫn tạo ra đường đi không chính xác. Các phát hiện cho thấy thực thi thành công tự nó không bảo đảm logic giao dịch chính xác. Kết quả chỉ giới hạn ở các nhiệm vụ mở đầu và giả định của bộ chuẩn, nên không chứng minh được hiệu quả với chiến lược phức tạp hơn hoặc thị trường thực.

Ý chính

  • Bộ chuẩn kiểm tra khả năng tạo mã cho giao dịch theo lịch, giao dịch cặp và phòng hộ delta.
  • Bộ chuẩn đo riêng việc kiểm thử lịch sử có chạy được hay không và đầu ra khớp với kết quả tham chiếu đến mức nào.
  • Mười ba mô hình được đánh giá qua nhiều vòng.
  • Kiểm thử lịch sử chạy được vẫn có thể tạo đường lợi nhuận và thua lỗ hoặc đường vị thế không chính xác.
  • Kết quả bao quát các nhiệm vụ mở đầu của bộ chuẩn và không chứng minh năng lực giao dịch thực.

Thẻ

Toàn văn
# Market-Bench: Evaluating Large Language Models on Introductory Quantitative Trading and Market Dynamics


# Market-Bench: Evaluating Large Language Models on Introductory Quantitative Trading and Market Dynamics









We introduce MARKET-BENCH, a benchmark that evaluates large language models (LLMs) on introductory quantitative trading tasks by asking them to construct executable backtesters from natural language strategy descriptions and market assumptions. Each instance specifies one of three canonical strategies: scheduled trading on Microsoft (NASDAQ: MSFT), pairs trading on Coca-Cola (NASDAQ: KO) and Pepsi (NASDAQ: PEP), or delta hedging on MSFT. Models must produce code whose profit and loss (P and L), drawdown, and position paths match a verifiable reference implementation. We assess thirteen state-of-the-art models using a multi-round evaluation that separates structural reliability (whether the backtest runs) from numerical accuracy (mean absolute error of the backtest metrics), assigning failed outputs a duplicated-metrics baseline MAE. While most models reliably execute the simplest strategy (average executable passes of 4.08 out of 5 rounds), errors vary by orders of magnitude across models and tasks. Gemini 3 Pro and Claude 4.5 Sonnet combine strong reliability with low error on simpler strategies. GPT-5.2 achieves strong overall performance with perfect executability. GPT-5.1 Codex-Max achieves the lowest best-run error on the easiest task. Qwen3 Max attains perfect executability yet sometimes produces inaccurate profit and loss paths. These results show that current LLMs can scaffold basic trading infrastructure but still struggle to reason robustly about prices, inventory, and risk. We release MARKET-BENCH and a public leaderboard at https://marketbench.ai.

Hiển thị toàn văn kèm ghi nguồn theo giấy phép của tài liệu gốc. Giấy phép: abstract CC0

Bản tóm tắt này do tác nhân nghiên cứu của Stratmill biên soạn từ tài liệu gốc; đây không phải bản sao của tài liệu.