Chuyển đến nội dung
Tất cả tài liệu trong thư viện

MintEval: Kiểm tra liệu mã giao dịch LLM có khớp đặc tả

Bài viết arXiv papers · Tác giả: Siyu Wang et al.

Tóm tắt

MintEval đánh giá liệu mô hình ngôn ngữ có chuyển chỉ dẫn của nhà giao dịch thành mã hoạt động đúng như chiến lược dự định hay không. Công cụ tạo chiến lược tham chiếu từ các thành phần có thể kết hợp, chuyển chúng thành chỉ dẫn ngôn ngữ đời thường rồi yêu cầu mô hình triển khai. Các chương trình được tạo và chương trình tham chiếu được chạy từng thanh trên cùng dữ liệu thị trường và với cùng ma sát giao dịch; hành động của chúng được so sánh để chênh lệch hiệu quả thị trường không làm nhiễu độ trung thực của triển khai.

Bộ chuẩn ban đầu gồm 800 tác vụ dùng dữ liệu BTCUSDT theo khung thời gian 15 phút, được nhóm theo độ phức tạp của khoảng trạng thái đo bằng thực thi. Kết quả được báo cáo cho thấy hiệu năng mô hình thay đổi đáng kể: các mô hình chi phí thấp có mức độ đồng thuận hành động và tái tạo chính xác hạn chế, trong khi mô hình tiên tiến hơn hoạt động tốt hơn trên tập con 200 tác vụ nhưng vẫn tạo ra lỗi âm thầm. Ngay cả khi mô hình xác định đúng các thành phần được yêu cầu, nhiều bản triển khai vẫn lệch khỏi đặc tả ở các thanh có giao dịch. Các tác giả cũng cho biết một bộ đánh giá LLM đã chấp nhận tất cả lỗi như vậy. Bộ chuẩn đo mức tương đương hành vi trên các tác vụ và dữ liệu đã xác định; nó không chứng minh khả năng sinh lời của giao dịch hay tự động khái quát sang thị trường và loại chiến lược khác.

Ý chính

  • Bộ chuẩn so sánh hành động giao dịch được thực thi, thay vì độ giống nhau của mã nguồn hay lợi nhuận.
  • Chiến lược tham chiếu được kết hợp bằng chương trình rồi chuyển thành chỉ dẫn không chính thức cho nhà giao dịch.
  • Cả hai bản triển khai chạy trên dữ liệu thị trường và ma sát giao dịch giống nhau để cô lập khác biệt hành vi.
  • Hiệu năng được đánh giá trên các tác vụ được nhóm theo độ phức tạp khoảng trạng thái dựa trên thực thi.
  • Nhận diện đúng đặc tả chiến lược không đảm bảo mã được tạo triển khai chiến lược trung thực.

Thẻ

Toàn văn
# 2610.03080


# MintEval: Do LLMs Implement the Trading Strategy You Asked For? A Behavioural-Equivalence Benchmark for Natural-Language-to-Strategy Code









Large language models are moving from producing trading signals to writing the code that executes them. The failure mode of the second role is silent: generated code runs, a backtest plots, yet the risk logic that the trader described is not the logic being executed. Existing code benchmarks test functional correctness on unit tests and finance benchmarks test forecasting; neither measures whether an implementation behaves like the strategy that was asked for. We introduce MintEval, a benchmark in which reference strategies are generated programmatically from a library of composable building blocks, back-translated into colloquial trader instructions, and re-implemented by the model under test. Generated and reference programs are executed bar by bar on identical market data and frictions, and compared on their actions rather than on code similarity or profit: alpha is differenced away. MintEval v0 contains 800 tasks on BTCUSDT 15-minute data, stratified by an execution-measured state-span complexity tau that is decoupled from description length. Low-cost models reach a mean ActionMatch of at most 0.544 and reproduce at most 0.087 of tasks exactly; on a stratified subset of 200 tasks a frontier model (Claude Opus 5.5) reaches 0.889 and reproduces 0.575 exactly, yet still fails silently on 0.275 of tasks. Given a menu of building blocks, models identify the strategy almost perfectly, yet 79.2% of the implementations whose specification was read correctly diverge on more than 10% of active bars. The LLM judge of a recent strategy-generation benchmark, applied verbatim, accepts every one of these silent failures.

Hiển thị toàn văn kèm ghi nguồn theo giấy phép của tài liệu gốc. Giấy phép: abstract CC0

Bản tóm tắt này do tác nhân nghiên cứu của Stratmill biên soạn từ tài liệu gốc; đây không phải bản sao của tài liệu.