Chuyển đến nội dung
Tất cả tài liệu trong thư viện

Kiểm định hợp lệ tại mọi thời điểm cho các nhân tố do tác nhân LLM đề xuất

Bài viết arXiv papers · Tác giả: Bo Qu et al.

Tóm tắt

Nghiên cứu tách việc phát hiện nhân tố khỏi việc phê duyệt nhân tố. Một tác nhân có thể đề xuất ứng viên và tạo phép thăm dò chẩn đoán, trong khi một trọng tài thống kê cố định đánh giá từng đề xuất bằng các kết quả thị trường chỉ được quan sát sau khi đề xuất được gửi. Trọng tài dùng các kiểm định dựa trên cược, được thiết kế để kiểm soát phát hiện sai tại mọi thời điểm dừng, bất kể tác nhân chọn đề xuất như thế nào.

Các nhà nghiên cứu so sánh một tập lệnh, một thuật toán bandit và một mô hình ngôn ngữ với trọng tài cố định cùng ba trọng tài cố ý để lộ thông tin. Bằng chứng đến từ bối cảnh tổng hợp có cài sẵn các nhân tố thực, môi trường tạo phép thăm dò và nghiên cứu kiểm thử cuốn chiếu kéo dài mười năm trên CSI 500. Với bên đề xuất bằng tập lệnh, trọng tài cố định chấp nhận ít nhân tố dưới ngưỡng hơn nhiều; đổi bên đề xuất không xóa được khoảng cách đó. Mô hình ngôn ngữ tạo ra nhiều nhân tố hơn tập lệnh, ngang bằng với bandit và có thể tạo phép thăm dò chẩn đoán. Đánh đổi là độ trễ: các nhân tố thực cần khoảng 500 ngày giao dịch để đủ điều kiện, và danh mục được chứng nhận có tỷ lệ Sharpe thấp hơn danh mục không qua bộ lọc. Kết quả phụ thuộc vào thiết kế nghiên cứu và không xác lập rằng mọi nhân tố hay thị trường đều sẽ có hành vi tương tự.

Ý chính

  • Trọng tài cố định có thể đánh giá ứng viên dựa trên kết quả được công bố sau khi đề xuất.
  • Các kiểm định dựa trên cược nhằm duy trì kiểm soát phát hiện sai tại mọi thời điểm dừng.
  • Việc chọn trọng tài ảnh hưởng mạnh đến số lượng nhân tố yếu được chấp nhận.
  • Mô hình ngôn ngữ có thể đóng góp bằng cách đề xuất nhân tố và tạo phép thăm dò chẩn đoán.
  • Chứng nhận có thể làm chậm việc áp dụng nhân tố thực và giảm Sharpe danh mục so với lựa chọn không qua bộ lọc.

Thẻ

Toàn văn
# Propose, Don't Judge: An Anytime-Valid Referee for LLM Agents That Mine Investment Factors


# Propose, Don't Judge: An Anytime-Valid Referee for LLM Agents That Mine Investment Factors









Language-model agents now run the whole of quantitative factor research: they propose investment factors, backtest them, select the survivors and retire them. We ask which of those jobs an agent should keep. Our answer is governed self-evolution: the agent may propose, and a frozen statistical referee that the agent cannot touch must judge. The referee scores each candidate only on market outcomes revealed after submission, by betting, so its false-discovery guarantee holds at every stopping time for any proposal policy. We cross three proposers (a script, a bandit and a language model) with this referee and with three deliberately leaky ones, in a synthetic world with planted truth, a probe-authoring environment and a ten-year walk-forward on the CSI 500. Who judges sets the number of false admissions: the frozen referee admits 5-11 times fewer sub-threshold factors than the leaky referees under a scripted proposer, and no proposer closes that gap. Who proposes sets the yield: the language model beats the script, matches the bandit, and adds the one capability a bandit lacks, writing its own diagnostic probes. The certificate's price is time: an admitted true factor waits about 500 trading days, and the certified portfolio's Sharpe ratio therefore trails an ungated one. Judging belongs to the procedure; proposing and instrument-making belong to the agent.

Hiển thị toàn văn kèm ghi nguồn theo giấy phép của tài liệu gốc. Giấy phép: abstract CC0

Bản tóm tắt này do tác nhân nghiên cứu của Stratmill biên soạn từ tài liệu gốc; đây không phải bản sao của tài liệu.