Chuyển đến nội dung
Tất cả tài liệu trong thư viện

Học tăng cường sâu cho thấy phản ứng trừng phạt trong trò chơi thực thi lệnh

Bài viết arXiv papers · Tác giả: Christos Spyridon Koulouris et al.

Tóm tắt

Bài báo nghiên cứu liệu các tác nhân học tăng cường sâu độc lập trong trò chơi thực thi tối ưu có phát triển hành vi phù hợp với thông đồng hay không. Trong bối cảnh thanh lý có hai người chơi và thời hạn hữu hạn, các tác nhân dùng tối ưu hóa chính sách vùng lân cận và có quyền truy cập vào lịch sử giá cùng hành động trong mỗi lượt. Chi phí thanh lý mà họ học được thấp hơn chuẩn Nash, điều mà các tác giả mô tả là kết quả vượt mức cạnh tranh.

Để tìm hiểu nguyên nhân, các nhà nghiên cứu huấn luyện tác nhân đối đầu với một lịch trình thanh lý trung bình đã học, rồi kiểm tra hành vi lệch chuẩn bằng cách áp đặt giao dịch ban đầu của hành vi đó lên một tác nhân gốc. Đối thủ phản ứng bằng cách bán nhanh hơn; trong các lượt chạy và vai trò người chơi được báo cáo, phản ứng này triệt tiêu phần lợi ích của bên lệch chuẩn nhiều hơn mức cần thiết, trong khi mức chi trả trung bình của bên trừng phạt hầu như không thay đổi. Các tác giả cũng kiểm tra liệu hình phạt có lớn hơn lợi ích từ hành vi lệch chuẩn hay không và liệu thay đổi hành vi giao dịch có giải thích cho khoản lỗ bị áp đặt hay không; cả hai kiểm tra đều đúng với hành vi lệch chuẩn đã thử nghiệm. Những phát hiện này ủng hộ cách diễn giải có thông đồng trong trò chơi mô phỏng cụ thể này, nhưng không cho thấy các tác nhân giao dịch đã triển khai thông đồng trong thị trường thực.

Ý chính

  • Các tác nhân học tăng cường độc lập đạt chi phí thanh lý thấp hơn chuẩn Nash trong trò chơi được nghiên cứu.
  • Hành vi lệch chuẩn được thử nghiệm khiến đối thủ đẩy nhanh thanh lý như một phản ứng trừng phạt.
  • Hình phạt được báo cáo triệt tiêu lợi ích của bên lệch chuẩn nhiều hơn mức cần thiết, đồng thời giữ nguyên mức chi trả trung bình của bên trừng phạt.
  • Các tác giả kiểm tra liệu hình phạt có vượt lợi ích và liệu thay đổi hành vi có giải thích khoản lỗ hay không; cả hai kiểm tra đều đúng với hành vi lệch chuẩn được thử nghiệm.
  • Bằng chứng đến từ trò chơi mô phỏng hai người chơi và không xác lập sự thông đồng trên thị trường thực.

Thẻ

Toàn văn
# Beyond Supra-Competitive Outcomes: Collusive Behaviour in Deep Reinforcement Learning for Optimal Execution Games


# Beyond Supra-Competitive Outcomes: Collusive Behaviour in Deep Reinforcement Learning for Optimal Execution Games









In this paper, we extend earlier findings of supra-competitive outcomes in optimal-execution games by identifying a learned punitive mechanism that deters deviations and provides behavioural evidence of collusion. We investigate this mechanism in a two-player, finite-horizon Almgren-Chriss liquidation game. Independent proximal policy optimisation agents with access to within-episode price and action histories achieve costs below the Nash benchmark. We identify a profitable deviation by training against the mean learned liquidation schedule, then impose its first trade on one of the original agents. The opponent responds by accelerating liquidation. This response more than offsets the deviator's gain in every run and both player roles, while leaving the punisher's average payoff materially unchanged relative to not punishing under the same deviation. The punisher imposes greater losses on the deviator while preserving its own average payoff, despite the availability of more profitable, less punitive liquidation plans. Matching deviations and subsequent additional selling rise and later decline during training, while final policies retain an effective punitive response. We formalise two checks: whether punishment outweighs the gain from deviating, and whether the change in trading behaviour is large enough to account for the loss imposed. Both checks hold for the tested deviation. Together, these findings provide behavioural and economic evidence supporting a collusive interpretation of the learned supra-competitive outcomes.

Hiển thị toàn văn kèm ghi nguồn theo giấy phép của tài liệu gốc. Giấy phép: abstract CC0

Bản tóm tắt này do tác nhân nghiên cứu của Stratmill biên soạn từ tài liệu gốc; đây không phải bản sao của tài liệu.