Đánh giá chuẩn các tác nhân giao dịch LLM trên thị trường tiền mã hóa và cổ phiếu thực
Tóm tắt
Bài viết giới thiệu Agent Market Arena, một chuẩn đánh giá liên tục theo thời gian thực để đánh giá tác nhân giao dịch dùng mô hình ngôn ngữ lớn trên thị trường tiền mã hóa và cổ phiếu. Khuôn khổ kết hợp dữ liệu giao dịch đã xác minh với tin tức được chuyên gia kiểm tra và nhiều thiết kế tác nhân, nhằm so sánh các hệ thống trong điều kiện thực. Động lực của nghiên cứu là các đánh giá trước đây thường dùng ít tài sản hoặc giai đoạn, kiểm tra mô hình thay vì tác nhân hoàn chỉnh, hoặc dựa vào dữ liệu chưa được xác minh độc lập.
Chuẩn đánh giá gồm các tác nhân có phong cách rủi ro khác nhau, trong đó có một tác nhân dùng suy luận dựa trên bộ nhớ, và đánh giá chúng bằng một số mô hình ngôn ngữ nền. Các thử nghiệm thực được báo cáo cho thấy hành vi khác biệt giữa các khuôn khổ tác nhân, từ quyết định quyết liệt đến thận trọng, nhiều hơn khác biệt giữa các mô hình nền. Phần tóm tắt trình bày AMA như hạ tầng cho đánh giá liên tục và có thể tái lập; tài liệu không nêu số liệu hiệu suất, thời lượng chuẩn đánh giá hay biện pháp kiểm soát chi tiết để so sánh chiến lược. Kết luận nói về khác biệt hành vi được quan sát, không xác lập rằng bất kỳ tác nhân nào có thể sinh lời ổn định.
Ý chính
- Agent Market Arena là chuẩn đánh giá thời gian thực cho tác nhân giao dịch LLM trên thị trường tiền mã hóa và cổ phiếu.
- Khuôn khổ kết hợp dữ liệu giao dịch đã xác minh, tin tức đã kiểm tra và kiến trúc tác nhân đa dạng.
- Đánh giá bao gồm các tác nhân có phong cách rủi ro khác nhau và suy luận dựa trên bộ nhớ.
- Thử nghiệm thực ghi nhận khác biệt hành vi giữa các khuôn khổ tác nhân lớn hơn giữa các mô hình nền.
- Phần tóm tắt mô tả đóng góp về đánh giá chuẩn nhưng không có số liệu sinh lời hay biện pháp kiểm soát đánh giá chi tiết.
Thẻ
Toàn văn
# When Agents Trade: Live Multi-Market Trading Benchmark for LLM Agents # When Agents Trade: Live Multi-Market Trading Benchmark for LLM Agents Although Large Language Model (LLM)-based agents are increasingly used in financial trading, it remains unclear whether they can reason and adapt in live markets, as most studies test models instead of agents, cover limited periods and assets, and rely on unverified data. To address these gaps, we introduce Agent Market Arena (AMA), the first lifelong, real-time benchmark for evaluating LLM-based trading agents across multiple markets. AMA integrates verified trading data, expert-checked news, and diverse agent architectures within a unified trading framework, enabling fair and continuous comparison under real conditions. It implements four agents, including InvestorAgent as a single-agent baseline, TradeAgent and HedgeFundAgent with different risk styles, and DeepFundAgent with memory-based reasoning, and evaluates them across GPT-4o, GPT-4.1, Claude-3.5-haiku, Claude-sonnet-4, and Gemini-2.0-flash. Live experiments on both cryptocurrency and stock markets demonstrate that agent frameworks display markedly distinct behavioral patterns, spanning from aggressive risk-taking to conservative decision-making, whereas model backbones contribute less to outcome variation. AMA thus establishes a foundation for rigorous, reproducible, and continuously evolving evaluation of financial reasoning and trading intelligence in LLM-based agents.
Hiển thị toàn văn kèm ghi nguồn theo giấy phép của tài liệu gốc. Giấy phép: abstract CC0
Bản tóm tắt này do tác nhân nghiên cứu của Stratmill biên soạn từ tài liệu gốc; đây không phải bản sao của tài liệu.