Zum Inhalt springen
Alle Bibliotheksdokumente

Jederzeit gültige Tests für von LLM-Agenten vorgeschlagene Faktoren

Artikel arXiv papers · Autor: Bo Qu et al.

Zusammenfassung

Die Studie trennt die Entdeckung von Faktoren von ihrer Zulassung. Ein Agent kann Kandidaten vorschlagen und diagnostische Prüfungen erstellen, während ein unveränderlicher statistischer Prüfer jeden Vorschlag anhand von Marktergebnissen bewertet, die erst nach der Einreichung beobachtet werden. Der Prüfer verwendet Tests auf Basis von Wettstrategien, die falsche Entdeckungen zu jedem beliebigen Stoppzeitpunkt kontrollieren sollen – unabhängig davon, wie der Agent seine Vorschläge auswählt.

Die Forschenden vergleichen ein Skript, einen Banditen und ein Sprachmodell sowohl mit dem unveränderlichen Prüfer als auch mit drei bewusst durchlässigen Prüfern, die Informations-Leakage zulassen. Die Evidenz stammt aus einem synthetischen Szenario mit vorgegebenen echten Faktoren, einer Umgebung zum Verfassen von Prüfungen und einer zehnjährigen Walk-Forward-Studie für den CSI 500. Mit dem skriptbasierten Vorschlagssystem lässt der unveränderliche Prüfer deutlich weniger Faktoren unterhalb der Schwelle zu; ein Wechsel des Vorschlagssystems beseitigt diesen Abstand nicht. Das Sprachmodell liefert mehr Faktoren als das Skript, erzielt so viele Faktoren wie der Bandit und kann diagnostische Prüfungen verfassen. Der Nachteil ist die Verzögerung: Echte Faktoren benötigen etwa 500 Handelstage bis zur Zulassung, und das zertifizierte Portfolio weist eine niedrigere Sharpe-Ratio auf als ein ungefiltertes. Die Ergebnisse hängen von den Studiendesigns ab und belegen nicht, dass sich jeder Faktor oder Markt ähnlich verhält.

Kernaussagen

  • Ein unveränderlicher Prüfer kann Kandidaten anhand von Ergebnissen bewerten, die nach der Einreichung bekannt werden.
  • Tests auf Basis von Wettstrategien sollen die Kontrolle falscher Entdeckungen zu jedem beliebigen Stoppzeitpunkt gewährleisten.
  • Die Wahl des Prüfers beeinflusst stark, wie viele schwache Faktoren zugelassen werden.
  • Sprachmodelle können Faktoren vorschlagen und diagnostische Prüfungen verfassen.
  • Die Zertifizierung kann die Einführung echter Faktoren verzögern und die Portfolio-Sharpe-Ratio gegenüber einer ungefilterten Auswahl senken.

Schlagwörter

Volltext
# Propose, Don't Judge: An Anytime-Valid Referee for LLM Agents That Mine Investment Factors


# Propose, Don't Judge: An Anytime-Valid Referee for LLM Agents That Mine Investment Factors









Language-model agents now run the whole of quantitative factor research: they propose investment factors, backtest them, select the survivors and retire them. We ask which of those jobs an agent should keep. Our answer is governed self-evolution: the agent may propose, and a frozen statistical referee that the agent cannot touch must judge. The referee scores each candidate only on market outcomes revealed after submission, by betting, so its false-discovery guarantee holds at every stopping time for any proposal policy. We cross three proposers (a script, a bandit and a language model) with this referee and with three deliberately leaky ones, in a synthetic world with planted truth, a probe-authoring environment and a ten-year walk-forward on the CSI 500. Who judges sets the number of false admissions: the frozen referee admits 5-11 times fewer sub-threshold factors than the leaky referees under a scripted proposer, and no proposer closes that gap. Who proposes sets the yield: the language model beats the script, matches the bandit, and adds the one capability a bandit lacks, writing its own diagnostic probes. The certificate's price is time: an admitted true factor waits about 500 trading days, and the certified portfolio's Sharpe ratio therefore trails an ungated one. Judging belongs to the procedure; proposing and instrument-making belong to the agent.

Vollständig mit Quellenangabe unter der Lizenz der Quelle angezeigt. Lizenz: abstract CC0

Diese Zusammenfassung wurde vom Research-Agenten von Stratmill anhand des Originals verfasst; sie ist keine Kopie der Quelle.