Passer au contenu
Tous les documents de la bibliothèque

Tests valides à tout instant pour les facteurs proposés par des agents LLM

Article arXiv papers · Auteur: Bo Qu et al.

Résumé

L’étude sépare la découverte des facteurs de leur approbation. Un agent peut proposer des candidats et créer des sondes diagnostiques, tandis qu’un arbitre statistique figé évalue chaque proposition à partir des résultats de marché observés uniquement après sa soumission. L’arbitre utilise des tests fondés sur les mises, conçus pour contrôler les fausses découvertes quel que soit le moment où le test est arrêté, indépendamment de la manière dont l’agent choisit ses propositions.

Les chercheurs comparent un script, un bandit et un modèle de langage avec l’arbitre figé et trois arbitres délibérément sujets aux fuites. Les éléments probants proviennent d’un cadre synthétique avec des facteurs réels intégrés, d’un environnement de création de sondes et d’une étude walk-forward de dix ans sur CSI 500. Avec le proposant programmé, l’arbitre figé admet beaucoup moins de facteurs qui n’atteignent pas le seuil, et changer de proposant ne réduit pas cet écart. Le modèle de langage produit plus de facteurs que le script, égale le bandit et peut créer des sondes diagnostiques. Le compromis est le délai : il faut environ 500 jours de trading pour qu’un facteur réel soit qualifié, et le portefeuille certifié a un ratio de Sharpe inférieur à celui d’un portefeuille sans filtre. Les résultats dépendent des plans d’étude et n’établissent pas que tous les facteurs ou marchés se comporteront de la même façon.

Idées clés

  • Un arbitre figé peut évaluer les candidats à partir des résultats observés après leur soumission.
  • Les tests fondés sur les mises visent à préserver le contrôle des fausses découvertes, quel que soit le moment où le test est arrêté.
  • Le choix de l’arbitre influe fortement sur le nombre de facteurs faibles admis.
  • Les modèles de langage peuvent contribuer en proposant des facteurs et en créant des sondes diagnostiques.
  • La certification peut retarder l’adoption de facteurs réels et réduire le ratio de Sharpe du portefeuille par rapport à une sélection sans filtre.

Étiquettes

Texte intégral
# Propose, Don't Judge: An Anytime-Valid Referee for LLM Agents That Mine Investment Factors


# Propose, Don't Judge: An Anytime-Valid Referee for LLM Agents That Mine Investment Factors









Language-model agents now run the whole of quantitative factor research: they propose investment factors, backtest them, select the survivors and retire them. We ask which of those jobs an agent should keep. Our answer is governed self-evolution: the agent may propose, and a frozen statistical referee that the agent cannot touch must judge. The referee scores each candidate only on market outcomes revealed after submission, by betting, so its false-discovery guarantee holds at every stopping time for any proposal policy. We cross three proposers (a script, a bandit and a language model) with this referee and with three deliberately leaky ones, in a synthetic world with planted truth, a probe-authoring environment and a ten-year walk-forward on the CSI 500. Who judges sets the number of false admissions: the frozen referee admits 5-11 times fewer sub-threshold factors than the leaky referees under a scripted proposer, and no proposer closes that gap. Who proposes sets the yield: the language model beats the script, matches the bandit, and adds the one capability a bandit lacks, writing its own diagnostic probes. The certificate's price is time: an admitted true factor waits about 500 trading days, and the certified portfolio's Sharpe ratio therefore trails an ungated one. Judging belongs to the procedure; proposing and instrument-making belong to the agent.

Reproduit dans son intégralité avec attribution, conformément à la licence de la source. Licence: abstract CC0

Ce résumé a été rédigé par l’agent de recherche de Stratmill à partir de la source originale ; il n’en est pas une copie.