Saltar al contenido
Todos los documentos de la biblioteca

Pruebas válidas en cualquier momento para factores propuestos por agentes LLM

Artículo arXiv papers · Autor: Bo Qu et al.

Resumen

El estudio separa el descubrimiento de factores de su aprobación. Un agente puede proponer candidatos y crear pruebas de diagnóstico, mientras un evaluador estadístico congelado examina cada propuesta utilizando resultados del mercado observados únicamente después de su presentación. El evaluador utiliza pruebas basadas en apuestas, diseñadas para controlar los falsos descubrimientos en cualquier momento de parada, independientemente de cómo el agente elija sus propuestas.

Los investigadores comparan un script, un algoritmo bandido y un modelo de lenguaje con el evaluador congelado y con tres evaluadores que permiten deliberadamente filtraciones de datos. La evidencia procede de un entorno sintético con factores verdaderos incorporados, un entorno para crear pruebas y un estudio walk-forward de diez años sobre el CSI 500. Con el proponente programado, el evaluador congelado acepta muchos menos factores por debajo del umbral, y cambiar el proponente no elimina esa diferencia. El modelo de lenguaje produce más factores que el script, iguala al algoritmo bandido y puede crear pruebas de diagnóstico. La contrapartida es el retraso: los factores verdaderos tardan unos 500 días de negociación en cumplir los requisitos, y la cartera certificada tiene un ratio de Sharpe inferior al de una cartera sin filtros. Los resultados dependen de los diseños del estudio y no establecen que todos los factores o mercados se comporten igual.

Ideas clave

  • Un evaluador congelado puede valorar candidatos utilizando resultados revelados después de su presentación.
  • Las pruebas basadas en apuestas buscan mantener el control de falsos descubrimientos en cualquier momento de parada.
  • La elección del evaluador influye mucho en cuántos factores débiles se aceptan.
  • Los modelos de lenguaje pueden contribuir proponiendo factores y creando pruebas de diagnóstico.
  • La certificación puede retrasar la adopción de factores verdaderos y reducir el Sharpe de la cartera frente a una selección sin filtros.

Etiquetas

Texto completo
# Propose, Don't Judge: An Anytime-Valid Referee for LLM Agents That Mine Investment Factors


# Propose, Don't Judge: An Anytime-Valid Referee for LLM Agents That Mine Investment Factors









Language-model agents now run the whole of quantitative factor research: they propose investment factors, backtest them, select the survivors and retire them. We ask which of those jobs an agent should keep. Our answer is governed self-evolution: the agent may propose, and a frozen statistical referee that the agent cannot touch must judge. The referee scores each candidate only on market outcomes revealed after submission, by betting, so its false-discovery guarantee holds at every stopping time for any proposal policy. We cross three proposers (a script, a bandit and a language model) with this referee and with three deliberately leaky ones, in a synthetic world with planted truth, a probe-authoring environment and a ten-year walk-forward on the CSI 500. Who judges sets the number of false admissions: the frozen referee admits 5-11 times fewer sub-threshold factors than the leaky referees under a scripted proposer, and no proposer closes that gap. Who proposes sets the yield: the language model beats the script, matches the bandit, and adds the one capability a bandit lacks, writing its own diagnostic probes. The certificate's price is time: an admitted true factor waits about 500 trading days, and the certified portfolio's Sharpe ratio therefore trails an ungated one. Judging belongs to the procedure; proposing and instrument-making belong to the agent.

Se muestra íntegramente con atribución según la licencia de la fuente. Licencia: abstract CC0

Este resumen lo redactó el agente de investigación de Stratmill a partir del original; no es una copia de la fuente.