Testes válidos a qualquer momento para fatores propostos por agentes LLM
Resumo
O estudo separa a descoberta de fatores de sua aprovação. Um agente pode propor candidatos e criar sondagens diagnósticas, enquanto um árbitro estatístico com regras fixas avalia cada proposta usando resultados de mercado observados somente após o envio. O árbitro usa testes baseados em apostas, projetados para controlar falsas descobertas em qualquer momento de parada, independentemente de como o agente escolhe suas propostas.
Os pesquisadores comparam um script, um bandido e um modelo de linguagem com o árbitro congelado e com três árbitros deliberadamente permissivos. As evidências vêm de um cenário sintético com fatores verdadeiros inseridos, um ambiente para criar sondagens e um estudo walk-forward de dez anos no CSI 500. Com o proponente baseado em script, o árbitro congelado aprova muito menos fatores abaixo do limiar, e trocar o proponente não elimina essa diferença. O modelo de linguagem produz mais fatores que o script, iguala o bandido e consegue criar sondagens diagnósticas. A contrapartida é a demora: fatores verdadeiros levam cerca de 500 dias de negociação para se qualificarem, e a carteira certificada tem índice de Sharpe menor que uma carteira sem esse filtro. Os resultados dependem dos desenhos dos estudos e não demonstram que todos os fatores ou mercados se comportarão da mesma forma.
Ideias principais
- Um árbitro estatístico com regras fixas pode avaliar candidatos com base em resultados revelados após o envio.
- Testes baseados em apostas buscam manter o controle de falsas descobertas em qualquer momento de parada.
- A escolha do árbitro afeta fortemente quantos fatores fracos são aprovados.
- Modelos de linguagem podem contribuir propondo fatores e criando sondagens diagnósticas.
- A certificação pode atrasar a adoção de fatores verdadeiros e reduzir o índice de Sharpe da carteira em relação à seleção sem filtro.
Tags
Texto completo
# Propose, Don't Judge: An Anytime-Valid Referee for LLM Agents That Mine Investment Factors # Propose, Don't Judge: An Anytime-Valid Referee for LLM Agents That Mine Investment Factors Language-model agents now run the whole of quantitative factor research: they propose investment factors, backtest them, select the survivors and retire them. We ask which of those jobs an agent should keep. Our answer is governed self-evolution: the agent may propose, and a frozen statistical referee that the agent cannot touch must judge. The referee scores each candidate only on market outcomes revealed after submission, by betting, so its false-discovery guarantee holds at every stopping time for any proposal policy. We cross three proposers (a script, a bandit and a language model) with this referee and with three deliberately leaky ones, in a synthetic world with planted truth, a probe-authoring environment and a ten-year walk-forward on the CSI 500. Who judges sets the number of false admissions: the frozen referee admits 5-11 times fewer sub-threshold factors than the leaky referees under a scripted proposer, and no proposer closes that gap. Who proposes sets the yield: the language model beats the script, matches the bandit, and adds the one capability a bandit lacks, writing its own diagnostic probes. The certificate's price is time: an admitted true factor waits about 500 trading days, and the certified portfolio's Sharpe ratio therefore trails an ungated one. Judging belongs to the procedure; proposing and instrument-making belong to the agent.
Exibido na íntegra, com atribuição conforme a licença da fonte. Licença: abstract CC0
Este resumo foi escrito pelo agente de pesquisa da Stratmill com base no original; não é uma cópia da fonte.