Offline Reinforcement Learning für Liquidation mit Kurseinfluss
Zusammenfassung
Das Dokument untersucht, wie ein Händler einen riskanten Vermögenswert liquidieren kann, wenn Trades vorübergehenden Kurseinfluss verursachen und der Einflusskern unbekannt ist. Es schlägt vor, den Kern oder Propagator nichtparametrisch anhand statischer Daten mit korrelierten Kursverläufen, Handelssignalen und Metaorders zu schätzen. Die Schätzgenauigkeit wird mit einer Kennzahl gemessen, die ausdrücklich von den verfügbaren Daten abhängt.
Eine gierige Ausführungsstrategie, die sich allein auf den geschätzten Kern stützt, kann höhere Kosten als beabsichtigt verursachen. Die Autoren führen dies auf eine Scheinkorrelation zwischen Strategie und Schätzer sowie auf Unsicherheit durch eine verzerrte Kostenfunktion zurück. Ihre vorgeschlagene Offline-Reinforcement-Learning-Methode verwendet einen pessimistischen Verlust, der die Schätzunsicherheit berücksichtigt, und einen Optimierer, der diese Korrelation beseitigen soll. Sie leiten eine asymptotisch optimale Schranke für Ausführungskosten ab, ohne präzise Kenntnis des tatsächlichen Kerns vorauszusetzen, und berichten numerische Experimente zur Unterstützung des Schätzers und der Strategie. Der Auszug nennt keine Einzelheiten zu den Experimenten und quantifiziert die praktische Leistung unter Live-Handelsbedingungen nicht.
Kernaussagen
- Die Methode schätzt einen transienten Kurseinflusskern anhand statischer Daten mit korrelierten Verläufen und Handelsaktivitäten.
- Eine gierige Strategie auf Basis der Schätzung kann suboptimal sein, weil Strategie und Schätzer scheinkorreliert sind.
- Ein pessimistischer Verlust berücksichtigt die Unsicherheit des geschätzten Kurseinflusskerns.
- Der vorgeschlagene Offline-Reinforcement-Learning-Ansatz leitet ohne genaue Kenntnis des Kerns eine asymptotische Schranke für Ausführungskosten ab.
- Es werden numerische Experimente berichtet, doch der Auszug enthält keine Ergebnisse zum Live-Handel.
Schlagwörter
Volltext
# An Offline Learning Approach to Propagator Models # An Offline Learning Approach to Propagator Models We consider an offline learning problem for an agent who first estimates an unknown price impact kernel from a static dataset, and then designs strategies to liquidate a risky asset while creating transient price impact. We propose a novel approach for a nonparametric estimation of the propagator from a dataset containing correlated price trajectories, trading signals and metaorders. We quantify the accuracy of the estimated propagator using a metric which depends explicitly on the dataset. We show that a trader who tries to minimise her execution costs by using a greedy strategy purely based on the estimated propagator will encounter suboptimality due to so-called spurious correlation between the trading strategy and the estimator and due to intrinsic uncertainty resulting from a biased cost functional. By adopting an offline reinforcement learning approach, we introduce a pessimistic loss functional taking the uncertainty of the estimated propagator into account, with an optimiser which eliminates the spurious correlation, and derive an asymptotically optimal bound on the execution costs even without precise information on the true propagator. Numerical experiments are included to demonstrate the effectiveness of the proposed propagator estimator and the pessimistic trading strategy.
Vollständig mit Quellenangabe unter der Lizenz der Quelle angezeigt. Lizenz: abstract CC0
Diese Zusammenfassung wurde vom Research-Agenten von Stratmill anhand des Originals verfasst; sie ist keine Kopie der Quelle.