Перейти к содержимому
Все документы библиотеки

Смеси экспертов для исполнения криптоордеров: устойчивость и хвостовой риск

Статья arXiv papers · Автор: Alexander Ardaiz et al.

Сводка

В исследовании сравниваются Double Deep Q-Learning, смеси экспертов с разбиением методом K-means и полносвязные сети с сопоставимым числом параметров для исполнения ордеров BTC/USDT. Оценка использует усреднённые за пятиминутные интервалы данные книги лимитных заявок Binance и сосредоточена на дефиците исполнения, разбросе результатов при разных начальных значениях генератора, коллапсе политики и хвостовом риске внутри политики. Результаты сравниваются со средневзвешенной по времени ценой и эталоном немедленной ликвидации в среде воспроизведения, где ранняя ликвидация почти ничего не стоит из-за заданной конструкции вознаграждения и штрафа.

Ни одна обученная конфигурация статистически значимо не снижает средний дефицит исполнения относительно базового алгоритма обучения, а у каждой этот показатель выше, чем у обоих простых эталонов в данной спецификации. Анализ с повторными запусками и абляциями связывает предотвращение коллапса с постепенным снижением уровня исследования, а не с присущим смесям экспертов преимуществом; сочетание изменений в исследовании и вознаграждении может вернуть коллапс. Конфигурация с наибольшим числом экспертов показывает наименьший разброс между запусками, но результат неустойчив к поправке на множественные сравнения, тогда как хвостовой риск внутри политики растёт с числом экспертов. Выводы относятся к проверенным среде и спецификациям; изменение атрибуции при разном числе запусков подчёркивает неопределённость оценки.

Ключевые идеи

  • Проверенные конфигурации со смесью экспертов не дают статистически значимого снижения среднего дефицита исполнения по сравнению с обычным Double Deep Q-Learning.
  • В заданной среде воспроизведения средневзвешенная по времени цена и немедленная ликвидация показывают меньший средний дефицит исполнения, чем обученные конфигурации.
  • Постепенное снижение уровня исследования подавляет наблюдавшиеся коллапсы политики без необходимости разбивать модель на экспертов.
  • Разброс между запусками и хвостовой риск внутри политики по-разному меняются с ростом числа экспертов.
  • Приписывание причин сбоев может меняться с числом обучающих запусков, поэтому важна оценка с повторными запусками.

Теги

Полный текст
# Mixture-of-Experts for Cryptocurrency Order Execution: Training Stability, Tail Risk, and Failure Modes


# Mixture-of-Experts for Cryptocurrency Order Execution: Training Stability, Tail Risk, and Failure Modes









Deep reinforcement-learning policies for order execution can vary substantially across training seeds, so apparent architectural gains may reflect favourable training realisations rather than reproducible properties of the architecture. We evaluate vanilla Double Deep Q-Learning (DDQL), K-means-partitioned mixtures of DDQL experts at $K \in \{2, 4, 8\}$, and dense networks parameter-matched to the $K{=}4$ and $K{=}8$ expert budgets on 5-minute mean-aggregated BTC/USDT limit order book data from Binance. No learned configuration significantly improves mean implementation shortfall over DDQL. Under the reported specification, all have higher mean shortfall than TWAP (0.39 bps) and immediate liquidation (0.21 bps) in an environment whose frictionless replay and terminal-urgency penalty make early liquidation nearly costless; 11/100 vanilla-DDQL runs, versus none in either MoE $K{\geq}4$ arm, converge to a policy that waits until forced liquidation. We then decompose this specification on a device-matched baseline. Annealed exploration alone eliminates observed collapses (12/100 to 0/100; exact McNemar $p{=}4.9{\times}10^{-4}$), matching the elimination under expert partitioning. Combining annealed exploration with the aligned reward restores collapse in 19/30 runs; with all three specification changes, it rises to 48/100. In this environment, expert partitioning is unnecessary to suppress collapse and appears to mask a training-specification failure rather than confer an intrinsic performance benefit. No MoE $K{=}8$ run collapses under any of the six specifications tested. Across-seed dispersion is lowest at $K{=}8$ but non-monotone and not robust to family-wise adjustment, while within-policy tail risk worsens monotonically with $K$. The apparent attribution of the failure mode reverses between 30 and 100 seeds, illustrating the importance of repeated-seed evaluation.

Полный текст с указанием источника опубликован на условиях его лицензии. Лицензия: abstract CC0

Это краткое изложение подготовлено исследовательским агентом Stratmill по оригиналу и не является его копией.