Перейти к содержимому
Все документы библиотеки

Ограничения ранга якобиана в обучении с ориентацией на решение

Статья arXiv papers · Автор: Aojie Yuan et al.

Сводка

В исследовании анализируется, как геометрия предиктора ограничивает обучение с ориентацией на решение, при котором обучение модели связано с последующей целевой задачей принятия решений. На примере разреженного индексного трекинга авторы различают ковариационную информацию, используемую оптимизатором, и направления обновления параметров, доступные предиктору. Якобианы предиктора ранга один приводят к коллинеарности ненулевых градиентов отдельных примеров, а спектральная граница описывает близость к коллинеарности. В работе также характеризуются подпространства пакетных обновлений и приводятся контрпримеры: локальные свойства ранга сами по себе не определяют ни общие минимизаторы, ни коллинеарность пакетных обновлений.

В экспериментах проверяется, влияют ли эти геометрические ограничения на качество решений. В представленных конфигурациях для акций обучение с ориентацией на решение лишь немного превосходит среднеквадратичную ошибку; в других экспериментах сокращение сожаления больше для задач кратчайшего пути и «рюкзака», но после корректировки результат сохраняется только для задачи «рюкзака». На результаты оптимизации влияют ёмкость модели, масштабирование координат и настройки обучения. Контрольные проверки на финансовых целях с прогнозом вперёд и сравнение с сопоставимой нейросетью не выявляют общего преимущества обучения с ориентацией на решение в проверенной архитектуре. Выводы относятся к рассмотренным моделям и задачам: структура якобиана объясняет доступные направления обучения, но для оценки практической ценности необходимо измерять качество решений на отложенных данных.

Ключевые идеи

  • Якобиан предиктора описывает, какие направления обновления параметров доступны обучению с ориентацией на решение.
  • Якобианы ранга один делают ненулевые градиенты отдельных примеров коллинеарными, но для пакетных обновлений это свойство необязательно.
  • Локальные ограничения ранга сами по себе не гарантируют существования общих минимизаторов.
  • Экспериментальные результаты различаются по задачам; после корректировки подтверждённый эффект сохраняется лишь для задачи «рюкзака» среди упомянутых сравнений.
  • Масштабирование координат меняет поведение оптимизации, поэтому для оценки по-прежнему необходимо проверять качество решений на отложенных данных.

Теги

Полный текст
# Jacobian Rank Collapse in Decision-Focused Learning


# Jacobian Rank Collapse in Decision-Focused Learning









Decision-focused learning (DFL) trains predictors through downstream objectives, but a different loss need not provide an independent parameter-update direction. We characterize this restriction through the predictor Jacobian, using sparse index tracking to distinguish the covariance entries read by the optimizer from the parameter directions available to learning. Rank-one Jacobians make nonzero per-example gradients collinear; a conditional spectral bound describes near-collinearity. A batch-subspace characterization and counterexamples show why these local statements imply neither common minimizers nor collinear batch updates. Experiments examine when geometry translates into decision quality. Across 38 one-parameter equity configurations, DFL gains over MSE remain below 1.8%; a 385-parameter conditional predictor also has pointwise rank one. In validation-tuned shortest-path and knapsack experiments, full-capacity SPO+ reduces mean regret by 11.6% and 10.6%, respectively; only knapsack survives correction across eight comparisons. The capacity contrast persists on fresh datasets across batch orders and training budgets. Holding expressivity fixed, invertible coordinate scaling lowers spectral effective rank and ordinary SGD gains; compensating for the scaling restores the original trajectories. Financial forward-target controls separate forecast accuracy from decision quality; a matched neural comparison finds no aggregate DFL advantage in the tested architecture. These findings distinguish local rank restrictions, coordinate-dependent optimization and predictive accuracy. Predictor geometry helps explain available learning directions, while held-out decision quality remains the test of practical benefit.

Полный текст с указанием источника опубликован на условиях его лицензии. Лицензия: abstract CC0

Это краткое изложение подготовлено исследовательским агентом Stratmill по оригиналу и не является его копией.