עבור לתוכן
כל מסמכי הספרייה

מגבלות דרגת היעקוביאן בלמידה ממוקדת החלטות

מאמר arXiv papers · מחבר: Aojie Yuan et al.

סיכום

המחקר מנתח כיצד הגאומטריה של מנבא מגבילה למידה ממוקדת החלטות, שבה אימון המודל קשור למטרת החלטה בהמשך התהליך. באמצעות מעקב דליל אחר מדד, הוא מבחין בין מידע המתאם שבו משתמש האופטימייזר לבין כיווני עדכון הפרמטרים הזמינים למנבא. יעקוביאנים מדרגה אחת מניבים גרדיאנטים לא־אפסיים קוליניאריים לכל דוגמה, ואילו חסם ספקטרלי מתאר קוליניאריות מקורבת. המאמר מאפיין גם תתי־מרחבים של עדכוני אצווה ומציג דוגמאות נגדיות המראות שתכונות דרגה מקומיות לבדן אינן קובעות מינימייזרים משותפים או עדכוני אצווה קוליניאריים.

ניסויים בודקים אם המגבלות הגאומטריות משפיעות על איכות ההחלטות. בתצורות המניות המדווחות, למידה ממוקדת החלטות משפרת מעט ביחס לשגיאה ריבועית ממוצעת; ניסויים אחרים מוצאים הפחתות חרטה גדולות יותר במשימות של המסלול הקצר ביותר ובעיית התרמיל, כאשר לאחר תיקון התוצאה נותרת רק לבעיית התרמיל. קיבולת, קנה מידה של הקואורדינטות ומערך האימון משפיעים על תוצאות האופטימיזציה. בקרות פיננסיות של יעד עתידי והשוואה עצבית תואמת אינן מראות יתרון מצרפי ללמידה ממוקדת החלטות בארכיטקטורה שנבדקה. הממצאים ייחודיים למודלים ולמשימות שנבחנו: מבנה היעקוביאן מסביר את כיווני הלמידה הזמינים, אך כדי לבסס ערך מעשי דרושה איכות החלטות שנמדדה על נתוני החזקה.

רעיונות מרכזיים

  • היעקוביאן של מנבא מתאר אילו כיווני עדכון פרמטרים זמינים ללמידה ממוקדת החלטות.
  • יעקוביאנים מדרגה אחת הופכים גרדיאנטים לא־אפסיים לכל דוגמה לקוליניאריים, אך עדכוני אצווה אינם חייבים להיות כאלה.
  • מגבלות דרגה מקומיות אינן גוררות כשלעצמן מינימייזרים משותפים.
  • השיפורים הניסויים משתנים בין המשימות; מבין ההשוואות שצוינו, הראיות המתוקנות נותרות רק לבעיית התרמיל.
  • שינוי קנה המידה של הקואורדינטות משנה את התנהגות האופטימיזציה, ולכן הערכת איכות ההחלטות על נתוני החזקה נותרת חיונית.

תגיות

הטקסט המלא
# Jacobian Rank Collapse in Decision-Focused Learning


# Jacobian Rank Collapse in Decision-Focused Learning









Decision-focused learning (DFL) trains predictors through downstream objectives, but a different loss need not provide an independent parameter-update direction. We characterize this restriction through the predictor Jacobian, using sparse index tracking to distinguish the covariance entries read by the optimizer from the parameter directions available to learning. Rank-one Jacobians make nonzero per-example gradients collinear; a conditional spectral bound describes near-collinearity. A batch-subspace characterization and counterexamples show why these local statements imply neither common minimizers nor collinear batch updates. Experiments examine when geometry translates into decision quality. Across 38 one-parameter equity configurations, DFL gains over MSE remain below 1.8%; a 385-parameter conditional predictor also has pointwise rank one. In validation-tuned shortest-path and knapsack experiments, full-capacity SPO+ reduces mean regret by 11.6% and 10.6%, respectively; only knapsack survives correction across eight comparisons. The capacity contrast persists on fresh datasets across batch orders and training budgets. Holding expressivity fixed, invertible coordinate scaling lowers spectral effective rank and ordinary SGD gains; compensating for the scaling restores the original trajectories. Financial forward-target controls separate forecast accuracy from decision quality; a matched neural comparison finds no aggregate DFL advantage in the tested architecture. These findings distinguish local rank restrictions, coordinate-dependent optimization and predictive accuracy. Predictor geometry helps explain available learning directions, while held-out decision quality remains the test of practical benefit.

מוצג במלואו בציון המקור ובהתאם לרישיון שלו. רישיון: abstract CC0

הסיכום נכתב בידי סוכן המחקר של Stratmill על סמך המקור; הוא אינו העתק של המקור.