Federated Learning zur Einkommensschätzung von Kreditnehmenden bei Datenbeschränkungen
Zusammenfassung
Das Dokument stellt einen Federated-Learning-Ansatz zur Schätzung des Einkommens von Kreditnehmenden vor, wenn Kreditgeber die Rohdaten von Antragstellenden nicht zusammenführen können. Die Institutionen trainieren ein gemeinsames Modell und speichern die Daten weiterhin lokal. Die Auswertung simuliert einen Verbund aus bundesstaatlichen Clients anhand historischer Kreditdaten und vergleicht föderierte Schätzungen bei späteren Beobachtungen mit gepoolten Modellen und Modellen, die nur lokal trainiert wurden.
Insgesamt liegt die Leistung des föderierten Modells nahe am gepoolten Benchmark; in diesem Szenario schneiden Clients mit wenigen Daten im Durchschnitt besser ab als dieser Benchmark. Die Studie stellt außerdem fest, dass Föderation in allen Client-Größengruppen das lokale Training übertrifft, mit den größten Verbesserungen bei den datenärmsten Clients. Sie kombiniert Einkommensschätzungen mit bundesstaaten- und einkommensspezifischen Verschuldungsgrenzen und analysiert rückblickend Kreditgenehmigungen. Dabei werden mehr simulierte Genehmigungen bei geringfügigen Veränderungen der beobachteten Ausfälle berichtet. Die Ergebnisse hängen von diesem Datensatz, der Aufteilung der Clients und dem Auswertungsdesign ab; die Analyse belegt nicht, dass die Änderungen bei Genehmigungen auch im realen Kreditgeschäft oder in anderen Bevölkerungsgruppen eintreten würden.
Kernaussagen
- Federated Learning ermöglicht Institutionen, gemeinsam ein Einkommensschätzungsmodell zu trainieren und Kreditnehmerdaten lokal zu speichern.
- Die Auswertung vergleicht föderierte Modelle sowohl mit gepooltem Training als auch mit lokalem Training in den einzelnen Institutionen.
- Clients mit wenigen Daten profitieren bei der Schätzung am deutlichsten gegenüber lokalem Training.
- Föderierte Schätzungen werden in einer rückblickenden Analyse von Kreditgenehmigungen mit angepassten Verschuldungsgrenzen kombiniert.
- Die berichteten Ergebnisse beziehen sich auf die historischen Daten und den simulierten Verbund.
Schlagwörter
Volltext
# FedIncome: Federated Learning for Income Estimation in Digital Lending Under Data Sovereignty Constraints # FedIncome: Federated Learning for Income Estimation in Digital Lending Under Data Sovereignty Constraints Verified income is often unavailable in digital loan applications, forcing lenders to rely on reported income and potentially leading to over-lending, overly conservative offers, or rejection of creditworthy applicants. Cross-institutional data-sharing constraints make this problem especially difficult for smaller lenders with limited training data. We introduce FedIncome, a federated learning framework for income estimation that enables institutions to train a shared model without pooling raw borrower records. Using more than one million LendingClub loans partitioned into $50$ state-level clients, we simulate a heterogeneous lending consortium. The best federated model achieves out-of-time $R^2=0.608$, compared with $0.619$ for a pooled centralised benchmark. Small-sample clients obtain an average out-of-time $R^2$ improvement of $3.8$ percentage points relative to the pooled centralised benchmark, while the fitted client-level relationship places the empirical crossover at approximately $4,790$ training observations in this setting. When pooling is infeasible and the relevant alternative is local-only training, federation improves out-of-time performance across all sample-size groups, with the largest gains for data-scarce clients. We also combine federated income estimates with state- and income-specific debt-to-income thresholds. In a retrospective decision analysis, replacing reported income with the federated estimate increases simulated approval rates with only modest changes in observed default rates. FedIncome supports collaborative learning under data-locality constraints with little aggregate loss relative to pooled training and larger gains relative to local-only estimation.
Vollständig mit Quellenangabe unter der Lizenz der Quelle angezeigt. Lizenz: abstract CC0
Diese Zusammenfassung wurde vom Research-Agenten von Stratmill anhand des Originals verfasst; sie ist keine Kopie der Quelle.