Module 2: Supervised Learning in Finance
This module explores supervised learning techniques used in credit risk modelling, fraud detection, customer behaviour prediction, and financial classification. It covers prediction targets, model families, evaluation metrics, regulatory requirements, and practical considerations when deploying supervised models in financial institutions.
Page 1 – Credit Risk Modelling: Concepts & Targets
1.1 Overview of Credit Risk
Credit risk represents the potential for financial loss arising from a borrower’s failure to meet contractual obligations. Supervised machine learning provides a flexible framework for estimating creditworthiness across retail, SME, and corporate portfolios.
1.2 Core Risk Metrics
- Probability of Default (PD) – likelihood of default within a time horizon.
- Loss Given Default (LGD) – proportion of exposure lost if default occurs.
- Exposure at Default (EAD) – amount outstanding at the time of default.
- Expected Loss (EL) –
EL = PD × LGD × EAD
1.3 Common Targets for ML Models
Supervised learning can be used to estimate:
- Binary default indicator (default vs non-default).
- Continuous LGD (bounded regression problem).
- Cure prediction (recoveries or restructuring outcomes).
- Fraud / non-fraud classification.
- Churn / retention in wealth and banking products.
1.4 Economic Data Structure
Credit modelling typically uses panel, behavioural, and static customer features:
- Demographics (age, region, customer type)
- Financial metrics (income, liabilities, credit utilisation)
- Repayment history (delinquencies, arrears, roll rates)
- Behavioural signals (spending patterns, payroll deposits)
- Product characteristics (loan type, maturity, limits)
1.5 Industry Practice
Banking models must meet regulatory expectations under:
- Basel II/III – internal ratings-based approaches.
- IFRS 9 – expected credit loss (ECL) estimation.
- Consumer lending regulations – fairness & transparency.
Interpretability and stability are crucial, influencing model choice.
Page 2 – Model Families & Training Pipelines
2.1 Interpretable Baseline Models
Financial institutions frequently begin with interpretable linear models:
- Logistic regression – default classification baseline.
- Linear regression – LGD and EAD estimation.
- Scorecards – monotonic transformations of features.
2.2 Tree-Based & Ensemble Models
More complex relationships can be captured by:
- Decision Trees
- Random Forests
- Gradient Boosted Trees (XGBoost, LightGBM, CatBoost)
Benefits:
- Excellent for tabular financial datasets.
- Handle nonlinear interactions.
- Robust to missing data and outliers.
2.3 Neural Networks in Credit & Fraud
Neural networks are used selectively where complexity is justified:
- Multilayer perceptrons for behavioural scoring.
- Temporal networks (LSTMs, TCNs) for credit histories.
- Deep anomaly detection architectures (Autoencoders).
2.4 Handling Imbalanced Data
Defaults and fraud cases are rare. Techniques include:
- SMOTE oversampling
- Class weighting in the loss function
- Anomaly detection frameworks instead of classification
2.5 Feature Pipelines
A typical financial ML pipeline includes:
- Extract features from data sources.
- Perform encoding, scaling, outlier checks.
- Split by time: train / validation / test.
- Train model and tune hyperparameters.
- Perform backtesting for time-based validity.
- Generate explainability reports.
Page 3 – Fraud Detection & Anomaly Classification
3.1 Nature of Fraud Problems
Fraud detection differs from standard classification:
- Fraud patterns evolve rapidly.
- Fraud datasets are highly imbalanced.
- Fraudsters actively adapt to detection systems.
3.2 Supervised Fraud Detection
Supervised approaches use historical labelled data:
- Gradient boosting methods (LightGBM, XGBoost).
- Neural networks for behavioural modelling.
- Cost-sensitive classifiers for rare events.
3.3 Unsupervised & Semi-Supervised Techniques
When labels are missing or incomplete:
- Autoencoders – reconstruction error signals anomalies.
- Isolation Forest – isolates rare points more easily.
- One-class SVM – learns normal behaviour boundary.
3.4 Real-Time Fraud Decision Engines
Modern fraud systems require:
- Low-latency decision latencies (<50ms).
- Streaming feature pipelines.
- Behavioural profiles updated in near real time.
3.5 Fraud Explainability
Because false positives create customer friction, models must provide:
- Reason codes for decisions.
- Feature attributions.
- Confidence thresholds for escalation.
Page 4 – Evaluation, Stability & Regulatory Metrics
4.1 Metrics Beyond Accuracy
Financial models require specialised evaluation metrics:
- Precision: Of predicted positives, how many are correct?
- Recall (Sensitivity): Of actual positives, how many were detected?
- ROC–AUC: Ranking ability across thresholds.
- PR–AUC: Critical in imbalanced data settings.
4.2 Calibration
Credit risk models must output well-calibrated probabilities. Techniques include:
- Platt scaling
- Isotonic regression
- Temperature scaling
4.3 Stability Over Time
Financial data changes due to:
- Economic cycles
- Product changes
- Regulatory interventions
Monitoring metrics include:
- Population stability index (PSI)
- Characteristic stability index (CSI)
- Drift scores in continuous monitoring
4.4 Fairness Metrics
In regulated applications:
- Equal opportunity
- Demographic parity
- Adverse impact ratio
- Group-level calibration
4.5 Stress and Scenario Testing
Credit and fraud models must be tested under:
- Macro shocks (e.g., rates +300bps)
- Market crashes
- Credit downturn scenarios
Stress testing reveals model fragility and supports regulatory filings.
Page 5 – Deployment, Monitoring & Governance in Finance
5.1 Deployment Architectures
Typical financial ML deployment pipelines include:
- Batch scoring for risk and reporting cycles.
- Online scoring for real-time credit or fraud decisions.
- API-based scoring engines with audit logs.
5.2 Monitoring & Alerts
Critical monitoring dimensions:
- Feature distribution drift
- Prediction drift
- Model latency
- Error spikes and alert thresholds
5.3 Regulatory Documentation
Financial institutions require documentation such as:
- Model development documents (MDD)
- Model validation reports
- Ongoing monitoring reports
- Fairness and compliance attestations
5.4 Human Oversight
AI systems in finance must include human decision points:
- Overrides for borderline decisions
- Manual review for flagged transactions
- Risk committee escalation procedures
5.5 Summary
Module 2 introduced supervised learning as the backbone of modern financial classification tasks. It covered:
- Credit risk target variables and modelling frameworks.
- Fraud detection methods and anomaly detection architectures.
- Model families and training pipelines.
- Evaluation metrics, stability, fairness, and stress testing.
- Deployment considerations and governance requirements.
Next, Module 3 will examine time-series forecasting, algorithmic trading, volatility modelling, and signal engineering.
