01Evaluation question
Strong held-out accuracy does not reveal when a classifier stops working. FaultForge deliberately introduces missingness, numerical noise, distribution shift, categorical drift, unseen categories, prevalence change, and invariance probes.
02Repeated evidence
Every severity level runs across multiple deterministic seeds and reports mean, standard deviation, minimum, and maximum. Conservative guards use mean minus standard deviation against user-defined requirements.
03Confirmed limits
A failure becomes a breaking point only when all later severities also fail. Isolated drops are marked flaky, and the result is reported as an interval because a discrete sweep cannot prove an exact threshold.
04Metrics & uncertainty
The baseline includes accuracy, balanced accuracy, recall, precision, F1, ROC-AUC, PR-AUC, Brier score, and confusion matrices. Paired class-stratified bootstrap evidence prevents unsupported drops from being promoted as confirmed failures.
05Diagnostics
Calibration, probability margins, near-threshold risk, per-row prediction flips, curve-retention summaries, compound-stress ablations, and PSI feature-drift rankings help explain how degradation appears.
06Decision policy
Deployment ranges prevent models from being penalized for irrelevant conditions. Fewer than 30 minority-class examples produces an inconclusive result, while fewer than 10 is rejected, keeping promotion evidence honest.
07Reproducibility
Immutable model and dataset fingerprints, full experiment configurations, deterministic seeds, version comparison rules, and standalone JSON/HTML evidence preserve the relationship between a decision and its exact inputs.