{
  "run": "reviewed-expanded-2026-09-07",
  "seed": 20260831,
  "selected_epochs": {
    "catalog_only_baseline": 10,
    "gameplay_trained_classifier": 5,
    "learned_validity_gate": 1
  },
  "thresholds": {
    "confidence_based": {
      "threshold": 1.0,
      "true_positive": 1159,
      "false_negative": 128,
      "false_positive": 7,
      "true_negative": 80,
      "balanced_accuracy": 0.910042065214479,
      "valid_accept_recall": 0.9005439005439005,
      "reject_recall": 0.9195402298850575,
      "false_accept_rate": 0.08045977011494253,
      "false_reject_rate": 0.09945609945609946
    },
    "learned_validity": {
      "threshold": 0.494140625,
      "true_positive": 1238,
      "false_negative": 49,
      "false_positive": 16,
      "true_negative": 71,
      "balanced_accuracy": 0.8890094579749752,
      "valid_accept_recall": 0.9619269619269619,
      "reject_recall": 0.8160919540229885,
      "false_accept_rate": 0.1839080459770115,
      "false_reject_rate": 0.03807303807303807
    }
  },
  "ranking": {
    "confidence_based": {
      "auroc": 0.9478605685502237,
      "auprc": 0.9931417244304818
    },
    "learned_validity": {
      "auroc": 0.9469763952522573,
      "auprc": 0.9944504321796056
    }
  },
  "protocol_invariants": {
    "m0_m1_initialization_match": true,
    "classification_identity_schedules_match": true,
    "classification_optimizer_updates": {
      "M0": 4272,
      "M1": 4272
    },
    "classification_optimizer_updates_match": true,
    "m2_trainable_parameter_names": [
      "validity_head.weight",
      "validity_head.bias"
    ],
    "m2_only_validity_head_trainable": true,
    "m1_m2_nonvalidity_parameters_equal": true,
    "m1_m2_changed_protected_parameters": [],
    "confidence_threshold_selection_partition": "validation",
    "validity_threshold_selection_partition": "validation"
  },
  "note": "Frozen development test; not an independent blind benchmark. Scores are uncalibrated. CSV contains the 1,374 original saved test predictions.",
  "ranking_definition": "Preserved original run values; auprc is legacy row-ordered AP. See ranking-score-audit.json for grouped-score AP. Model weights, thresholds and counts unchanged."
}