Conformal Lower-Clearance Certificate for Neural Selectors / bench_report.json

Mechanism confirmed, baseline not beaten

Raw ⬇ ZIP
  1{
  2  "bench_version": 1,
  3  "track": "dynamics",
  4  "model": "rnn_small",
  5  "metric_direction": "lower is better",
  6  "n_seeds": 8,
  7  "baseline": {
  8    "best_cfg": {
  9      "lr": 0.006
 10    },
 11    "sweep": [
 12      {
 13        "cfg": {
 14          "lr": 0.001
 15        },
 16        "mean": 0.01659585232846439
 17      },
 18      {
 19        "cfg": {
 20          "lr": 0.003
 21        },
 22        "mean": 0.012405469547957182
 23      },
 24      {
 25        "cfg": {
 26          "lr": 0.006
 27        },
 28        "mean": 0.005767271446529776
 29      }
 30    ],
 31    "full": {
 32      "mean": 0.005887067440198734,
 33      "std": 0.0028623089080256525,
 34      "per_seed": [
 35        0.008059674873948097,
 36        0.004038976971060038,
 37        0.0031182977836579084,
 38        0.00785213615745306,
 39        0.003916425164788961,
 40        0.0028475807048380375,
 41        0.005657579749822617,
 42        0.011605868116021156
 43      ],
 44      "n": 8
 45    },
 46    "sweep_union": [
 47      {
 48        "lr": 0.001
 49      },
 50      {
 51        "lr": 0.003
 52      },
 53      {
 54        "lr": 0.006
 55      }
 56    ]
 57  },
 58  "idea": {
 59    "mean": 0.011248106741367055,
 60    "std": 0.006258844122725869,
 61    "per_seed": [
 62      0.022217202194459013,
 63      0.006783677271716304,
 64      0.00541313520087919,
 65      0.010822826067157683,
 66      0.005995401958828461,
 67      0.006209289870068991,
 68      0.012061415767069159,
 69      0.02048190560075764
 70    ],
 71    "n": 8,
 72    "selected_cfg": {
 73      "lr": 0.006
 74    }
 75  },
 76  "comparison": {
 77    "delta_mean": 0.005361039301168321,
 78    "idea_wins": 0,
 79    "n_pairs": 8,
 80    "per_seed_diffs": [
 81      0.014157527320510916,
 82      0.0027447003006562665,
 83      0.002294837417221282,
 84      0.0029706899097046227,
 85      0.0020789767940394997,
 86      0.003361709165230953,
 87      0.006403836017246542,
 88      0.008876037484736483
 89    ],
 90    "p_value": 0.0081,
 91    "mde": 0.0035692628707567073,
 92    "mde_rel_pct": 60.628876890124715,
 93    "verdict": "idea worse (significant)",
 94    "system_worked": false
 95  },
 96  "mechanism_signature": {
 97    "definition": "trained RNN predicted-vs-observed clearance coverage",
 98    "alpha": 0.1,
 99    "gamma": 0.25,
100    "K": 8,
101    "coverage_mean": 0.9009375,
102    "coverage_per_seed": [
103      0.92,
104      0.9175,
105      0.89,
106      0.8525,
107      0.88,
108      0.9225,
109      0.9075,
110      0.9175
111    ],
112    "q_mean": 0.05177069455385208,
113    "certificate_nonnegative_mean": 0.92,
114    "target_coverage": 0.9,
115    "confirmed": true,
116    "math_check": {
117      "cvar_max_abs_error": 1.1102230246251565e-16,
118      "q_is_order_statistic": true,
119      "q_rank": 29
120    },
121    "idea_sweep": [
122      {
123        "cfg": {
124          "lr": 0.001
125        },
126        "mean": 0.03188629204078374
127      },
128      {
129        "cfg": {
130          "lr": 0.003
131        },
132        "mean": 0.023879009760325764
133      },
134      {
135        "cfg": {
136          "lr": 0.006
137        },
138        "mean": 0.011309210183553048
139      }
140    ]
141  },
142  "math_check": {
143    "cvar_max_abs_error": 1.1102230246251565e-16,
144    "q_is_order_statistic": true,
145    "q_rank": 29
146  }
147}