Criticality-Guided Failure Replay / bench_report.json

Mechanism confirmed, baseline not beaten

Raw ⬇ ZIP
  1{
  2  "bench_version": 1,
  3  "track": "dynamics",
  4  "model": "rnn_small",
  5  "metric_direction": "lower is better",
  6  "n_seeds": 8,
  7  "baseline": {
  8    "best_cfg": {
  9      "lr": 0.006,
 10      "epochs": 6,
 11      "alpha": 0.0,
 12      "weighted": false
 13    },
 14    "sweep": [
 15      {
 16        "cfg": {
 17          "lr": 0.001,
 18          "epochs": 6,
 19          "alpha": 0.0,
 20          "weighted": false
 21        },
 22        "mean": 0.15612634923309088
 23      },
 24      {
 25        "cfg": {
 26          "lr": 0.003,
 27          "epochs": 6,
 28          "alpha": 0.0,
 29          "weighted": false
 30        },
 31        "mean": 0.022599048796109855
 32      },
 33      {
 34        "cfg": {
 35          "lr": 0.006,
 36          "epochs": 6,
 37          "alpha": 0.0,
 38          "weighted": false
 39        },
 40        "mean": 0.013443514122627676
 41      }
 42    ],
 43    "full": {
 44      "mean": 0.013443514122627676,
 45      "std": 0.0034362747708833723,
 46      "per_seed": [
 47        0.015814311802387238,
 48        0.011003119871020317,
 49        0.014025969430804253,
 50        0.013154271990060806,
 51        0.01978541910648346,
 52        0.015274417586624622,
 53        0.010594896040856838,
 54        0.00789570715278387
 55      ],
 56      "n": 8
 57    }
 58  },
 59  "idea": {
 60    "mean": 0.016453448799438775,
 61    "std": 0.003337952311107532,
 62    "per_seed": [
 63      0.012871215119957924,
 64      0.01926228776574135,
 65      0.019986655563116074,
 66      0.01737268455326557,
 67      0.009503618814051151,
 68      0.017524683848023415,
 69      0.016284719109535217,
 70      0.018821725621819496
 71    ],
 72    "n": 8
 73  },
 74  "comparison": {
 75    "delta_mean": 0.003009934676811099,
 76    "idea_wins": 2,
 77    "n_pairs": 8,
 78    "per_seed_diffs": [
 79      -0.0029430966824293137,
 80      0.008259167894721031,
 81      0.005960686132311821,
 82      0.004218412563204765,
 83      -0.010281800292432308,
 84      0.0022502662613987923,
 85      0.005689823068678379,
 86      0.010926018469035625
 87    ],
 88    "p_value": 0.24735,
 89    "mde": 0.005655673555602832,
 90    "mde_rel_pct": 42.06990452059994,
 91    "verdict": "no significant win",
 92    "system_worked": false
 93  },
 94  "mechanism_signature": {
 95    "mechanism_signature": {
 96      "metric": 0.012871215119957924,
 97      "critic_bce": 0.09358271956443787,
 98      "failure_rate": 0.0625,
 99      "predicted_enrichment": 2.64437198638916,
100      "observed_enrichment": 2.55679988861084,
101      "ess_fraction": 0.9292901097924411,
102      "weighted_pool_loss": 0.013131698593497276,
103      "uniform_pool_loss": 0.013131696730852127
104    },
105    "math_check": {
106      "rows": [
107        {
108          "alpha": 0.5,
109          "predicted_enrichment": 1.1935695059810845,
110          "sampled_enrichment": 1.1971491228070177,
111          "identity_l2": 2.180444593116775e-16,
112          "ess_fraction": 0.7844566886686185
113        },
114        {
115          "alpha": 1.0,
116          "predicted_enrichment": 1.3319936587355161,
117          "sampled_enrichment": 1.3263157894736841,
118          "identity_l2": 1.6025315005387115e-16,
119          "ess_fraction": 0.35981862086454786
120        },
121        {
122          "alpha": 2.0,
123          "predicted_enrichment": 1.5119809457893971,
124          "sampled_enrichment": 1.5087719298245612,
125          "identity_l2": 2.1315227208338676e-16,
126          "ess_fraction": 0.08387276797729101
127        }
128      ],
129      "max_identity_l2": 2.180444593116775e-16,
130      "confirmed_identity": true
131    },
132    "prediction": "criticality proposal enrichment equals E_q[y]/E_p[y] while weighted expectation preserves uniform loss",
133    "confirmed": true,
134    "idea_sweep": [
135      {
136        "cfg": {
137          "lr": 0.006,
138          "epochs": 6,
139          "alpha": 0.5,
140          "weighted": true
141        },
142        "result": {
143          "mean": 0.016453448799438775,
144          "std": 0.003337952311107532,
145          "per_seed": [
146            0.012871215119957924,
147            0.01926228776574135,
148            0.019986655563116074,
149            0.01737268455326557,
150            0.009503618814051151,
151            0.017524683848023415,
152            0.016284719109535217,
153            0.018821725621819496
154          ],
155          "n": 8
156        }
157      },
158      {
159        "cfg": {
160          "lr": 0.006,
161          "epochs": 6,
162          "alpha": 1.0,
163          "weighted": true
164        },
165        "result": {
166          "mean": 0.01651376229710877,
167          "std": 0.0028040435177098303,
168          "per_seed": [
169            0.01849322021007538,
170            0.01740805059671402,
171            0.017674783244729042,
172            0.018753860145807266,
173            0.014908691868185997,
174            0.014080381020903587,
175            0.010877873748540878,
176            0.019913237541913986
177          ],
178          "n": 8
179        }
180      },
181      {
182        "cfg": {
183          "lr": 0.006,
184          "epochs": 6,
185          "alpha": 2.0,
186          "weighted": true
187        },
188        "result": {
189          "mean": 0.01855568215250969,
190          "std": 0.006122484793310474,
191          "per_seed": [
192            0.025685645639896393,
193            0.020075352862477303,
194            0.025499150156974792,
195            0.0117742158472538,
196            0.01591908372938633,
197            0.008489308878779411,
198            0.016218945384025574,
199            0.024783754721283913
200          ],
201          "n": 8
202        }
203      }
204    ],
205    "track_justification": "dynamics is the built-in structural match for rollout failure/control states"
206  }
207}