Positive-Regime Observable ReLU State Space / bench_report.json

Mechanism confirmed, baseline not beaten

Raw ⬇ ZIP
  1{
  2  "bench_version": 1,
  3  "track": "dynamics",
  4  "model": "rnn_small",
  5  "metric_direction": "lower is better",
  6  "n_seeds": 8,
  7  "baseline": {
  8    "best_cfg": {
  9      "lr": 0.01,
 10      "epochs": 20
 11    },
 12    "sweep": [
 13      {
 14        "cfg": {
 15          "lr": 0.001,
 16          "epochs": 20
 17        },
 18        "mean": 0.00029752701448160224
 19      },
 20      {
 21        "cfg": {
 22          "lr": 0.003,
 23          "epochs": 20
 24        },
 25        "mean": 0.00014188402201398276
 26      },
 27      {
 28        "cfg": {
 29          "lr": 0.01,
 30          "epochs": 20
 31        },
 32        "mean": 0.00010523172568355221
 33      }
 34    ],
 35    "full": {
 36      "mean": 0.00010165680305362912,
 37      "std": 3.3366825192157083e-05,
 38      "per_seed": [
 39        0.0001742699823807925,
 40        6.733651389367878e-05,
 41        7.70786646171473e-05,
 42        0.00010224174184259027,
 43        8.755998715059832e-05,
 44        0.00010097782796947286,
 45        7.315044058486819e-05,
 46        0.00013063926598988473
 47      ],
 48      "n": 8
 49    },
 50    "idea_parity_note": "Baseline lr union covers every idea lr; baseline penalty fixed to zero."
 51  },
 52  "idea": {
 53    "mean": 0.00010387055726823746,
 54    "std": 3.405913194481688e-05,
 55    "per_seed": [
 56      0.0001575992937432602,
 57      8.58209896250628e-05,
 58      7.609691965626553e-05,
 59      0.00010509935236768797,
 60      7.766245835227892e-05,
 61      0.00012542385957203805,
 62      5.6170345487771556e-05,
 63      0.00014709123934153467
 64    ],
 65    "n": 8,
 66    "sweep": [
 67      {
 68        "cfg": {
 69          "lr": 0.01,
 70          "epochs": 20,
 71          "penalty": 0.01
 72        },
 73        "mean": 0.00010615413884806912
 74      },
 75      {
 76        "cfg": {
 77          "lr": 0.01,
 78          "epochs": 20,
 79          "penalty": 0.1
 80        },
 81        "mean": 0.0001076593453035457
 82      },
 83      {
 84        "cfg": {
 85          "lr": 0.01,
 86          "epochs": 20,
 87          "penalty": 1.0
 88        },
 89        "mean": 0.000183743754405441
 90      }
 91    ],
 92    "best_cfg": {
 93      "lr": 0.01,
 94      "epochs": 20,
 95      "penalty": 0.01
 96    }
 97  },
 98  "comparison": {
 99    "delta_mean": 2.2137542146083433e-06,
100    "idea_wins": 4,
101    "n_pairs": 8,
102    "per_seed_diffs": [
103      -1.6670688637532294e-05,
104      1.848447573138401e-05,
105      -9.817449608817697e-07,
106      2.857610525097698e-06,
107      -9.8975287983194e-06,
108      2.44460316025652e-05,
109      -1.6980095097096637e-05,
110      1.645197335164994e-05
111    ],
112    "p_value": 0.70145,
113    "mde": 1.3571445751318616e-05,
114    "mde_rel_pct": 13.350258264721337,
115    "verdict": "no significant win",
116    "system_worked": false
117  },
118  "mechanism_signature": {
119    "math_check": {
120      "max_affine_difference": 0.0,
121      "negative_fraction": 0.0,
122      "max_perturbation_residual": 1.0295876722904796e-15,
123      "pass": true
124    },
125    "prediction": "penalty should reduce negative preactivations and affine ReLU gap",
126    "baseline_observed": {
127      "negative_preactivation_fraction": 0.603515625,
128      "mean_relu_affine_gap": 0.24997861124575138,
129      "finite_difference_output_change": 1.8480932340025902e-08
130    },
131    "idea_observed": {
132      "negative_preactivation_fraction": 0.5734405517578125,
133      "mean_relu_affine_gap": 0.1607181280851364,
134      "finite_difference_output_change": 1.2689270079135895e-08
135    },
136    "confirmed": true
137  },
138  "protocol_notes": {
139    "structural_match": "controlled pendulum rollout is a recurrent dynamics task",
140    "n_train": 1200,
141    "n_test": 400
142  }
143}