Positive-Regime Observable ReLU State Space / bench_report.json
Mechanism confirmed, baseline not beaten
1{
2 "bench_version": 1,
3 "track": "dynamics",
4 "model": "rnn_small",
5 "metric_direction": "lower is better",
6 "n_seeds": 8,
7 "baseline": {
8 "best_cfg": {
9 "lr": 0.01,
10 "epochs": 20
11 },
12 "sweep": [
13 {
14 "cfg": {
15 "lr": 0.001,
16 "epochs": 20
17 },
18 "mean": 0.00029752701448160224
19 },
20 {
21 "cfg": {
22 "lr": 0.003,
23 "epochs": 20
24 },
25 "mean": 0.00014188402201398276
26 },
27 {
28 "cfg": {
29 "lr": 0.01,
30 "epochs": 20
31 },
32 "mean": 0.00010523172568355221
33 }
34 ],
35 "full": {
36 "mean": 0.00010165680305362912,
37 "std": 3.3366825192157083e-05,
38 "per_seed": [
39 0.0001742699823807925,
40 6.733651389367878e-05,
41 7.70786646171473e-05,
42 0.00010224174184259027,
43 8.755998715059832e-05,
44 0.00010097782796947286,
45 7.315044058486819e-05,
46 0.00013063926598988473
47 ],
48 "n": 8
49 },
50 "idea_parity_note": "Baseline lr union covers every idea lr; baseline penalty fixed to zero."
51 },
52 "idea": {
53 "mean": 0.00010387055726823746,
54 "std": 3.405913194481688e-05,
55 "per_seed": [
56 0.0001575992937432602,
57 8.58209896250628e-05,
58 7.609691965626553e-05,
59 0.00010509935236768797,
60 7.766245835227892e-05,
61 0.00012542385957203805,
62 5.6170345487771556e-05,
63 0.00014709123934153467
64 ],
65 "n": 8,
66 "sweep": [
67 {
68 "cfg": {
69 "lr": 0.01,
70 "epochs": 20,
71 "penalty": 0.01
72 },
73 "mean": 0.00010615413884806912
74 },
75 {
76 "cfg": {
77 "lr": 0.01,
78 "epochs": 20,
79 "penalty": 0.1
80 },
81 "mean": 0.0001076593453035457
82 },
83 {
84 "cfg": {
85 "lr": 0.01,
86 "epochs": 20,
87 "penalty": 1.0
88 },
89 "mean": 0.000183743754405441
90 }
91 ],
92 "best_cfg": {
93 "lr": 0.01,
94 "epochs": 20,
95 "penalty": 0.01
96 }
97 },
98 "comparison": {
99 "delta_mean": 2.2137542146083433e-06,
100 "idea_wins": 4,
101 "n_pairs": 8,
102 "per_seed_diffs": [
103 -1.6670688637532294e-05,
104 1.848447573138401e-05,
105 -9.817449608817697e-07,
106 2.857610525097698e-06,
107 -9.8975287983194e-06,
108 2.44460316025652e-05,
109 -1.6980095097096637e-05,
110 1.645197335164994e-05
111 ],
112 "p_value": 0.70145,
113 "mde": 1.3571445751318616e-05,
114 "mde_rel_pct": 13.350258264721337,
115 "verdict": "no significant win",
116 "system_worked": false
117 },
118 "mechanism_signature": {
119 "math_check": {
120 "max_affine_difference": 0.0,
121 "negative_fraction": 0.0,
122 "max_perturbation_residual": 1.0295876722904796e-15,
123 "pass": true
124 },
125 "prediction": "penalty should reduce negative preactivations and affine ReLU gap",
126 "baseline_observed": {
127 "negative_preactivation_fraction": 0.603515625,
128 "mean_relu_affine_gap": 0.24997861124575138,
129 "finite_difference_output_change": 1.8480932340025902e-08
130 },
131 "idea_observed": {
132 "negative_preactivation_fraction": 0.5734405517578125,
133 "mean_relu_affine_gap": 0.1607181280851364,
134 "finite_difference_output_change": 1.2689270079135895e-08
135 },
136 "confirmed": true
137 },
138 "protocol_notes": {
139 "structural_match": "controlled pendulum rollout is a recurrent dynamics task",
140 "n_train": 1200,
141 "n_test": 400
142 }
143}