Positive-envelope stability for complex state updates / bench_report.json
Mechanism confirmed, baseline not beaten
1{
2 "bench_version": 1,
3 "track": "dynamics",
4 "model": "factor_rnn",
5 "metric_direction": "lower is better",
6 "n_seeds": 8,
7 "baseline": {
8 "best_cfg": {
9 "lr": 0.006,
10 "epochs": 18,
11 "beta": 0.0
12 },
13 "sweep": [
14 {
15 "cfg": {
16 "lr": 0.0015,
17 "epochs": 18,
18 "beta": 0.0
19 },
20 "mean": 0.11639470420777798
21 },
22 {
23 "cfg": {
24 "lr": 0.003,
25 "epochs": 18,
26 "beta": 0.0
27 },
28 "mean": 0.058107024524360895
29 },
30 {
31 "cfg": {
32 "lr": 0.006,
33 "epochs": 18,
34 "beta": 0.0
35 },
36 "mean": 0.026168195763602853
37 }
38 ],
39 "full": {
40 "mean": 0.02109241997823119,
41 "std": 0.014265532680015599,
42 "per_seed": [
43 0.05811716988682747,
44 0.019254598766565323,
45 0.013698350638151169,
46 0.01360266376286745,
47 0.014953133650124073,
48 0.012289082631468773,
49 0.021011028438806534,
50 0.015813332051038742
51 ],
52 "n": 8
53 },
54 "full_all_union": [
55 {
56 "cfg": {
57 "lr": 0.0015,
58 "epochs": 18,
59 "beta": 0.0
60 },
61 "mean": 0.08842666260898113,
62 "std": 0.06345898927987136,
63 "per_seed": [
64 0.2491457462310791,
65 0.04528465121984482,
66 0.08107621967792511,
67 0.09007219970226288,
68 0.05925949290394783,
69 0.04771618917584419,
70 0.09064487367868423,
71 0.044213928282260895
72 ],
73 "n": 8
74 },
75 {
76 "cfg": {
77 "lr": 0.003,
78 "epochs": 18,
79 "beta": 0.0
80 },
81 "mean": 0.04415802680887282,
82 "std": 0.03152132845115148,
83 "per_seed": [
84 0.1255890429019928,
85 0.02912258543074131,
86 0.03296443447470665,
87 0.04475203529000282,
88 0.029448043555021286,
89 0.025108061730861664,
90 0.041623830795288086,
91 0.024656180292367935
92 ],
93 "n": 8
94 },
95 {
96 "cfg": {
97 "lr": 0.006,
98 "epochs": 18,
99 "beta": 0.0
100 },
101 "mean": 0.02109241997823119,
102 "std": 0.014265532680015599,
103 "per_seed": [
104 0.05811716988682747,
105 0.019254598766565323,
106 0.013698350638151169,
107 0.01360266376286745,
108 0.014953133650124073,
109 0.012289082631468773,
110 0.021011028438806534,
111 0.015813332051038742
112 ],
113 "n": 8
114 }
115 ]
116 },
117 "idea": {
118 "mean": 0.022512523224577308,
119 "std": 0.012331270086282655,
120 "per_seed": [
121 0.04500043764710426,
122 0.017105672508478165,
123 0.03219568356871605,
124 0.034598458558321,
125 0.01256189402192831,
126 0.008819940499961376,
127 0.019357675686478615,
128 0.010460423305630684
129 ],
130 "n": 8
131 },
132 "comparison": {
133 "delta_mean": 0.001420103246346116,
134 "idea_wins": 6,
135 "n_pairs": 8,
136 "per_seed_diffs": [
137 -0.013116732239723206,
138 -0.002148926258087158,
139 0.01849733293056488,
140 0.02099579479545355,
141 -0.0023912396281957626,
142 -0.0034691421315073967,
143 -0.001653352752327919,
144 -0.005352908745408058
145 ],
146 "p_value": 0.78325,
147 "mde": 0.009957143075416026,
148 "mde_rel_pct": 47.20721038976311,
149 "verdict": "no significant win",
150 "system_worked": false
151 },
152 "mechanism_signature": {
153 "track_structure": "controlled pendulum multi-step dynamics",
154 "metric": 0.04500043764710426,
155 "max_component_violation": -0.35021981596946716,
156 "max_observed_ratio": 0.7172038555145264,
157 "predicted_bound": "nonpositive violation",
158 "observed_envelope_row_sum": 2.4505488872528076,
159 "observed_sum_abs_A": 45.71932601928711,
160 "observed_sum_P": 65.28011322021484,
161 "confirmed": true,
162 "config": {
163 "lr": 0.006,
164 "epochs": 18,
165 "beta": 0.02,
166 "target": 0.92
167 },
168 "wall_seconds": 27.75654865699471
169 },
170 "idea_grid": [
171 {
172 "cfg": {
173 "lr": 0.0015,
174 "epochs": 18,
175 "beta": 0.005,
176 "target": 0.92
177 },
178 "mean": 0.09474506694823503,
179 "std": 0.10094635313979229,
180 "per_seed": [
181 0.35983920097351074,
182 0.059099163860082626,
183 0.058137185871601105,
184 0.07874950021505356,
185 0.054427292197942734,
186 0.044902503490448,
187 0.0674169585108757,
188 0.035388730466365814
189 ],
190 "n": 8
191 },
192 {
193 "cfg": {
194 "lr": 0.003,
195 "epochs": 18,
196 "beta": 0.01,
197 "target": 0.92
198 },
199 "mean": 0.036793723003938794,
200 "std": 0.02819267034786451,
201 "per_seed": [
202 0.1090393140912056,
203 0.0328064002096653,
204 0.026808833703398705,
205 0.040870074182748795,
206 0.023899797350168228,
207 0.01856924220919609,
208 0.024410061538219452,
209 0.017946060746908188
210 ],
211 "n": 8
212 },
213 {
214 "cfg": {
215 "lr": 0.006,
216 "epochs": 18,
217 "beta": 0.02,
218 "target": 0.92
219 },
220 "mean": 0.022512523224577308,
221 "std": 0.012331270086282655,
222 "per_seed": [
223 0.04500043764710426,
224 0.017105672508478165,
225 0.03219568356871605,
226 0.034598458558321,
227 0.01256189402192831,
228 0.008819940499961376,
229 0.019357675686478615,
230 0.010460423305630684
231 ],
232 "n": 8
233 }
234 ],
235 "device": "cuda",
236 "note": "Baseline and idea are end-to-end trained systems with identical FactorRNN architecture; only envelope loss differs. All shared learning rates were evaluated on the same eight paired seeds."
237}