Residual-screened Koopman latent bottleneck / bench_report.json
Mechanism confirmed, baseline not beaten
1{
2 "bench_version": 1,
3 "track": "dynamics",
4 "model": "rnn_small",
5 "metric_direction": "lower is better",
6 "n_seeds": 8,
7 "baseline": {
8 "best_cfg": {
9 "lr": 0.006
10 },
11 "sweep": [
12 {
13 "cfg": {
14 "lr": 0.001
15 },
16 "mean": 0.006104337517172098
17 },
18 {
19 "cfg": {
20 "lr": 0.003
21 },
22 "mean": 0.0017399389762431383
23 },
24 {
25 "cfg": {
26 "lr": 0.006
27 },
28 "mean": 0.0012507251958595589
29 }
30 ],
31 "full": {
32 "mean": 0.001170862014987506,
33 "std": 0.0004510333101838233,
34 "per_seed": [
35 0.000902677362319082,
36 0.0019194456981495023,
37 0.0005950153572484851,
38 0.0015857623657211661,
39 0.0008504731813445687,
40 0.000836688035633415,
41 0.0016707839677110314,
42 0.001006050151772797
43 ],
44 "n": 8
45 }
46 },
47 "idea": {
48 "mean": 0.0011421147792134434,
49 "std": 0.00044998942636985775,
50 "per_seed": [
51 0.0008761535282246768,
52 0.0019359904108569026,
53 0.0006074620177969337,
54 0.0015396701637655497,
55 0.0007932198350317776,
56 0.0007940693758428097,
57 0.0015995833091437817,
58 0.0009907695930451155
59 ],
60 "n": 8
61 },
62 "comparison": {
63 "delta_mean": -2.8747235774062574e-05,
64 "idea_wins": 6,
65 "n_pairs": 8,
66 "per_seed_diffs": [
67 -2.6523834094405174e-05,
68 1.6544712707400322e-05,
69 1.2446660548448563e-05,
70 -4.6092201955616474e-05,
71 -5.725334631279111e-05,
72 -4.261865979060531e-05,
73 -7.120065856724977e-05,
74 -1.5280558727681637e-05
75 ],
76 "p_value": 0.05535,
77 "mde": 2.6522118750884212e-05,
78 "mde_rel_pct": 2.265178852109847,
79 "verdict": "no significant win",
80 "system_worked": false
81 },
82 "mechanism_signature": {
83 "mechanism_signature": {
84 "mean_residual": 0.6372732743620872,
85 "retained_modes": 48.0,
86 "retained_fraction": 0.75,
87 "fit_rmse": 0.015746959019452333,
88 "latent_step_rms": 0.16071157343685627,
89 "predicted_vs_observed": {
90 "predicted_retained_fraction": 0.75,
91 "observed_retained_fraction": 0.75,
92 "prediction": "screening retains approximately the lower 75% residual modes"
93 },
94 "confirmed": true
95 },
96 "idea_lr_runs": {
97 "0.001": {
98 "mean": 0.005698318331269547,
99 "std": 0.0013604234038858917,
100 "per_seed": [
101 0.00519864447414875,
102 0.008421543054282665,
103 0.005426613613963127,
104 0.005435609724372625,
105 0.00428318977355957,
106 0.0038333924021571875,
107 0.006848391145467758,
108 0.006139162462204695
109 ],
110 "n": 8
111 },
112 "0.003": {
113 "mean": 0.0016669390752213076,
114 "std": 0.0002611493893328423,
115 "per_seed": [
116 0.002052778610959649,
117 0.0019236018415540457,
118 0.0013689034385606647,
119 0.0015125471400097013,
120 0.0015859621344134212,
121 0.0015673021553084254,
122 0.0019797401037067175,
123 0.0013446771772578359
124 ],
125 "n": 8
126 },
127 "0.006": {
128 "mean": 0.0011421147792134434,
129 "std": 0.00044998942636985775,
130 "per_seed": [
131 0.0008761535282246768,
132 0.0019359904108569026,
133 0.0006074620177969337,
134 0.0015396701637655497,
135 0.0007932198350317776,
136 0.0007940693758428097,
137 0.0015995833091437817,
138 0.0009907695930451155
139 ],
140 "n": 8
141 }
142 },
143 "architecture_match": "same bench rnn_small GRU and head; only residual loss differs",
144 "alpha": 0.03,
145 "quantile": 0.75
146 },
147 "protocol_notes": {
148 "baseline_grid": [
149 0.001,
150 0.003,
151 0.006
152 ],
153 "idea_grid": [
154 0.001,
155 0.003,
156 0.006
157 ],
158 "epochs": 15,
159 "batch": 128,
160 "n_train": 400,
161 "n_test": 400,
162 "selection": "baseline selected by four-seed sweep; idea best selected among same grid",
163 "structural_match": "controlled pendulum dynamics requires temporal latent stability"
164 }
165}