Finite-Horizon Hidden-State Observability Regularizer / bench_report.json
Failed on benchmark
1{
2 "bench_version": 1,
3 "track": "dynamics",
4 "model": "rnn_small",
5 "metric_direction": "lower is better",
6 "n_seeds": 8,
7 "baseline": {
8 "best_cfg": {
9 "lr": 0.006
10 },
11 "sweep": [
12 {
13 "cfg": {
14 "lr": 0.0015
15 },
16 "mean": 0.33852236717939377
17 },
18 {
19 "cfg": {
20 "lr": 0.003
21 },
22 "mean": 0.024998844717629254
23 },
24 {
25 "cfg": {
26 "lr": 0.006
27 },
28 "mean": 0.0168350946623832
29 }
30 ],
31 "full": {
32 "mean": 0.019937668344937265,
33 "std": 0.013005039202094617,
34 "per_seed": [
35 0.03213806077837944,
36 0.009990346617996693,
37 0.010487839579582214,
38 0.014724131673574448,
39 0.04623213782906532,
40 0.006986701861023903,
41 0.011433426290750504,
42 0.027508702129125595
43 ],
44 "n": 8
45 }
46 },
47 "idea": {
48 "per_seed": [
49 0.032140087336301804,
50 0.010026148520410061,
51 0.010492031462490559,
52 0.01471502985805273,
53 0.04622451215982437,
54 0.006962496321648359,
55 0.011483874171972275,
56 0.02751341462135315
57 ],
58 "mean": 0.019944699306506664,
59 "std": 0.013896786279171906
60 },
61 "comparison": {
62 "delta_mean": 7.030961569398642e-06,
63 "idea_wins": 3,
64 "n_pairs": 8,
65 "per_seed_diffs": [
66 2.0265579223632812e-06,
67 3.5801902413368225e-05,
68 4.191882908344269e-06,
69 -9.101815521717072e-06,
70 -7.625669240951538e-06,
71 -2.4205539375543594e-05,
72 5.044788122177124e-05,
73 4.712492227554321e-06
74 ],
75 "p_value": 0.45785,
76 "mde": 2.0486566875431273e-05,
77 "mde_rel_pct": 0.10275307283177568,
78 "verdict": "no measurable effect",
79 "system_worked": false
80 },
81 "mechanism_signature": {
82 "prediction": "For T=1, m >= n/2 is the counting threshold for full rank.",
83 "baseline_trained_model": {
84 "state_dim": 64,
85 "horizon_T": 1,
86 "predicted_counting_threshold_m": 32,
87 "observed": [
88 {
89 "m": 8,
90 "predicted_rank_upper_bound_T1": 16,
91 "observed_rank_T1": 16,
92 "observed_smin": 0.03744511306285858,
93 "observed_logdet": -383.529296875
94 },
95 {
96 "m": 16,
97 "predicted_rank_upper_bound_T1": 32,
98 "observed_rank_T1": 32,
99 "observed_smin": 0.028290288522839546,
100 "observed_logdet": -327.2057189941406
101 },
102 {
103 "m": 32,
104 "predicted_rank_upper_bound_T1": 64,
105 "observed_rank_T1": 64,
106 "observed_smin": 4.912145959679037e-05,
107 "observed_logdet": -227.1643829345703
108 }
109 ],
110 "confirmed": true
111 },
112 "idea_trained_model": {
113 "state_dim": 64,
114 "horizon_T": 1,
115 "predicted_counting_threshold_m": 32,
116 "observed": [
117 {
118 "m": 8,
119 "predicted_rank_upper_bound_T1": 16,
120 "observed_rank_T1": 16,
121 "observed_smin": 0.04268581420183182,
122 "observed_logdet": -381.6462097167969
123 },
124 {
125 "m": 16,
126 "predicted_rank_upper_bound_T1": 32,
127 "observed_rank_T1": 32,
128 "observed_smin": 0.02824431285262108,
129 "observed_logdet": -325.7181701660156
130 },
131 {
132 "m": 32,
133 "predicted_rank_upper_bound_T1": 64,
134 "observed_rank_T1": 64,
135 "observed_smin": 0.0018923624884337187,
136 "observed_logdet": -225.09347534179688
137 }
138 ],
139 "confirmed": true
140 }
141 },
142 "idea_sweep": {
143 "0.0015": {
144 "per_seed": [
145 0.2595526874065399,
146 0.3410550355911255,
147 0.31123819947242737,
148 0.4425976574420929,
149 0.19178999960422516,
150 0.34441572427749634,
151 0.3199017643928528,
152 0.3680892884731293
153 ],
154 "mean": 0.32233004458248615,
155 "std": 0.07416895300576867
156 },
157 "0.003": {
158 "per_seed": [
159 0.03490198403596878,
160 0.014994751662015915,
161 0.0031942580826580524,
162 0.046722445636987686,
163 0.06990749388933182,
164 0.01345915999263525,
165 0.008423914201557636,
166 0.06726980954408646
167 ],
168 "mean": 0.0323592271306552,
169 "std": 0.02652120695991089
170 },
171 "0.006": {
172 "per_seed": [
173 0.032140087336301804,
174 0.010026148520410061,
175 0.010492031462490559,
176 0.01471502985805273,
177 0.04622451215982437,
178 0.006962496321648359,
179 0.011483874171972275,
180 0.02751341462135315
181 ],
182 "mean": 0.019944699306506664,
183 "std": 0.013896786279171906
184 }
185 },
186 "protocol_notes": "Baseline sweep uses the same three learning rates as the idea; idea adds only finite-horizon logdet loss."
187}