Finite-Horizon Hidden-State Observability Regularizer / bench_report.json

Failed on benchmark

Raw ⬇ ZIP
  1{
  2  "bench_version": 1,
  3  "track": "dynamics",
  4  "model": "rnn_small",
  5  "metric_direction": "lower is better",
  6  "n_seeds": 8,
  7  "baseline": {
  8    "best_cfg": {
  9      "lr": 0.006
 10    },
 11    "sweep": [
 12      {
 13        "cfg": {
 14          "lr": 0.0015
 15        },
 16        "mean": 0.33852236717939377
 17      },
 18      {
 19        "cfg": {
 20          "lr": 0.003
 21        },
 22        "mean": 0.024998844717629254
 23      },
 24      {
 25        "cfg": {
 26          "lr": 0.006
 27        },
 28        "mean": 0.0168350946623832
 29      }
 30    ],
 31    "full": {
 32      "mean": 0.019937668344937265,
 33      "std": 0.013005039202094617,
 34      "per_seed": [
 35        0.03213806077837944,
 36        0.009990346617996693,
 37        0.010487839579582214,
 38        0.014724131673574448,
 39        0.04623213782906532,
 40        0.006986701861023903,
 41        0.011433426290750504,
 42        0.027508702129125595
 43      ],
 44      "n": 8
 45    }
 46  },
 47  "idea": {
 48    "per_seed": [
 49      0.032140087336301804,
 50      0.010026148520410061,
 51      0.010492031462490559,
 52      0.01471502985805273,
 53      0.04622451215982437,
 54      0.006962496321648359,
 55      0.011483874171972275,
 56      0.02751341462135315
 57    ],
 58    "mean": 0.019944699306506664,
 59    "std": 0.013896786279171906
 60  },
 61  "comparison": {
 62    "delta_mean": 7.030961569398642e-06,
 63    "idea_wins": 3,
 64    "n_pairs": 8,
 65    "per_seed_diffs": [
 66      2.0265579223632812e-06,
 67      3.5801902413368225e-05,
 68      4.191882908344269e-06,
 69      -9.101815521717072e-06,
 70      -7.625669240951538e-06,
 71      -2.4205539375543594e-05,
 72      5.044788122177124e-05,
 73      4.712492227554321e-06
 74    ],
 75    "p_value": 0.45785,
 76    "mde": 2.0486566875431273e-05,
 77    "mde_rel_pct": 0.10275307283177568,
 78    "verdict": "no measurable effect",
 79    "system_worked": false
 80  },
 81  "mechanism_signature": {
 82    "prediction": "For T=1, m >= n/2 is the counting threshold for full rank.",
 83    "baseline_trained_model": {
 84      "state_dim": 64,
 85      "horizon_T": 1,
 86      "predicted_counting_threshold_m": 32,
 87      "observed": [
 88        {
 89          "m": 8,
 90          "predicted_rank_upper_bound_T1": 16,
 91          "observed_rank_T1": 16,
 92          "observed_smin": 0.03744511306285858,
 93          "observed_logdet": -383.529296875
 94        },
 95        {
 96          "m": 16,
 97          "predicted_rank_upper_bound_T1": 32,
 98          "observed_rank_T1": 32,
 99          "observed_smin": 0.028290288522839546,
100          "observed_logdet": -327.2057189941406
101        },
102        {
103          "m": 32,
104          "predicted_rank_upper_bound_T1": 64,
105          "observed_rank_T1": 64,
106          "observed_smin": 4.912145959679037e-05,
107          "observed_logdet": -227.1643829345703
108        }
109      ],
110      "confirmed": true
111    },
112    "idea_trained_model": {
113      "state_dim": 64,
114      "horizon_T": 1,
115      "predicted_counting_threshold_m": 32,
116      "observed": [
117        {
118          "m": 8,
119          "predicted_rank_upper_bound_T1": 16,
120          "observed_rank_T1": 16,
121          "observed_smin": 0.04268581420183182,
122          "observed_logdet": -381.6462097167969
123        },
124        {
125          "m": 16,
126          "predicted_rank_upper_bound_T1": 32,
127          "observed_rank_T1": 32,
128          "observed_smin": 0.02824431285262108,
129          "observed_logdet": -325.7181701660156
130        },
131        {
132          "m": 32,
133          "predicted_rank_upper_bound_T1": 64,
134          "observed_rank_T1": 64,
135          "observed_smin": 0.0018923624884337187,
136          "observed_logdet": -225.09347534179688
137        }
138      ],
139      "confirmed": true
140    }
141  },
142  "idea_sweep": {
143    "0.0015": {
144      "per_seed": [
145        0.2595526874065399,
146        0.3410550355911255,
147        0.31123819947242737,
148        0.4425976574420929,
149        0.19178999960422516,
150        0.34441572427749634,
151        0.3199017643928528,
152        0.3680892884731293
153      ],
154      "mean": 0.32233004458248615,
155      "std": 0.07416895300576867
156    },
157    "0.003": {
158      "per_seed": [
159        0.03490198403596878,
160        0.014994751662015915,
161        0.0031942580826580524,
162        0.046722445636987686,
163        0.06990749388933182,
164        0.01345915999263525,
165        0.008423914201557636,
166        0.06726980954408646
167      ],
168      "mean": 0.0323592271306552,
169      "std": 0.02652120695991089
170    },
171    "0.006": {
172      "per_seed": [
173        0.032140087336301804,
174        0.010026148520410061,
175        0.010492031462490559,
176        0.01471502985805273,
177        0.04622451215982437,
178        0.006962496321648359,
179        0.011483874171972275,
180        0.02751341462135315
181      ],
182      "mean": 0.019944699306506664,
183      "std": 0.013896786279171906
184    }
185  },
186  "protocol_notes": "Baseline sweep uses the same three learning rates as the idea; idea adds only finite-horizon logdet loss."
187}