Conditioned Irregular-Delay State Encoder / bench_report.json

Failed on benchmark

Raw ⬇ ZIP
  1{
  2  "bench_version": "local_fallback_no_harness",
  3  "track": "dynamics",
  4  "model": "shared DelayGRU",
  5  "metric_direction": "lower is better",
  6  "n_seeds": 8,
  7  "baseline": {
  8    "best_cfg": {
  9      "lr": 0.006,
 10      "wd": 0.0
 11    },
 12    "sweep": [
 13      {
 14        "cfg": {
 15          "lr": 0.001,
 16          "wd": 0.0
 17        },
 18        "mean": 0.6801233738660812
 19      },
 20      {
 21        "cfg": {
 22          "lr": 0.001,
 23          "wd": 0.0001
 24        },
 25        "mean": 0.6801258623600006
 26      },
 27      {
 28        "cfg": {
 29          "lr": 0.003,
 30          "wd": 0.0
 31        },
 32        "mean": 0.35754771530628204
 33      },
 34      {
 35        "cfg": {
 36          "lr": 0.003,
 37          "wd": 0.0001
 38        },
 39        "mean": 0.3575517013669014
 40      },
 41      {
 42        "cfg": {
 43          "lr": 0.006,
 44          "wd": 0.0
 45        },
 46        "mean": 0.16513000801205635
 47      },
 48      {
 49        "cfg": {
 50          "lr": 0.006,
 51          "wd": 0.0001
 52        },
 53        "mean": 0.16513226553797722
 54      }
 55    ],
 56    "full": {
 57      "mean": 0.17238342948257923,
 58      "std": 0.023754673289860206,
 59      "per_seed": [
 60        0.15474747121334076,
 61        0.1601465791463852,
 62        0.16793453693389893,
 63        0.17769144475460052,
 64        0.16201430559158325,
 65        0.2271566540002823,
 66        0.15431520342826843,
 67        0.17506124079227448
 68      ],
 69      "n": 8
 70    }
 71  },
 72  "idea": {
 73    "mean": 0.17108880542218685,
 74    "std": 0.022775696321881225,
 75    "per_seed": [
 76      0.15279607474803925,
 77      0.1616012454032898,
 78      0.16678939759731293,
 79      0.1741822063922882,
 80      0.15894076228141785,
 81      0.2237611562013626,
 82      0.15557505190372467,
 83      0.1750645488500595
 84    ],
 85    "n": 8,
 86    "best_cfg": {
 87      "lr": 0.006,
 88      "wd": 0.0
 89    },
 90    "grid": [
 91      {
 92        "cfg": {
 93          "lr": 0.001,
 94          "wd": 0.0
 95        },
 96        "mean": 0.6519463434815407
 97      },
 98      {
 99        "cfg": {
100          "lr": 0.003,
101          "wd": 0.0
102        },
103        "mean": 0.3875108100473881
104      },
105      {
106        "cfg": {
107          "lr": 0.006,
108          "wd": 0.0
109        },
110        "mean": 0.17108880542218685
111      }
112    ]
113  },
114  "comparison": {
115    "delta_mean": -0.0012946240603923798,
116    "idea_wins": 5,
117    "n_pairs": 8,
118    "per_seed_diffs": [
119      -0.0019513964653015137,
120      0.001454666256904602,
121      -0.0011451393365859985,
122      -0.003509238362312317,
123      -0.0030735433101654053,
124      -0.0033954977989196777,
125      0.0012598484754562378,
126      3.3080577850341797e-06
127    ],
128    "p_value": 0.1247937603119844,
129    "verdict": "idea better (not significant)",
130    "system_worked": false
131  },
132  "mechanism_signature": {
133    "prediction": "reconstruction/prediction error grows approximately linearly with observation noise (inverse observability intuition)",
134    "observed_loglog_slopes": {
135      "baseline": 0.0070740981333970365,
136      "idea": 0.007060657411190435
137    },
138    "per_noise": [
139      {
140        "sigma": 0.01,
141        "baseline_rmse": 0.3934699594974518,
142        "idea_rmse": 0.3909880518913269
143      },
144      {
145        "sigma": 0.03,
146        "baseline_rmse": 0.394115686416626,
147        "idea_rmse": 0.3916374146938324
148      },
149      {
150        "sigma": 0.06,
151        "baseline_rmse": 0.3962407410144806,
152        "idea_rmse": 0.3937460780143738
153      },
154      {
155        "sigma": 0.1,
156        "baseline_rmse": 0.40119439363479614,
157        "idea_rmse": 0.398638516664505
158      },
159      {
160        "sigma": 0.01,
161        "baseline_rmse": 0.4001429080963135,
162        "idea_rmse": 0.4019409716129303
163      },
164      {
165        "sigma": 0.03,
166        "baseline_rmse": 0.40048766136169434,
167        "idea_rmse": 0.40225452184677124
168      },
169      {
170        "sigma": 0.06,
171        "baseline_rmse": 0.4020640552043915,
172        "idea_rmse": 0.40378326177597046
173      },
174      {
175        "sigma": 0.1,
176        "baseline_rmse": 0.40611129999160767,
177        "idea_rmse": 0.4077668786048889
178      },
179      {
180        "sigma": 0.01,
181        "baseline_rmse": 0.4102720320224762,
182        "idea_rmse": 0.40883108973503113
183      },
184      {
185        "sigma": 0.03,
186        "baseline_rmse": 0.41178008913993835,
187        "idea_rmse": 0.41025447845458984
188      },
189      {
190        "sigma": 0.06,
191        "baseline_rmse": 0.4154220521450043,
192        "idea_rmse": 0.41376587748527527
193      },
194      {
195        "sigma": 0.1,
196        "baseline_rmse": 0.42276376485824585,
197        "idea_rmse": 0.4209310710430145
198      },
199      {
200        "sigma": 0.01,
201        "baseline_rmse": 0.421396940946579,
202        "idea_rmse": 0.4172685146331787
203      },
204      {
205        "sigma": 0.03,
206        "baseline_rmse": 0.4214303195476532,
207        "idea_rmse": 0.4174094498157501
208      },
209      {
210        "sigma": 0.06,
211        "baseline_rmse": 0.4222506880760193,
212        "idea_rmse": 0.41838502883911133
213      },
214      {
215        "sigma": 0.1,
216        "baseline_rmse": 0.4247669279575348,
217        "idea_rmse": 0.42109447717666626
218      }
219    ],
220    "confirmed": false
221  },
222  "protocol_note": "Official /home/maxwelhelp/all/math2nn/bench and README were absent; this is a local fallback and is not official harness evidence."
223}