Finite-Candidate Neural Reference Shield / bench_report.json

Mechanism confirmed, baseline not beaten

Raw ⬇ ZIP
  1{
  2  "bench_version": 1,
  3  "track": "dynamics",
  4  "model": "rnn_small",
  5  "metric_direction": "lower is better",
  6  "n_seeds": 8,
  7  "baseline": {
  8    "best_cfg": {
  9      "lr": 0.005
 10    },
 11    "sweep": [
 12      {
 13        "cfg": {
 14          "lr": 0.001
 15        },
 16        "mean": 0.0014035784406587481
 17      },
 18      {
 19        "cfg": {
 20          "lr": 0.003
 21        },
 22        "mean": 0.000857145045301877
 23      },
 24      {
 25        "cfg": {
 26          "lr": 0.005
 27        },
 28        "mean": 0.000637838282273151
 29      }
 30    ],
 31    "full": {
 32      "mean": 0.0006355784062179737,
 33      "std": 0.00018562462201799073,
 34      "per_seed": [
 35        0.0005684797652065754,
 36        0.0006359252729453146,
 37        0.0004176601651124656,
 38        0.0009292879258282483,
 39        0.0004875308950431645,
 40        0.0004790188977494836,
 41        0.0006295977509580553,
 42        0.0009371265769004822
 43      ],
 44      "n": 8
 45    },
 46    "parity_full": [
 47      {
 48        "cfg": {
 49          "lr": 0.001
 50        },
 51        "full": {
 52          "mean": 0.0016591226740274578,
 53          "std": 0.0005884083669493902,
 54          "per_seed": [
 55            0.0011428100988268852,
 56            0.001511492533609271,
 57            0.001185992150567472,
 58            0.0017740189796313643,
 59            0.0012394130462780595,
 60            0.0013388715451583266,
 61            0.002085721120238304,
 62            0.00299466191790998
 63          ],
 64          "n": 8
 65        }
 66      },
 67      {
 68        "cfg": {
 69          "lr": 0.003
 70        },
 71        "full": {
 72          "mean": 0.0009047073835972697,
 73          "std": 0.00019738432718009543,
 74          "per_seed": [
 75            0.0007076333276927471,
 76            0.0008893113117665052,
 77            0.0007631920161657035,
 78            0.001068443525582552,
 79            0.0006572386482730508,
 80            0.0008406317210756242,
 81            0.0010242111748084426,
 82            0.0012869973434135318
 83          ],
 84          "n": 8
 85        }
 86      },
 87      {
 88        "cfg": {
 89          "lr": 0.005
 90        },
 91        "full": {
 92          "mean": 0.0006355784062179737,
 93          "std": 0.00018562462201799073,
 94          "per_seed": [
 95            0.0005684797652065754,
 96            0.0006359252729453146,
 97            0.0004176601651124656,
 98            0.0009292879258282483,
 99            0.0004875308950431645,
100            0.0004790188977494836,
101            0.0006295977509580553,
102            0.0009371265769004822
103          ],
104          "n": 8
105        }
106      }
107    ]
108  },
109  "idea": {
110    "mean": 0.05243536550551653,
111    "std": 0.008883196341761043,
112    "per_seed": [
113      0.04108409211039543,
114      0.05810997262597084,
115      0.05400923267006874,
116      0.06831105798482895,
117      0.05535797029733658,
118      0.03811589255928993,
119      0.053262870758771896,
120      0.051231835037469864
121    ],
122    "n": 8
123  },
124  "comparison": {
125    "delta_mean": 0.051799787099298555,
126    "idea_wins": 0,
127    "n_pairs": 8,
128    "per_seed_diffs": [
129      0.040515612345188856,
130      0.057474047353025526,
131      0.053591572504956275,
132      0.0673817700590007,
133      0.054870439402293414,
134      0.03763687366154045,
135      0.05263327300781384,
136      0.05029470846056938
137    ],
138    "p_value": 0.0081,
139    "mde": 0.007859816836150254,
140    "mde_rel_pct": 1236.640005270208,
141    "verdict": "idea worse (significant)",
142    "system_worked": false
143  },
144  "mechanism_signature": {
145    "bound": 1.0,
146    "n_test": 400,
147    "interior_fraction": 0.72,
148    "interior_identity_max_error": 0.0,
149    "max_constraint_violation": 0.0,
150    "mean_shaping_distance": 0.08201595395803452,
151    "predicted_interior_error": 0.0,
152    "predicted_max_violation": 0.0,
153    "confirmed": true,
154    "math_check": {
155      "max_error_vs_slsqp": 1.8546459140785727e-08,
156      "max_constraint_violation": 3.3306690738754696e-16,
157      "interior_identity_max_error": 0.0,
158      "n_reference": 90
159    },
160    "trained_baseline_mean": 0.0006355784062179737,
161    "trained_idea_best_mean": 0.05243536550551653
162  },
163  "idea_sweep": [
164    {
165      "cfg": {
166        "lr": 0.001
167      },
168      "full": {
169        "mean": 0.05274156527593732,
170        "std": 0.008962000698782165,
171        "per_seed": [
172          0.04126017168164253,
173          0.05878905951976776,
174          0.054237402975559235,
175          0.06873083114624023,
176          0.05547387897968292,
177          0.03838273882865906,
178          0.053651560097932816,
179          0.05140687897801399
180        ],
181        "n": 8
182      }
183    },
184    {
185      "cfg": {
186        "lr": 0.003
187      },
188      "full": {
189        "mean": 0.05250410409644246,
190        "std": 0.00887397537778388,
191        "per_seed": [
192          0.04117707535624504,
193          0.05814062058925629,
194          0.054112356156110764,
195          0.06837401539087296,
196          0.055376794189214706,
197          0.03818747028708458,
198          0.05337858572602272,
199          0.051285915076732635
200        ],
201        "n": 8
202      }
203    },
204    {
205      "cfg": {
206        "lr": 0.005
207      },
208      "full": {
209        "mean": 0.05243536550551653,
210        "std": 0.008883196341761043,
211        "per_seed": [
212          0.04108409211039543,
213          0.05810997262597084,
214          0.05400923267006874,
215          0.06831105798482895,
216          0.05535797029733658,
217          0.03811589255928993,
218          0.053262870758771896,
219          0.051231835037469864
220        ],
221        "n": 8
222      }
223    }
224  ],
225  "runtime_sec": 95.81617069244385
226}