Horizon-Adaptive Neural Tube Rollouts / bench_report.json

Failed on benchmark

Raw ⬇ ZIP
  1{
  2  "bench_version": 1,
  3  "track": "dynamics",
  4  "model": "rnn_small",
  5  "metric_direction": "lower is better",
  6  "n_seeds": 8,
  7  "baseline": {
  8    "best_cfg": {
  9      "lr": 0.001
 10    },
 11    "sweep": [
 12      {
 13        "cfg": {
 14          "lr": 0.001
 15        },
 16        "mean": 0.8349032551050186
 17      },
 18      {
 19        "cfg": {
 20          "lr": 0.003
 21        },
 22        "mean": 0.8359973579645157
 23      },
 24      {
 25        "cfg": {
 26          "lr": 0.006
 27        },
 28        "mean": 0.8355543166399002
 29      }
 30    ],
 31    "full": {
 32      "mean": 0.7859984934329987,
 33      "std": 0.07510655446575974,
 34      "per_seed": [
 35        0.8355869054794312,
 36        0.7388775944709778,
 37        0.8546704053878784,
 38        0.9104781150817871,
 39        0.7400559186935425,
 40        0.7168379426002502,
 41        0.8168118000030518,
 42        0.6746692657470703
 43      ],
 44      "n": 8
 45    }
 46  },
 47  "idea": {
 48    "mean": 0.7857095971703529,
 49    "std": 0.07640934958971482,
 50    "per_seed": [
 51      0.8372436761856079,
 52      0.7375508546829224,
 53      0.8549157381057739,
 54      0.9125410914421082,
 55      0.7379266023635864,
 56      0.7164239287376404,
 57      0.8165872693061829,
 58      0.6724876165390015
 59    ],
 60    "n": 8
 61  },
 62  "comparison": {
 63    "delta_mean": -0.00028889626264572144,
 64    "idea_wins": 5,
 65    "n_pairs": 8,
 66    "per_seed_diffs": [
 67      0.0016567707061767578,
 68      -0.00132673978805542,
 69      0.0002453327178955078,
 70      0.002062976360321045,
 71      -0.0021293163299560547,
 72      -0.0004140138626098633,
 73      -0.00022453069686889648,
 74      -0.0021816492080688477
 75    ],
 76    "p_value": 0.58005,
 77    "mde": 0.0013284398908388765,
 78    "mde_rel_pct": 0.16901303271418006,
 79    "verdict": "no measurable effect",
 80    "system_worked": false
 81  },
 82  "mechanism_signature": {
 83    "quantity": "absolute local Jacobian gain vs finite-difference gain",
 84    "predicted_mean": [
 85      0.02751869708299637,
 86      0.04405847191810608,
 87      0.040442872792482376,
 88      0.07109975069761276
 89    ],
 90    "observed_mean": [
 91      0.019221652299165726,
 92      0.029958780854940414,
 93      0.018909338861703873,
 94      0.0590406097471714
 95    ],
 96    "correlation": 0.9556240583468331,
 97    "relative_error": 0.5613289126670399,
 98    "confirmed": false
 99  },
100  "idea_sweep": [
101    {
102      "cfg": {
103        "lr": 0.001,
104        "lam": 0.03
105      },
106      "result": {
107        "mean": 0.7859929502010345,
108        "std": 0.07511012743166294,
109        "per_seed": [
110          0.8355842232704163,
111          0.7388842105865479,
112          0.8546649217605591,
113          0.9104771614074707,
114          0.740043580532074,
115          0.7168059349060059,
116          0.8168159127235413,
117          0.6746676564216614
118        ],
119        "n": 8
120      }
121    },
122    {
123      "cfg": {
124        "lr": 0.003,
125        "lam": 0.03
126      },
127      "result": {
128        "mean": 0.7857807502150536,
129        "std": 0.07594789968969756,
130        "per_seed": [
131          0.8376532196998596,
132          0.7396882176399231,
133          0.8549769520759583,
134          0.9116700887680054,
135          0.738188624382019,
136          0.7167485356330872,
137          0.814774215221405,
138          0.6725461483001709
139        ],
140        "n": 8
141      }
142    },
143    {
144      "cfg": {
145        "lr": 0.006,
146        "lam": 0.03
147      },
148      "result": {
149        "mean": 0.7857095971703529,
150        "std": 0.07640934958971482,
151        "per_seed": [
152          0.8372436761856079,
153          0.7375508546829224,
154          0.8549157381057739,
155          0.9125410914421082,
156          0.7379266023635864,
157          0.7164239287376404,
158          0.8165872693061829,
159          0.6724876165390015
160        ],
161        "n": 8
162      }
163    }
164  ],
165  "budget": {
166    "epochs": 18,
167    "n_train": 400,
168    "n_test": 120,
169    "seeds": [
170      0,
171      1,
172      2,
173      3,
174      4,
175      5,
176      6,
177      7
178    ]
179  }
180}