Envelope-Max Neural Operator / bench_report.json

Mechanism confirmed, baseline not beaten

Raw ⬇ ZIP
  1{
  2  "bench_version": 1,
  3  "track": "dynamics",
  4  "model": "rnn_small",
  5  "metric_direction": "lower is better",
  6  "n_seeds": 8,
  7  "baseline": {
  8    "best_cfg": {
  9      "lr": 0.006,
 10      "epochs": 10,
 11      "branches": 1
 12    },
 13    "sweep": [
 14      {
 15        "cfg": {
 16          "lr": 0.001,
 17          "epochs": 10,
 18          "branches": 1
 19        },
 20        "mean": 0.0019458123424556106
 21      },
 22      {
 23        "cfg": {
 24          "lr": 0.003,
 25          "epochs": 10,
 26          "branches": 1
 27        },
 28        "mean": 0.000998065312160179
 29      },
 30      {
 31        "cfg": {
 32          "lr": 0.006,
 33          "epochs": 10,
 34          "branches": 1
 35        },
 36        "mean": 0.0007849872272345237
 37      }
 38    ],
 39    "full": {
 40      "mean": 0.0007333773064601701,
 41      "std": 0.00023119481143299165,
 42      "per_seed": [
 43        0.0007082645315676928,
 44        0.0011445400305092335,
 45        0.00047928086132742465,
 46        0.0008078634855337441,
 47        0.00035395112354308367,
 48        0.0006696216878481209,
 49        0.0007750760996714234,
 50        0.0009284206316806376
 51      ],
 52      "n": 8
 53    }
 54  },
 55  "idea": {
 56    "cfg": {
 57      "lr": 0.006,
 58      "epochs": 10,
 59      "branches": 5
 60    },
 61    "mean": 0.0008847052595228888,
 62    "std": 0.00026667546357193395,
 63    "per_seed": [
 64      0.0010930252028629184,
 65      0.0010985390981659293,
 66      0.0007570339366793633,
 67      0.001170001458376646,
 68      0.00035861978540197015,
 69      0.0010039987973868847,
 70      0.0006030820077285171,
 71      0.0009933417895808816
 72    ],
 73    "n": 8
 74  },
 75  "comparison": {
 76    "delta_mean": 0.00015132795306271873,
 77    "idea_wins": 2,
 78    "n_pairs": 8,
 79    "per_seed_diffs": [
 80      0.0003847606712952256,
 81      -4.600093234330416e-05,
 82      0.0002777530753519386,
 83      0.00036213797284290195,
 84      4.66866185888648e-06,
 85      0.00033437710953876376,
 86      -0.00017199409194290638,
 87      6.4921157900244e-05
 88    ],
 89    "p_value": 0.08585,
 90    "mde": 0.00017902087041145347,
 91    "mde_rel_pct": 24.410473140427907,
 92    "verdict": "no significant win",
 93    "system_worked": false
 94  },
 95  "idea_sweep": [
 96    {
 97      "cfg": {
 98        "lr": 0.001,
 99        "epochs": 10,
100        "branches": 5
101      },
102      "mean": 0.00476446797256358,
103      "std": 0.0010113119245195041,
104      "per_seed": [
105        0.004423358011990786,
106        0.00587823148816824,
107        0.006476645823568106,
108        0.0045180427841842175,
109        0.0030923711601644754,
110        0.004275563172996044,
111        0.005356233566999435,
112        0.004095297772437334
113      ],
114      "n": 8
115    },
116    {
117      "cfg": {
118        "lr": 0.003,
119        "epochs": 10,
120        "branches": 5
121      },
122      "mean": 0.0016875666624400765,
123      "std": 0.00044316453275384946,
124      "per_seed": [
125        0.0008459890959784389,
126        0.0019791238009929657,
127        0.0021841360721737146,
128        0.001931163715198636,
129        0.0013305676402524114,
130        0.0013080938952043653,
131        0.0018005802994593978,
132        0.002120878780260682
133      ],
134      "n": 8
135    },
136    {
137      "cfg": {
138        "lr": 0.006,
139        "epochs": 10,
140        "branches": 5
141      },
142      "mean": 0.0008847052595228888,
143      "std": 0.00026667546357193395,
144      "per_seed": [
145        0.0010930252028629184,
146        0.0010985390981659293,
147        0.0007570339366793633,
148        0.001170001458376646,
149        0.00035861978540197015,
150        0.0010039987973868847,
151        0.0006030820077285171,
152        0.0009933417895808816
153      ],
154      "n": 8
155    }
156  ],
157  "budget": {
158    "n_train": 800,
159    "n_test": 300,
160    "epochs": 10,
161    "batch": 128,
162    "lr_union": [
163      0.001,
164      0.003,
165      0.006
166    ]
167  },
168  "mechanism_signature": {
169    "trained_model": true,
170    "soft_minus_hard_mean": 0.004501420073211193,
171    "soft_minus_hard_std": 0.008464416489005089,
172    "branch_spread_mean": 0.2787400186061859,
173    "subset_refinement": [
174      {
175        "M": 2,
176        "mean_abs_to_full": 0.5144225358963013
177      },
178      {
179        "M": 3,
180        "mean_abs_to_full": 0.035924121737480164
181      },
182      {
183        "M": 5,
184        "mean_abs_to_full": 0.0
185      }
186    ],
187    "confirmed": true,
188    "note": "values measured on the seed-0 trained dynamics model"
189  }
190}