Gauge-Covariant Wilson-Loop Regularization / bench_report.json

Failed on benchmark

Raw ⬇ ZIP
  1{
  2  "bench_version": 1,
  3  "track": "holonomy_cycle_sector",
  4  "model": "custom_transport_cycle",
  5  "metric_direction": "lower is better",
  6  "n_seeds": 8,
  7  "baseline": {
  8    "best_cfg": {
  9      "lr": 0.006,
 10      "epochs": 8,
 11      "wd": 0.0,
 12      "lam": 0.0
 13    },
 14    "sweep": [
 15      {
 16        "cfg": {
 17          "lr": 0.001,
 18          "epochs": 8,
 19          "wd": 0.0,
 20          "lam": 0.0
 21        },
 22        "mean": 0.04124999768100679
 23      },
 24      {
 25        "cfg": {
 26          "lr": 0.001,
 27          "epochs": 8,
 28          "wd": 0.0001,
 29          "lam": 0.0
 30        },
 31        "mean": 0.04124999768100679
 32      },
 33      {
 34        "cfg": {
 35          "lr": 0.003,
 36          "epochs": 8,
 37          "wd": 0.0,
 38          "lam": 0.0
 39        },
 40        "mean": 0.034999999683350325
 41      },
 42      {
 43        "cfg": {
 44          "lr": 0.003,
 45          "epochs": 8,
 46          "wd": 0.0001,
 47          "lam": 0.0
 48        },
 49        "mean": 0.034999999683350325
 50      },
 51      {
 52        "cfg": {
 53          "lr": 0.006,
 54          "epochs": 8,
 55          "wd": 0.0,
 56          "lam": 0.0
 57        },
 58        "mean": 0.028749998891726136
 59      },
 60      {
 61        "cfg": {
 62          "lr": 0.006,
 63          "epochs": 8,
 64          "wd": 0.0001,
 65          "lam": 0.0
 66        },
 67        "mean": 0.028749998891726136
 68      }
 69    ],
 70    "full": {
 71      "mean": 0.02437499910593033,
 72      "std": 0.011842058801278857,
 73      "per_seed": [
 74        0.04999999701976776,
 75        0.019999999552965164,
 76        0.014999999664723873,
 77        0.029999999329447746,
 78        0.014999999664723873,
 79        0.009999999776482582,
 80        0.02499999850988388,
 81        0.029999999329447746
 82      ],
 83      "n": 8
 84    }
 85  },
 86  "idea": {
 87    "mean": 0.014999999548308551,
 88    "std": 0.011989578249002557,
 89    "per_seed": [
 90      0.004999999888241291,
 91      0.014999999664723873,
 92      0.009999999776482582,
 93      0.009999999776482582,
 94      0.014999999664723873,
 95      0.004999999888241291,
 96      0.044999998062849045,
 97      0.014999999664723873
 98    ],
 99    "n": 8
100  },
101  "comparison": {
102    "delta_mean": -0.009374999557621777,
103    "idea_wins": 6,
104    "n_pairs": 8,
105    "per_seed_diffs": [
106      -0.04499999713152647,
107      -0.004999999888241291,
108      -0.004999999888241291,
109      -0.019999999552965164,
110      0.0,
111      -0.004999999888241291,
112      0.019999999552965164,
113      -0.014999999664723873
114    ],
115    "p_value": 0.2182,
116    "mde": 0.015552957027650763,
117    "mde_rel_pct": 63.80700553078912,
118    "verdict": "no significant win",
119    "system_worked": false
120  },
121  "mechanism_signature": {
122    "prediction": "Wilson penalty lowers trained cycle frustration while preserving or improving classification",
123    "observed_seed0": {
124      "metric": 0.004999999888241291,
125      "compatibility_M": 0.8122859001159668,
126      "wilson_energy": 0.1877141296863556
127    },
128    "math_check": {
129      "conjugation_max_abs_error": 3.5762786865234375e-07,
130      "flat_loop_scalar": 1.0
131    },
132    "confirmed": true
133  },
134  "idea_sweep": [
135    {
136      "cfg": {
137        "lr": 0.006,
138        "epochs": 8,
139        "wd": 0.0,
140        "lam": 0.01
141      },
142      "result": {
143        "mean": 0.02437499922234565,
144        "std": 0.01666536387181637,
145        "per_seed": [
146          0.06499999761581421,
147          0.019999999552965164,
148          0.014999999664723873,
149          0.029999999329447746,
150          0.009999999776482582,
151          0.009999999776482582,
152          0.019999999552965164,
153          0.02499999850988388
154        ],
155        "n": 8
156      }
157    },
158    {
159      "cfg": {
160        "lr": 0.006,
161        "epochs": 8,
162        "wd": 0.0,
163        "lam": 0.03
164      },
165      "result": {
166        "mean": 0.02187499951105565,
167        "std": 0.008637671792387556,
168        "per_seed": [
169          0.03500000014901161,
170          0.014999999664723873,
171          0.014999999664723873,
172          0.02499999850988388,
173          0.014999999664723873,
174          0.009999999776482582,
175          0.029999999329447746,
176          0.029999999329447746
177        ],
178        "n": 8
179      }
180    },
181    {
182      "cfg": {
183        "lr": 0.006,
184        "epochs": 8,
185        "wd": 0.0,
186        "lam": 0.1
187      },
188      "result": {
189        "mean": 0.014999999548308551,
190        "std": 0.011989578249002557,
191        "per_seed": [
192          0.004999999888241291,
193          0.014999999664723873,
194          0.009999999776482582,
195          0.009999999776482582,
196          0.014999999664723873,
197          0.004999999888241291,
198          0.044999998062849045,
199          0.014999999664723873
200        ],
201        "n": 8
202      }
203    }
204  ],
205  "custom_track": {
206    "name": "holonomy_cycle_sector",
207    "file": "/home/maxwelhelp/all/math2nn/bench/custom_tracks/holonomy_cycle_sector.py",
208    "domain": "graph-nn"
209  }
210}