Bregman-Projection Polyak Optimizer / bench_report.json

Failed on benchmark

Raw ⬇ ZIP
  1{
  2  "bench_version": 1,
  3  "track": "tabular",
  4  "model": "mlp_tiny",
  5  "metric_direction": "lower is better",
  6  "n_seeds": 8,
  7  "baseline": {
  8    "best_cfg": {
  9      "lr": 0.01
 10    },
 11    "sweep": [
 12      {
 13        "cfg": {
 14          "lr": 0.001
 15        },
 16        "mean": 146.7281608581543
 17      },
 18      {
 19        "cfg": {
 20          "lr": 0.003
 21        },
 22        "mean": 17.104151725769043
 23      },
 24      {
 25        "cfg": {
 26          "lr": 0.01
 27        },
 28        "mean": 12.445883750915527
 29      }
 30    ],
 31    "full": {
 32      "mean": 12.770212650299072,
 33      "std": 1.168904265972683,
 34      "per_seed": [
 35        12.32522201538086,
 36        12.587058067321777,
 37        14.008906364440918,
 38        10.862348556518555,
 39        11.249069213867188,
 40        13.969073295593262,
 41        13.09931755065918,
 42        14.06070613861084
 43      ],
 44      "n": 8
 45    }
 46  },
 47  "idea": {
 48    "mean": 14.78523874282837,
 49    "per_seed": [
 50      17.6944580078125,
 51      12.148554801940918,
 52      14.37415885925293,
 53      26.43087387084961,
 54      8.728538513183594,
 55      12.932696342468262,
 56      13.736586570739746,
 57      12.236042976379395
 58    ],
 59    "cfg": {
 60      "lr": 0.001
 61    },
 62    "sweep": [
 63      {
 64        "cfg": {
 65          "lr": 0.001
 66        },
 67        "mean": 14.78523874282837,
 68        "per_seed": [
 69          17.6944580078125,
 70          12.148554801940918,
 71          14.37415885925293,
 72          26.43087387084961,
 73          8.728538513183594,
 74          12.932696342468262,
 75          13.736586570739746,
 76          12.236042976379395
 77        ]
 78      },
 79      {
 80        "cfg": {
 81          "lr": 0.003
 82        },
 83        "mean": 25.065056443214417,
 84        "per_seed": [
 85          18.1739444732666,
 86          15.587058067321777,
 87          16.13030242919922,
 88          13.475675582885742,
 89          65.8013687133789,
 90          8.955453872680664,
 91          17.400615692138672,
 92          44.99603271484375
 93        ]
 94      },
 95      {
 96        "cfg": {
 97          "lr": 0.01
 98        },
 99        "mean": 16.26691508293152,
100        "per_seed": [
101          42.245765686035156,
102          13.930212020874023,
103          9.309124946594238,
104          8.357898712158203,
105          22.75505828857422,
106          8.172164916992188,
107          16.167266845703125,
108          9.197829246520996
109        ]
110      }
111    ]
112  },
113  "comparison": {
114    "delta_mean": 2.015026092529297,
115    "idea_wins": 4,
116    "n_pairs": 8,
117    "per_seed_diffs": [
118      5.369235992431641,
119      -0.4385032653808594,
120      0.3652524948120117,
121      15.568525314331055,
122      -2.5205307006835938,
123      -1.036376953125,
124      0.6372690200805664,
125      -1.8246631622314453
126    ],
127    "p_value": 0.4921,
128    "mde": 4.999106670375855,
129    "mde_rel_pct": 39.14662039914252,
130    "verdict": "no significant win",
131    "system_worked": false
132  },
133  "mechanism_signature": {
134    "track_choice": "tabular/Friedman#1: optimizer intervention is structurally matched",
135    "prediction": "small-gap positive-log lambda/delta approximates inverse weighted gradient square",
136    "observed_lambda_over_delta_mean": 0.2710435168226066,
137    "predicted_inverse_variance_mean": 1000000000000.0,
138    "root_residual_max": 0.169219970703125,
139    "root_failure_rate_mean": 0.14531249999999998,
140    "confirmed": false
141  }
142}