Anchored Whitening Layer / bench_results.json

Failed on benchmark

Raw ⬇ ZIP
  1{
  2  "bench_version": 1,
  3  "track": "vision",
  4  "model": "cnn_small",
  5  "metric_direction": "lower is better",
  6  "n_seeds": 8,
  7  "baseline": {
  8    "best_cfg": {
  9      "lr": 0.003
 10    },
 11    "sweep": [
 12      {
 13        "cfg": {
 14          "lr": 0.001
 15        },
 16        "mean": 0.8537499755620956
 17      },
 18      {
 19        "cfg": {
 20          "lr": 0.003
 21        },
 22        "mean": 0.846249982714653
 23      },
 24      {
 25        "cfg": {
 26          "lr": 0.01
 27        },
 28        "mean": 0.8699999898672104
 29      }
 30    ],
 31    "full": {
 32      "mean": 0.8537499830126762,
 33      "std": 0.032475961531880884,
 34      "per_seed": [
 35        0.8899999856948853,
 36        0.8399999737739563,
 37        0.8700000047683716,
 38        0.7849999666213989,
 39        0.8700000047683716,
 40        0.8499999642372131,
 41        0.8899999856948853,
 42        0.8349999785423279
 43      ],
 44      "n": 8
 45    }
 46  },
 47  "idea": {
 48    "mean": 0.8706249967217445,
 49    "std": 0.046464878782190286,
 50    "per_seed": [
 51      0.7599999904632568,
 52      0.8550000190734863,
 53      0.8849999904632568,
 54      0.9100000262260437,
 55      0.8549999594688416,
 56      0.9100000262260437,
 57      0.8999999761581421,
 58      0.8899999856948853
 59    ],
 60    "n": 8
 61  },
 62  "comparison": {
 63    "delta_mean": 0.0168750137090683,
 64    "idea_wins": 2,
 65    "n_pairs": 8,
 66    "per_seed_diffs": [
 67      -0.12999999523162842,
 68      0.01500004529953003,
 69      0.014999985694885254,
 70      0.12500005960464478,
 71      -0.01500004529953003,
 72      0.060000061988830566,
 73      0.009999990463256836,
 74      0.05500000715255737
 75    ],
 76    "p_value": 0.50765,
 77    "mde": 0.061319939059687474,
 78    "mde_rel_pct": 7.182423458833265,
 79    "verdict": "no significant win",
 80    "system_worked": false
 81  },
 82  "idea_sweep": [
 83    {
 84      "cfg": {
 85        "lr": 0.001
 86      },
 87      "mean": 0.8587500005960464
 88    },
 89    {
 90      "cfg": {
 91        "lr": 0.003
 92      },
 93      "mean": 0.8525000065565109
 94    },
 95    {
 96      "cfg": {
 97        "lr": 0.01
 98      },
 99      "mean": 0.885000005364418
100    }
101  ],
102  "protocol_note": "shared lr grid; 8 paired seeds; 400/200 CIFAR subset; 4 epochs",
103  "mechanism_signature": {
104    "prediction": "trained anchored layer should reduce channel covariance while preserving designated-channel fidelity",
105    "baseline_offdiag_cov": null,
106    "idea_offdiag_cov_observed": 1.9903746843338013,
107    "idea_max_unit_variance_error_observed": 0.9999727606773376,
108    "idea_min_fidelity_observed": -0.0010492571163922548,
109    "rho_min": 0.8,
110    "confirmed": false
111  }
112}