Coupled multilevel gradients for Markov-stream training / artifacts/bench_report.json

Mechanism confirmed, baseline not beaten

Raw ⬇ ZIP
  1{
  2  "bench_version": 1,
  3  "track": "markov_stream_regression",
  4  "model": "mlp_tiny",
  5  "metric_direction": "lower is better",
  6  "n_seeds": 8,
  7  "baseline": {
  8    "best_cfg": {
  9      "lr": 0.006
 10    },
 11    "sweep": [
 12      {
 13        "cfg": {
 14          "lr": 0.001
 15        },
 16        "mean": 2.7850674092769623
 17      },
 18      {
 19        "cfg": {
 20          "lr": 0.003
 21        },
 22        "mean": 0.9566748812794685
 23      },
 24      {
 25        "cfg": {
 26          "lr": 0.006
 27        },
 28        "mean": 0.6123837828636169
 29      }
 30    ],
 31    "full": {
 32      "mean": 0.6354323998093605,
 33      "std": 0.333473278949733,
 34      "per_seed": [
 35        0.36419546604156494,
 36        0.2755792737007141,
 37        1.0398473739624023,
 38        0.7699130177497864,
 39        0.5838971138000488,
 40        0.3222571909427643,
 41        0.47670307755470276,
 42        1.2510666847229004
 43      ],
 44      "n": 8
 45    }
 46  },
 47  "idea": {
 48    "mean": 1.956806443631649,
 49    "std": 0.615567636769626,
 50    "per_seed": [
 51      1.6518237590789795,
 52      0.9949750304222107,
 53      2.369184970855713,
 54      1.7660677433013916,
 55      3.053445816040039,
 56      1.3799846172332764,
 57      2.4778213500976562,
 58      1.9611482620239258
 59    ],
 60    "n": 8,
 61    "sweep": [
 62      {
 63        "cfg": {
 64          "lr": 0.001
 65        },
 66        "mean": 4.620329976081848,
 67        "std": 1.0518765869021856
 68      },
 69      {
 70        "cfg": {
 71          "lr": 0.003
 72        },
 73        "mean": 3.1034981161355972,
 74        "std": 1.2009995397914373
 75      },
 76      {
 77        "cfg": {
 78          "lr": 0.006
 79        },
 80        "mean": 1.956806443631649,
 81        "std": 0.615567636769626
 82      }
 83    ]
 84  },
 85  "comparison": {
 86    "delta_mean": 1.3213740438222885,
 87    "idea_wins": 0,
 88    "n_pairs": 8,
 89    "per_seed_diffs": [
 90      1.2876282930374146,
 91      0.7193957567214966,
 92      1.3293375968933105,
 93      0.9961547255516052,
 94      2.4695487022399902,
 95      1.057727426290512,
 96      2.0011182725429535,
 97      0.7100815773010254
 98    ],
 99    "p_value": 0.0081,
100    "mde": 0.5186169124394706,
101    "mde_rel_pct": 81.61637848417293,
102    "verdict": "idea worse (significant)",
103    "system_worked": false
104  },
105  "mechanism_signature": {
106    "prediction": "shared fine-minus-coarse corrections have smaller norm than raw fine gradients under correlated streams",
107    "observed_correction_norm_mean": 4.148377245852362,
108    "observed_mean_gradient_norm": 7.382436275482178,
109    "observed_gradient_lag1_mean": 0.08052120597292914,
110    "observed_clip_fraction_mean": 0.4244791666666667,
111    "confirmed": true
112  },
113  "custom_track": {
114    "name": "markov_stream_regression",
115    "file": "markov_stream_bench.py",
116    "domain": "optimizer"
117  }
118}