Log-Scale Self-Similar Activation / bench_report.json

Failed on benchmark

Raw ⬇ ZIP
  1{
  2  "bench_version": 1,
  3  "track": "tabular",
  4  "model": "mlp_tiny_shared_activation",
  5  "metric_direction": "lower is better",
  6  "n_seeds": 8,
  7  "baseline": {
  8    "best_cfg": {
  9      "lr": 0.01,
 10      "epochs": 20
 11    },
 12    "sweep": [
 13      {
 14        "cfg": {
 15          "lr": 0.001,
 16          "epochs": 20
 17        },
 18        "mean": 17.79831099510193
 19      },
 20      {
 21        "cfg": {
 22          "lr": 0.003,
 23          "epochs": 20
 24        },
 25        "mean": 13.153547525405884
 26      },
 27      {
 28        "cfg": {
 29          "lr": 0.01,
 30          "epochs": 20
 31        },
 32        "mean": 7.754182696342468
 33      }
 34    ],
 35    "full": {
 36      "mean": 7.931941092014313,
 37      "std": 0.8101161551333251,
 38      "per_seed": [
 39        7.2100510597229,
 40        8.814193725585938,
 41        7.362153053283691,
 42        7.630332946777344,
 43        6.520580291748047,
 44        8.472823143005371,
 45        8.71557903289795,
 46        8.729815483093262
 47      ],
 48      "n": 8
 49    },
 50    "union_grid": [
 51      {
 52        "lr": 0.001,
 53        "epochs": 20
 54      },
 55      {
 56        "lr": 0.003,
 57        "epochs": 20
 58      },
 59      {
 60        "lr": 0.01,
 61        "epochs": 20
 62      }
 63    ]
 64  },
 65  "idea": {
 66    "mean": 25.546241760253906,
 67    "std": 1.397921331795095,
 68    "per_seed": [
 69      26.91761589050293,
 70      25.963476181030273,
 71      26.16190528869629,
 72      22.51058578491211,
 73      25.61777687072754,
 74      26.621234893798828,
 75      24.128700256347656,
 76      26.448638916015625
 77    ],
 78    "n": 8,
 79    "best_cfg": {
 80      "lr": 0.01,
 81      "epochs": 20
 82    }
 83  },
 84  "comparison": {
 85    "delta_mean": 17.614300668239594,
 86    "idea_wins": 0,
 87    "n_pairs": 8,
 88    "per_seed_diffs": [
 89      19.70756483078003,
 90      17.149282455444336,
 91      18.799752235412598,
 92      14.880252838134766,
 93      19.097196578979492,
 94      18.148411750793457,
 95      15.413121223449707,
 96      17.718823432922363
 97    ],
 98    "p_value": 0.0081,
 99    "mde": 1.4419949288736407,
100    "mde_rel_pct": 18.17959705128681,
101    "verdict": "idea worse (significant)",
102    "system_worked": false
103  },
104  "mechanism_signature": {
105    "idea_sweep": [
106      {
107        "cfg": {
108          "lr": 0.001,
109          "epochs": 20
110        },
111        "mean": 136.8510456085205
112      },
113      {
114        "cfg": {
115          "lr": 0.003,
116          "epochs": 20
117        },
118        "mean": 72.42067241668701
119      },
120      {
121        "cfg": {
122          "lr": 0.01,
123          "epochs": 20
124        },
125        "mean": 25.3883957862854
126      }
127    ],
128    "selected_cfg": {
129      "lr": 0.01,
130      "epochs": 20
131    },
132    "mechanism_signature": {
133      "prediction": "adjacent local gain ratio is sigma=2; output changes under input scaling",
134      "sigma_predicted": 2.0,
135      "slope_ratios_observed_trained_model": [
136        0.49992549419403076,
137        0.5001490116119385,
138        0.5
139      ],
140      "median_ratio_observed": 0.5,
141      "input_scale_2_output_abs_ratio": 1.0001696348190308,
142      "probe_test_mse": 26.91761589050293,
143      "confirmed": false
144    },
145    "track_choice": "tabular: activation is an MLP scalar nonlinearity; Friedman regression supplies the matched MLP setting."
146  }
147}