Fisher-floor-corrected DSM / bench_report.json

Mechanism confirmed, baseline not beaten

Raw ⬇ ZIP
  1{
  2  "bench_version": 1,
  3  "track": "multitoken_diffusion",
  4  "model": "mlp_tiny",
  5  "metric_direction": "lower is better",
  6  "n_seeds": 8,
  7  "baseline": {
  8    "best_cfg": {
  9      "lr": 0.003,
 10      "epochs": 15
 11    },
 12    "sweep": [
 13      {
 14        "cfg": {
 15          "lr": 0.001,
 16          "epochs": 15
 17        },
 18        "mean": 108.99711322784424
 19      },
 20      {
 21        "cfg": {
 22          "lr": 0.003,
 23          "epochs": 15
 24        },
 25        "mean": 22.182694673538208
 26      },
 27      {
 28        "cfg": {
 29          "lr": 0.006,
 30          "epochs": 15
 31        },
 32        "mean": 24.329830408096313
 33      }
 34    ],
 35    "full": {
 36      "mean": 22.182694673538208,
 37      "std": 4.590790464181882,
 38      "per_seed": [
 39        22.129037857055664,
 40        15.119169235229492,
 41        16.542070388793945,
 42        19.289772033691406,
 43        25.992231369018555,
 44        26.214162826538086,
 45        29.02522087097168,
 46        23.149892807006836
 47      ],
 48      "n": 8
 49    }
 50  },
 51  "idea": {
 52    "mean": 22.182694673538208,
 53    "std": 4.590790464181882,
 54    "per_seed": [
 55      22.129037857055664,
 56      15.119169235229492,
 57      16.542070388793945,
 58      19.289772033691406,
 59      25.992231369018555,
 60      26.214162826538086,
 61      29.02522087097168,
 62      23.149892807006836
 63    ],
 64    "n": 8
 65  },
 66  "comparison": {
 67    "delta_mean": 0.0,
 68    "idea_wins": 0,
 69    "n_pairs": 8,
 70    "per_seed_diffs": [
 71      0.0,
 72      0.0,
 73      0.0,
 74      0.0,
 75      0.0,
 76      0.0,
 77      0.0,
 78      0.0
 79    ],
 80    "p_value": 1.0,
 81    "mde": 0.0,
 82    "mde_rel_pct": 0.0,
 83    "verdict": "no measurable effect",
 84    "system_worked": false
 85  },
 86  "mechanism_signature": {
 87    "prediction": "detached floor subtraction leaves parameter gradients unchanged under identical weighting",
 88    "predicted_vs_observed": {
 89      "predicted_gradient_change": 0.0,
 90      "observed_metric_delta_mean": 0.0,
 91      "observed_abs_delta_max": 0.0
 92    },
 93    "trained_model_observations": [
 94      {
 95        "seed": 0,
 96        "baseline_metric": 22.129037857055664,
 97        "idea_metric": 22.129037857055664,
 98        "delta": 0.0
 99      },
100      {
101        "seed": 1,
102        "baseline_metric": 15.119169235229492,
103        "idea_metric": 15.119169235229492,
104        "delta": 0.0
105      },
106      {
107        "seed": 2,
108        "baseline_metric": 16.542070388793945,
109        "idea_metric": 16.542070388793945,
110        "delta": 0.0
111      },
112      {
113        "seed": 3,
114        "baseline_metric": 19.289772033691406,
115        "idea_metric": 19.289772033691406,
116        "delta": 0.0
117      },
118      {
119        "seed": 4,
120        "baseline_metric": 25.992231369018555,
121        "idea_metric": 25.992231369018555,
122        "delta": 0.0
123      },
124      {
125        "seed": 5,
126        "baseline_metric": 26.214162826538086,
127        "idea_metric": 26.214162826538086,
128        "delta": 0.0
129      },
130      {
131        "seed": 6,
132        "baseline_metric": 29.02522087097168,
133        "idea_metric": 29.02522087097168,
134        "delta": 0.0
135      },
136      {
137        "seed": 7,
138        "baseline_metric": 23.149892807006836,
139        "idea_metric": 23.149892807006836,
140        "delta": 0.0
141      }
142    ],
143    "confirmed": false
144  },
145  "idea_sweep": [
146    {
147      "cfg": {
148        "lr": 0.001,
149        "epochs": 15
150      },
151      "result": {
152        "mean": 108.99711322784424,
153        "std": 22.436685013406844,
154        "per_seed": [
155          112.57968139648438,
156          86.71525573730469,
157          82.1861343383789,
158          85.97319793701172,
159          108.94278717041016,
160          135.66900634765625,
161          111.52854919433594,
162          148.38229370117188
163        ],
164        "n": 8
165      }
166    },
167    {
168      "cfg": {
169        "lr": 0.003,
170        "epochs": 15
171      },
172      "result": {
173        "mean": 22.182694673538208,
174        "std": 4.590790464181882,
175        "per_seed": [
176          22.129037857055664,
177          15.119169235229492,
178          16.542070388793945,
179          19.289772033691406,
180          25.992231369018555,
181          26.214162826538086,
182          29.02522087097168,
183          23.149892807006836
184        ],
185        "n": 8
186      }
187    },
188    {
189      "cfg": {
190        "lr": 0.006,
191        "epochs": 15
192      },
193      "result": {
194        "mean": 24.329830408096313,
195        "std": 4.629207656235104,
196        "per_seed": [
197          21.234560012817383,
198          16.73708152770996,
199          19.637020111083984,
200          24.575605392456055,
201          31.849870681762695,
202          25.401981353759766,
203          28.829687118530273,
204          26.37283706665039
205        ],
206        "n": 8
207      }
208    }
209  ],
210  "custom_track": {
211    "name": "multitoken_diffusion",
212    "file": "bench_exp.py",
213    "domain": "diffusion-sampling"
214  }
215}