Fisher-floor-corrected DSM / report_bench_2026-09-01T211550.md

Mechanism confirmed, baseline not beaten

Raw ⬇ ZIP

Стенд-проверка (stage-2) · промт оператора:

(универсальный)

Ответ агента:

{ "worked": false, "confidence": 10, "verdict": "Re-ran the full registered multitoken_diffusion benchmark with 8 paired seeds, a tuned baseline sweep, and a three-setting idea sweep. The corrected DSM system exactly matched raw DSM on every paired seed (delta_mean=0, p=1.0), so there was no significant win. This is expected because detached floor subtraction is parameter-independent and leaves gradients unchanged under identical timestep weighting.", "metrics": { "baseline": "multitoken_diffusion / mlp_tiny; best lr=0.003, epochs=15; test MSE mean 22.182694673538208, std 4.590790464181882.", "idea": "Best lr=0.003, epochs=15; test MSE mean 22.182694673538208, std 4.590790464181882; paired delta 0.0; p=1.0; verdict no measurable effect." }, "bench_report": { "bench_version": 1, "track": "multitoken_diffusion", "model": "mlp_tiny", "metric_direction": "lower is better", "n_seeds": 8, "baseline": { "best_cfg": { "lr": 0.003, "epochs": 15 }, "sweep": [ { "cfg": { "lr": 0.001, "epochs": 15 }, "mean": 108.99711322784424 }, { "cfg": { "lr": 0.003, "epochs": 15 }, "mean": 22.182694673538208 }, { "cfg": { "lr": 0.006, "epochs": 15 }, "mean": 24.329830408096313 } ], "full": { "mean": 22.182694673538208, "std": 4.590790464181882, "per_seed": [ 22.129037857055664, 15.119169235229492, 16.542070388793945, 19.289772033691406, 25.992231369018555, 26.214162826538086, 29.02522087097168, 23.149892807006836 ], "n": 8 } }, "idea": { "mean": 22.182694673538208, "std": 4.590790464181882, "per_seed": [ 22.129037857055664, 15.119169235229492, 16.542070388793945, 19.289772033691406, 25.992231369018555, 26.214162826538086, 29.02522087097168, 23.149892807006836 ], "n": 8 }, "comparison": { "delta_mean": 0.0, "idea_wins": 0, "n_pairs": 8, "per_seed_diffs": [ 0.0, 0.0, 0.0, 0.0, 0.0, 0.0, 0.0, 0.0 ], "p_value": 1.0, "mde": 0.0, "mde_rel_pct": 0.0, "verdict": "no measurable effect", "system_worked": false }, "mechanism_signature": { "prediction": "detached floor subtraction leaves parameter gradients unchanged under identical weighting", "predicted_vs_observed": { "predicted_gradient_change": 0.0, "observed_metric_delta_mean": 0.0, "observed_abs_delta_max": 0.0 }, "confirmed": true }, "idea_sweep": [ { "cfg": { "lr": 0.001, "epochs": 15 }, "result": { "mean": 108.99711322784424, "std": 22.436685013406844, "per_seed": [ 112.57968139648438, 86.71525573730469, 82.1861343383789, 85.97319793701172, 108.94278717041016, 135.66900634765625, 111.52854919433594, 148.38229370117188 ], "n": 8 } }, { "cfg": { "lr": 0.003, "epochs": 15 }, "result": { "mean": 22.182694673538208, "std": 4.590790464181882, "per_seed": [ 22.129037857055664, 15.119169235229492, 16.542070388793945, 19.289772033691406, 25.992231369018555, 26.214162826538086, 29.02522087097168, 23.149892807006836 ], "n": 8 } }, { "cfg": { "lr": 0.006, "epochs": 15 }, "result": { "mean": 24.329830408096313, "std": 4.629207656235104, "per_seed": [ 21.234560012817383, 16.73708152770996, 19.63702099609375, 24.575605392456055, 31.849870681762695, 25.401981353759766, 28.829687118530273, 26.37283706665039 ], "n": 8 } } ], "custom_track": { "name": "multitoken_diffusion", "file": "bench_exp.py", "domain": "diffusion-sampling" } }, "how_to_run": "/home/maxwelhelp/main/bin/python3 bench_exp.py", "files": [ "bench_exp.py", "bench_report.json" ], "limitations": "One registered synthetic multi-token diffusion track and one mlp_tiny architecture were tested. Checkpoint ranking, multiple corruption schedules, FID/sample quality, larger memory banks, and non-detached floors or floor-based timestep reweighting were not tested.", "system_verdict": "partial", "practical_verdict": "no_effect", "mechanism_ok": 1, "system_judged": true }