Ordered Diffusion Message Passing / report_bench_2026-09-01T165603.md

Mechanism confirmed, baseline not beaten

Raw ⬇ ZIP

Стенд-проверка (stage-2) · промт оператора:

(универсальный)

Ответ агента:

{ "worked": false, "confidence": 9, "verdict": "Implemented learned ordered Gaussian message passing on the structurally matched multi-token sequence track, with beta=0 as the symmetric baseline and identical end-to-end training otherwise. The idea slightly improved mean test MSE, 0.0768425 versus 0.0776014, but the paired permutation test was not significant (p=0.42205), so no benchmark win was demonstrated.", "metrics": { "baseline": "8-seed mean test MSE 0.0776014216, std 0.0061187429; best lr=0.001, beta=0", "idea": "8-seed mean test MSE 0.0768425418, std 0.0054380882; lr=0.001, beta=0.75; paired delta=-0.0007588798; 4/8 wins; permutation p=0.42205" }, "bench_report": { "bench_version": 1, "track": "sequence", "model": "ordered_diffusion_sequence", "metric_direction": "lower is better", "n_seeds": 8, "baseline": { "best_cfg": { "lr": 0.001, "beta": 0.0 }, "sweep": [ { "cfg": { "lr": 0.001, "beta": 0.0 }, "mean": 0.07924088463187218 }, { "cfg": { "lr": 0.003, "beta": 0.0 }, "mean": 0.09628596156835556 }, { "cfg": { "lr": 0.006, "beta": 0.0 }, "mean": 0.19720600172877312 } ], "full": { "mean": 0.07760142162442207, "std": 0.006118742941324521, "per_seed": [ 0.07903548330068588, 0.07285989820957184, 0.07350674271583557, 0.09156141430139542, 0.07591164112091064, 0.07749377191066742, 0.0801774188876152, 0.07026500254869461 ], "n": 8 } }, "idea": { "mean": 0.07684254180639982, "std": 0.0054380881863217555, "per_seed": [ 0.07450506091117859, 0.07289530336856842, 0.07336334884166718, 0.08876381069421768, 0.07585369050502777, 0.07825427502393723, 0.08079726994037628, 0.07030757516622543 ], "n": 8 }, "comparison": { "delta_mean": -0.0007588798180222511, "idea_wins": 4, "n_pairs": 8, "per_seed_diffs": [ -0.004530422389507294, 3.540515899658203e-05, -0.000143393874168396, -0.0027976036071777344, -5.79506158828735e-05, 0.0007605031132698059, 0.0006198510527610779, 4.257261753082275e-05 ], "p_value": 0.42205, "mde": 0.0015717432149880194, "mde_rel_pct": 2.0254051821305468, "verdict": "no measurable effect", "system_worked": false }, "mechanism_signature": { "beta": 0.75, "epsilon": 9.0, "observed_drift_over_eps": 0.010957256890833378, "predicted_drift_over_eps": 0.0006128650275059044, "absolute_error": 0.010344391863327473, "entropy": 2.350996971130371, "confirmed": true }, "track_choice": "sequence: the mechanism is local message passing over multi-token temporal correlations, not a single-token task.", "idea_sweep": [ { "cfg": { "lr": 0.001, "beta": 0.75 }, "mean": 0.07738188095390797 }, { "cfg": { "lr": 0.003, "beta": 1.0 }, "mean": 0.09474318288266659 }, { "cfg": { "lr": 0.006, "beta": 1.25 }, "mean": 0.19016914442181587 } ], "selected_cfg": { "lr": 0.001, "beta": 0.75 } }, "system_verdict": "partial", "practical_verdict": "no_effect", "mechanism_ok": 1, "system_judged": true }