OT-Sufficient Bottleneck Flow Matching / report_bench_2026-08-31T122644.md

Mechanism confirmed, baseline not beaten

Raw ⬇ ZIP

Стенд-проверка (stage-2) · промт оператора:

(универсальный)

Ответ агента:

{ "worked": false, "confidence": 10, "verdict": "The registered conditional_multitoken_diffusion benchmark was rerun with 8 paired seeds, a tuned baseline sweep, and three idea locality settings. The mechanism signature was confirmed, but OT flow matching was significantly worse on the standard test MSE: 0.7549 versus 0.3607, paired delta +0.3942, permutation p=0.0081. The protocol therefore requires worked=false.", "metrics": { "baseline": "Mean test MSE 0.3607390486 over 8 seeds; tuned lr=0.01 after sweep [0.001, 0.003, 0.01].", "idea": "Mean test MSE 0.7549030110 over 8 seeds; best lambda=8.0 at lr=0.01. Paired delta +0.3941639625, p=0.0081; idea worse significantly." }, "bench_report": { "bench_version": 1, "track": "conditional_multitoken_diffusion", "model": "shared_encoder_mlp", "metric_direction": "lower is better", "n_seeds": 8, "baseline": { "best_cfg": { "lr": 0.01, "epochs": 12 }, "sweep": [ { "cfg": { "lr": 0.001, "epochs": 12 }, "mean": 0.390290267765522 }, { "cfg": { "lr": 0.003, "epochs": 12 }, "mean": 0.3733091354370117 }, { "cfg": { "lr": 0.01, "epochs": 12 }, "mean": 0.36269813030958176 } ], "full": { "mean": 0.3607390485703945, "std": 0.01654029145653189, "per_seed": [ 0.37062346935272217, 0.32732465863227844, 0.3899999260902405, 0.36284446716308594, 0.3566600978374481, 0.3669852316379547, 0.3537239730358124, 0.3577505648136139 ], "n": 8 } }, "idea": { "per_seed": [ 0.829505980014801, 0.8032728433609009, 0.6855372190475464, 0.7373040318489075, 0.7540731430053711, 0.773855447769165, 0.7264139652252197, 0.7292614579200745 ], "mean": 0.7549030110239983, "std": 0.046067620085947815 }, "comparison": { "delta_mean": 0.39416396245360374, "idea_wins": 0, "n_pairs": 8, "per_seed_diffs": [ 0.45888251066207886, 0.47594818472862244, 0.2955372190475464, 0.37445956468582153, 0.397413045167923, 0.4068702161312103, 0.37268999218940735, 0.37151089310646057 ], "p_value": 0.0081, "mde": 0.047023554672292786, "mde_rel_pct": 13.03533810898673, "verdict": "idea worse (significant)", "system_worked": false }, "mechanism_signature": { "mechanism_signature": { "observed_token_std": 0.7545899152755737, "predicted_token_std": 0.7607559561729431, "observed_sample_mean_std": 0.14106108248233795, "predicted_sample_mean_std": 0.1528526395559311, "confirmed": true }, "idea_lambda": 8.0, "idea_runs": [ { "lambda": 0.0, "result": { "per_seed": [ 0.924494743347168, 1.0625691413879395, 0.7344903349876404, 0.912911593914032, 0.8331963419914246, 0.8818286657333374, 0.8657779693603516, 0.7827775478363037 ], "mean": 0.8747557923197746, "std": 0.09942397904692929 } }, { "lambda": 2.0, "result": { "per_seed": [ 0.871182918548584, 0.8115776777267456, 0.6836869716644287, 0.7553004026412964, 0.7379289865493774, 0.782780110836029, 0.7276151776313782, 0.7247848510742188 ], "mean": 0.7618571370840073, "std": 0.058718477961378 } }, { "lambda": 8.0, "result": { "per_seed": [ 0.829505980014801, 0.8032728433609009, 0.6855372190475464, 0.7373040318489075, 0.7540731430053711, 0.773855447769165, 0.7264139652252197, 0.7292614579200745 ], "mean": 0.7549030110239983, "std": 0.046067620085947815 } } ] } }, "how_to_run": "/home/maxwelhelp/main/bin/python3 ot_registered_bench.py", "files": [ "ot_registered_bench.py", "bench_report.json" ], "limitations": "Used 400 training and 400 test examples, 12 epochs, batch size 64, a 1-D bottleneck, 25 Euler steps, and three lambda values. Larger models, longer training, alternate flow parameterizations, likelihood/Wasserstein secondary metrics, and real-world data were not tested.", "system_verdict": "failed", "practical_verdict": "harms", "mechanism_ok": 0, "system_judged": true }