Rankine–Hugoniot Front Tokens / report_bench_2026-09-02T122451.md

Failed on benchmark

Raw ⬇ ZIP

Стенд-проверка (stage-2) · промт оператора:

(универсальный)

Ответ агента:

{ "worked": false, "confidence": 9, "verdict": "The registered Burgers PDE bench completed with 8 paired seeds and a three-configuration baseline sweep. The front-token model had test MSE 0.0022266772 versus 0.0001909858 for the baseline; paired delta was +0.0020356914 with permutation p=0.0081, so the idea was significantly worse. The trained-model mechanism signature was not confirmed.", "metrics": { "baseline": "MSE mean=0.0001909858247, std=0.0000489987634; best config lr=0.006, epochs=15.", "idea": "MSE mean=0.002226677214, std=0.000878247893; selected config lr=0.006, epochs=15.", "paired_comparison": "delta_mean=+0.002035691389, idea_wins=0/8, permutation p_value=0.0081, verdict=idea worse (significant)." }, "bench_report": { "bench_version": 1, "track": "burgers_periodic_split", "model": "cnn_shared", "metric_direction": "lower is better", "n_seeds": 8, "baseline": { "best_cfg": { "lr": 0.006, "epochs": 15 }, "sweep": [ { "cfg": { "lr": 0.0015, "epochs": 15 }, "mean": 0.0002808531244227197 }, { "cfg": { "lr": 0.003, "epochs": 15 }, "mean": 0.0002247071788588073 }, { "cfg": { "lr": 0.006, "epochs": 15 }, "mean": 0.00017973236390389502 } ], "full": { "mean": 0.0001909858247017837, "std": 4.899876337576311e-05, "per_seed": [ 0.00019845497445203364, 0.00017688231309875846, 0.00018345325952395797, 0.00016013890854083002, 0.00018341024406254292, 0.00011085406731581315, 0.000293802673695609, 0.00022089015692472458 ], "n": 8 } }, "idea": { "mean": 0.0022266772139118984, "std": 0.0008782478931862389, "per_seed": [ 0.002027727896347642, 0.0031949642580002546, 0.0016515825409442186, 0.0014884979464113712, 0.0014188691275194287, 0.001367701217532158, 0.00382382795214653, 0.0028402467723935843 ], "n": 8, "selected_cfg": { "lr": 0.006, "epochs": 15 } }, "comparison": { "delta_mean": 0.0020356913892101147, "idea_wins": 0, "n_pairs": 8, "per_seed_diffs": [ 0.0018292729218956083, 0.003018081944901496, 0.0014681292814202607, 0.0013283590378705412, 0.0012354588834568858, 0.0012568471502163447, 0.003530025278450921, 0.0026193566154688597 ], "p_value": 0.0081, "mde": 0.000751264160788154, "mde_rel_pct": 393.36121513794086, "verdict": "idea worse (significant)", "system_worked": false }, "mechanism_signature": { "predicted_mean_speed_displacement": -0.00025935691202875956, "observed_mean_displacement": 0.0, "relative_error": 259.35691202875955, "confirmed": false } }, "how_to_run": "/home/maxwelhelp/main/bin/python3 bench_front_tokens.py", "files": [ "bench_front_tokens.py", "bench_report.json" ], "limitations": "Only the registered burgers_periodic_split one-step PDE track was tested. No source terms, rarefactions, multiple interacting fronts, long autoregressive rollouts, learned-position ablation, FNO comparison, or explicit FLOP measurement was included.", "system_verdict": "failed", "practical_verdict": "harms", "mechanism_ok": 0, "system_judged": true }