Detailed-Balance Graph Transport Layer / report_bench_2026-09-01T234458.md

Failed on benchmark

Raw ⬇ ZIP

Стенд-проверка (stage-2) · промт оператора:

(универсальный)

Ответ агента:

{ "worked": false, "confidence": 9, "verdict": "Built a local detailed-balance transport modification for the benchmark rnn_small dynamics model and evaluated it on the structurally matched controlled-pendulum rollout task. The mechanism preserved latent mass with relative error 3.49e-8 and decreased measured free energy, but the observed-vs-predicted finite-step energy change differed by 50.1%, so the signature was not confirmed quantitatively. On the independent task metric, transport MSE was 0.0009517 versus baseline 0.0004291, with paired delta +0.0005225 and permutation p=0.0081; therefore the idea was significantly worse.", "metrics": { "baseline": "dynamics/rnn_small tuned baseline: test MSE mean 0.0004291251, std 0.0001791583, 8 paired seeds; best lr=0.01.", "idea": "detailed-balance latent transport: test MSE mean 0.0009516680, std 0.0002400580, 8 paired seeds; best idea setting lr=0.0033333, dt=0.05.", "paired_delta": "idea - baseline = +0.0005225429 MSE; idea wins 0/8 seeds; permutation p=0.0081; verdict idea worse (significant).", "mechanism_signature": "mass conservation relative error 3.493e-8; observed energy change -0.0034661; predicted derivative -0.0463764; finite-step relative error 0.50085; confirmed=false." }, "bench_report": { "bench_version": 1, "track": "dynamics", "model": "rnn_small", "metric_direction": "lower is better", "n_seeds": 8, "baseline": { "best_cfg": { "lr": 0.01 }, "sweep": [ { "cfg": { "lr": 0.001 }, "mean": 0.001443413842935115 }, { "cfg": { "lr": 0.003 }, "mean": 0.0009000279824249446 }, { "cfg": { "lr": 0.01 }, "mean": 0.0005028522355132736 } ], "full": { "mean": 0.00042912505523418076, "std": 0.00017915832886079294, "per_seed": [ 0.000361639482434839, 0.00038413508445955813, 0.00039487716276198626, 0.0008707572123967111, 0.0004429189139045775, 0.0002050218463409692, 0.00038642011350020766, 0.00038723062607459724 ], "n": 8 }, "union_extra": [ { "cfg": { "lr": 0.0033333333333333335 }, "full": { "mean": 0.0008873757251421921, "std": 0.00023680384896603653, "per_seed": [ 0.0007913073641248047, 0.000795992324128747, 0.0006051670643500984, 0.001341381692327559, 0.0006803745054639876, 0.0007620747201144695, 0.0009469457436352968, 0.0011757623869925737 ], "n": 8 } }, { "cfg": { "lr": 0.03 }, "full": { "mean": 0.00019077555771218613, "std": 0.00010217559367124779, "per_seed": [ 0.00023975277144927531, 0.00015833131328690797, 0.00018476269906386733, 0.00011282971536275, 0.0004178391245659441, 7.224319415399805e-05, 0.00023147270258050412, 0.00010897294123424217 ], "n": 8 } } ] }, "idea": { "best_cfg": { "lr": 0.0033333333333333335, "dt": 0.05 }, "mean": 0.0009516679710941389, "std": 0.0002400579622568702, "per_seed": [ 0.0009455473045818508, 0.0009278051438741386, 0.0008952125790528953, 0.0009500241139903665, 0.0007523722597397864, 0.0006179050542414188, 0.0015001472784206271, 0.001024330034852028 ], "n": 8, "sweep": [ { "cfg": { "lr": 0.0033333333333333335, "dt": 0.05 }, "mean": 0.0009296472853748128 }, { "cfg": { "lr": 0.01, "dt": 0.05 }, "mean": null }, { "cfg": { "lr": 0.03, "dt": 0.05 }, "mean": null } ] }, "comparison": { "delta_mean": 0.0005225429158599582, "idea_wins": 0, "n_pairs": 8, "per_seed_diffs": [ 0.0005839078221470118, 0.0005436700594145805, 0.000500335416290909, 7.926690159935535e-05, 0.0003094533458352089, 0.00041288320790044963, 0.0011137271649204195, 0.0006370994087774307 ], "p_value": 0.0081, "mde": 0.00024909869994053333, "mde_rel_pct": 58.04804378168876, "verdict": "idea worse (significant)", "system_worked": false }, "mechanism_signature": { "mass_conservation_rel_error": 3.493384204134031e-08, "observed_energy_change": -0.003466067530098371, "predicted_energy_derivative": -0.04637642973102629, "derivative_relative_error": 0.5008485137480757, "energy_dissipates": 1.0, "confirmed": false }, "protocol_notes": { "structural_match": "controlled pendulum rollout tests stability of recurrent dynamical states", "paired_seeds": 8, "epochs": 20, "samples_per_seed": [ 400, 200 ], "device": "cuda" } }, "how_to_run": "/home/maxwelhelp/main/bin/python3 bench_experiment.py", "files": [ "bench_experiment.py", "bench_report.json" ], "limitations": "Only the built-in dynamics track was tested; no graph-specific benchmark, implicit sparse solver, Cora, sequence diffusion, calibration, FLOP accounting, or longer-horizon stability study was run. The idea sweep settings at lr=0.01 and lr=0.03 produced non-finite training metrics, while the baseline remained stable at those shared learning rates.", "system_verdict": "failed", "practical_verdict": "harms", "mechanism_ok": 0, "system_judged": true }