Differentiable Physics-Equilibrium Projection / report_bench_v2.md
Beats tuned baseline
Переаудит stage-2 (2026-09-05)
Промт оператора:
STAGE-2 RE-AUDIT (manual, operator-approved): replace the degenerate projection with an honest implementation where gradient flows through the claimed mechanism; full protocol: 8 paired seeds, lr-grid parity both sides, permutation test, RULE 0.1 self-check on every seed, weights saved.
Ответ (система):
{ "ts": "2026-09-05T02:42:12", "mode": "bench", "prompt": "STAGE-2 RE-AUDIT (manual, operator-approved): replace the degenerate projection with an honest implementation where gradient flows through the claimed mechanism; full protocol: 8 paired seeds, lr-grid parity both sides, permutation test, RULE 0.1 self-check on every seed, weights saved.", "worked": true, "system_verdict": "worked", "mechanism_ok": true, "practical_verdict": "helps", "confidence": 9, "verdict": "RE-AUDIT PASSED (honest implementation). The degenerate one-liner projection was replaced: the network now predicts the hidden stiffness parameter a_hat from noisy indirect features, and the differentiable Newton projection (IFT backward dz/da=-z/J) solves F(z;a_hat,u)=z^3+a_hat*z-u, so the loss gradient flows through the network. Baseline (direct MLP on x,u, same size/budget, tuned over the same lr grid) loses on all 8 paired seeds, p=0.0081. RULE 0.1 self-check passed on every seed x lr: gradient norms decay from ~0.05 to ~3e-05 during training (no constant zero), randomizing network weights changes outputs (relative_delta up to 0.27, always > 0.05). The earlier 'win' of 2026-09-01 was voided (network bypassed); this round replaces it with a valid comparison.", "metrics": { "baseline_mean": 0.0004695942006947007, "idea_mean": 0.00022121649271866772, "improvement_pct": 52.9, "idea_wins": 8, "n_pairs": 8, "p_value": 0.0081, "a_hat_mse_mean": 0.004151654953602701, "self_check_all_seeds_ok": true, "max_relative_delta": 0.371749 }, "bench_report": { "bench_version": 1, "track": "cubic_equilibrium_a_estimation (custom, in-folder; structural match: z = root(z^3 + a(x)*z - u) is exactly the idea's claimed equilibrium class)", "model": "mlp_32x32_tanh (idea: AParamNet 4->32->32->1 + softplus + ImplicitCubic Newton-20; baseline: DirectMLP 5->32->32->1, sees x and u)", "metric_direction": "lower is better", "n_seeds": 8, "epochs": 300, "grid_parity": { "grid": [ 0.003, 0.01, 0.03 ], "baseline_means": { "0.003": 0.0026160763518419117, "0.01": 0.0005651257015415467, "0.03": 0.0004695942006947007 }, "idea_means": { "0.003": 0.00024374518761760555, "0.01": 0.00022121649271866772, "0.03": 0.0002691956779017346 }, "search_space_parity": true }, "baseline": { "best_cfg": { "lr": 0.03, "epochs": 300 }, "sweep": [ { "cfg": { "lr": 0.003 }, "mean": 0.0026160763518419117 }, { "cfg": { "lr": 0.01 }, "mean": 0.0005651257015415467 }, { "cfg": { "lr": 0.03 }, "mean": 0.0004695942006947007 } ], "full": { "mean": 0.0004695942006947007, "std": 0.00013169171442929794, "per_seed": [ 0.000339631165843457, 0.000445100711658597, 0.00030270591378211975, 0.0007381809409707785, 0.0004293923848308623, 0.0006018560379743576, 0.00047620252007618546, 0.0004236839304212481 ], "n": 8 } }, "idea": { "mean": 0.00022121649271866772, "std": 2.5303392934561233e-05, "per_seed": [ 0.00020260778546798974, 0.00018607612582854927, 0.00022137281484901905, 0.0002577590639702976, 0.00023610987409483641, 0.0002327339316252619, 0.0001864753576228395, 0.0002465969882905483 ], "n": 8 }, "comparison": { "delta_mean": -0.000248377707976033, "idea_wins": 8, "n_pairs": 8, "per_seed_diffs": [ -0.00013702338037546724, -0.0002590245858300477, -8.13330989331007e-05, -0.0004804218770004809, -0.00019328251073602587, -0.0003691221063490957, -0.00028972716245334595, -0.00017708694213069975 ], "p_value": 0.0081, "mde": 0.00010886910199832132, "mde_rel_pct": 23.183655555640232, "verdict": "idea better (significant)", "system_worked": true, "baseline_mean": 0.0004695942006947007, "idea_mean": 0.00022121649271866772 }, "mechanism_signature": { "confirmed": true, "gradient_flows": true, "ift_backward": "dz/da = -z/J, dz/du = 1/J, J = 3z^2 + a_hat > 0 (a_hat = softplus(net(x))+0.05)", "self_check_all_seeds_ok": true, "self_check": [ { "seed": 0, "lr": 0.003, "grad_norm_first": 0.05369017, "grad_norm_last": 0.00011467, "output_delta": 0.13677967, "relative_delta": 0.264168, "network_matters": true }, { "seed": 0, "lr": 0.01, "grad_norm_first": 0.05369017, "grad_norm_last": 2.584e-05, "output_delta": 0.140783, "relative_delta": 0.272181, "network_matters": true }, { "seed": 0, "lr": 0.03, "grad_norm_first": 0.05369017, "grad_norm_last": 0.00126087, "output_delta": 0.14829852, "relative_delta": 0.28838, "network_matters": true }, { "seed": 1, "lr": 0.003, "grad_norm_first": 0.06303131, "grad_norm_last": 0.00011149, "output_delta": 0.14938839, "relative_delta": 0.282632, "network_matters": true }, { "seed": 1, "lr": 0.01, "grad_norm_first": 0.06303131, "grad_norm_last": 3.273e-05, "output_delta": 0.14870496, "relative_delta": 0.28067, "network_matters": true }, { "seed": 1, "lr": 0.03, "grad_norm_first": 0.06303131, "grad_norm_last": 2.077e-05, "output_delta": 0.15761301, "relative_delta": 0.297171, "network_matters": true }, { "seed": 2, "lr": 0.003, "grad_norm_first": 0.0651998, "grad_norm_last": 8.441e-05, "output_delta": 0.13411286, "relative_delta": 0.243048, "network_matters": true }, { "seed": 2, "lr": 0.01, "grad_norm_first": 0.0651998, "grad_norm_last": 3.367e-05, "output_delta": 0.13443458, "relative_delta": 0.243553, "network_matters": true }, { "seed": 2, "lr": 0.03, "grad_norm_first": 0.0651998, "grad_norm_last": 0.00014135, "output_delta": 0.13707605, "relative_delta": 0.248529, "network_matters": true }, { "seed": 3, "lr": 0.003, "grad_norm_first": 0.0478717, "grad_norm_last": 7.282e-05, "output_delta": 0.1600959, "relative_delta": 0.303371, "network_matters": true }, { "seed": 3, "lr": 0.01, "grad_norm_first": 0.0478717, "grad_norm_last": 2.8e-05, "output_delta": 0.16947965, "relative_delta": 0.321804, "network_matters": true }, { "seed": 3, "lr": 0.03, "grad_norm_first": 0.0478717, "grad_norm_last": 2.299e-05, "output_delta": 0.18700044, "relative_delta": 0.355268, "network_matters": true }, { "seed": 4, "lr": 0.003, "grad_norm_first": 0.06093026, "grad_norm_last": 0.00016984, "output_delta": 0.11551933, "relative_delta": 0.215875, "network_matters": true }, { "seed": 4, "lr": 0.01, "grad_norm_first": 0.06093026, "grad_norm_last": 3.269e-05, "output_delta": 0.11578429, "relative_delta": 0.216497, "network_matters": true }, { "seed": 4, "lr": 0.03, "grad_norm_first": 0.06093026, "grad_norm_last": 0.00775644, "output_delta": 0.12103881, "relative_delta": 0.229614, "network_matters": true }, { "seed": 5, "lr": 0.003, "grad_norm_first": 0.05086348, "grad_norm_last": 8.827e-05, "output_delta": 0.16617334, "relative_delta": 0.31593, "network_matters": true }, { "seed": 5, "lr": 0.01, "grad_norm_first": 0.05086348, "grad_norm_last": 3.019e-05, "output_delta": 0.17603016, "relative_delta": 0.334429, "network_matters": true }, { "seed": 5, "lr": 0.03, "grad_norm_first": 0.05086348, "grad_norm_last": 6.138e-05, "output_delta": 0.19581376, "relative_delta": 0.371749, "network_matters": tru