{ "bench_version": 1, "track": "dynamics", "model": "matched_ternary_rnn", "metric_direction": "lower is better", "n_seeds": 8, "baseline": { "best_cfg": { "lr": 0.01, "weight_decay": 0.0, "epochs": 12 }, "sweep": [ { "cfg": { "lr": 0.001, "weight_decay": 0.0, "epochs": 12 }, "mean": 0.020193250384181738 }, { "cfg": { "lr": 0.003, "weight_decay": 0.0, "epochs": 12 }, "mean": 0.00683436612598598 }, { "cfg": { "lr": 0.01, "weight_decay": 0.0, "epochs": 12 }, "mean": 0.002462160831782967 }, { "cfg": { "lr": 0.003, "weight_decay": 0.0001, "epochs": 12 }, "mean": 0.006820366135798395 }, { "cfg": { "lr": 0.003, "weight_decay": 0.001, "epochs": 12 }, "mean": 0.0067008426412940025 } ], "full": { "mean": 0.0032130961772054434, "std": 0.0010584401251843786, "per_seed": [ 0.0025007869116961956, 0.0035816810559481382, 0.0025283501017838717, 0.001237825257703662, 0.0037454410921782255, 0.0029973499476909637, 0.004620881285518408, 0.0044924537651240826 ], "n": 8 } }, "idea": { "mean": 0.041399288922548294, "std": 0.005352299829694784, "per_seed": [ 0.043414220213890076, 0.03751295432448387, 0.051180846989154816, 0.048405274748802185, 0.037778589874506, 0.035160426050424576, 0.03840555250644684, 0.039336446672677994 ], "n": 8, "best_cfg": { "lr": 0.01, "weight_decay": 0.0, "epochs": 12, "R": 1.2 }, "sweep": [ { "cfg": { "lr": 0.001, "weight_decay": 0.0, "epochs": 12, "R": 0.6 }, "mean": 0.04771255608648062 }, { "cfg": { "lr": 0.003, "weight_decay": 0.0, "epochs": 12, "R": 0.9 }, "mean": 0.05168276559561491 }, { "cfg": { "lr": 0.01, "weight_decay": 0.0, "epochs": 12, "R": 1.2 }, "mean": 0.04512832406908274 } ] }, "comparison": { "delta_mean": 0.03818619274534285, "idea_wins": 0, "n_pairs": 8, "per_seed_diffs": [ 0.04091343330219388, 0.03393127326853573, 0.048652496887370944, 0.04716744949109852, 0.03403314878232777, 0.03216307610273361, 0.03378467122092843, 0.03484399290755391 ], "p_value": 0.0081, "mde": 0.005472251358790593, "mde_rel_pct": 170.3108483839418, "verdict": "idea worse (significant)", "system_worked": false }, "mechanism_signature": { "prediction": "disorder above Rc suppresses persistent mean-field basin magnetization", "predicted_Rc": 0.7978845608028654, "tested_R": 1.2, "observed_mean_abs_late_m": 0.010480209394700069, "observed_per_seed": [ 0.016682207817211747, 0.012151359231211245, 0.008320131455548108, 0.01342325797304511, 0.006388145731762052, 0.0017870731899165548, 0.01985514839179814, 0.0052343513671075925 ], "confirmed": true }, "math_sanity": { "Rc_predicted": 0.7978845608028654, "rows": [ { "R": 0.6, "observed_slope": 1.3298076013374933, "predicted_slope": 1.329807601338109, "abs_error": 6.157296894571118e-13 }, { "R": 0.7978845608028654, "observed_slope": 0.9999999999997379, "predicted_slope": 1.0, "abs_error": 2.6212365611399946e-13 }, { "R": 1.0, "observed_slope": 0.7978845608027323, "predicted_slope": 0.7978845608028654, "abs_error": 1.3311574065255627e-13 } ], "max_abs_error": 6.157296894571118e-13 }, "protocol_notes": "Dynamics selected because the idea targets recurrent stability/basin dependence. Baseline and idea share trainable input, recurrent, and head maps; only state update/disorder differs." }