{ "bench_version": 1, "track": "dynamics", "model": "rnn_small", "metric_direction": "lower is better", "n_seeds": 8, "baseline": { "best_cfg": { "lr": 0.01, "consensus": 0.0 }, "sweep": [ { "cfg": { "lr": 0.001, "consensus": 0.0 }, "mean": 0.19337305054068565 }, { "cfg": { "lr": 0.001, "consensus": 0.01 }, "mean": 0.19314046204090118 }, { "cfg": { "lr": 0.001, "consensus": 0.05 }, "mean": 0.1922968477010727 }, { "cfg": { "lr": 0.003, "consensus": 0.0 }, "mean": 0.014081272296607494 }, { "cfg": { "lr": 0.003, "consensus": 0.01 }, "mean": 0.013959631556645036 }, { "cfg": { "lr": 0.003, "consensus": 0.05 }, "mean": 0.013560101622715592 }, { "cfg": { "lr": 0.01, "consensus": 0.0 }, "mean": 0.004480039002373815 }, { "cfg": { "lr": 0.01, "consensus": 0.01 }, "mean": 0.004745688289403915 }, { "cfg": { "lr": 0.01, "consensus": 0.05 }, "mean": 0.0076980371959507465 } ], "full": { "mean": 0.0037503628409467638, "std": 0.0010392951000048232, "per_seed": [ 0.003767967689782381, 0.004212214145809412, 0.0051866089925169945, 0.004753365181386471, 0.00401176605373621, 0.002003958448767662, 0.002254849299788475, 0.0038121729157865047 ], "n": 8 } }, "idea": { "mean": 0.0033386775467079133, "std": 0.000882734589731385, "per_seed": [ 0.0032974749337881804, 0.004293782636523247, 0.00453130342066288, 0.003945973236113787, 0.003240686608478427, 0.001959612825885415, 0.0020674322731792927, 0.003373154439032078 ], "n": 8 }, "comparison": { "delta_mean": -0.0004116852942388505, "idea_wins": 7, "n_pairs": 8, "per_seed_diffs": [ -0.0004704927559942007, 8.156849071383476e-05, -0.0006553055718541145, -0.0008073919452726841, -0.0007710794452577829, -4.434562288224697e-05, -0.00018741702660918236, -0.00043901847675442696 ], "p_value": 0.0245, "mde": 0.00027872874101319965, "mde_rel_pct": 7.432047320062389, "verdict": "idea better (significant)", "system_worked": true }, "mechanism_signature": { "pins": [ 2, 0 ], "lambda_min_grounded": 0.21781201402076653, "test_representation_disagreement": 0.01838405802845955, "task_prediction_disagreement": 0.0007268482004292309, "baseline_random_gap": 0.2000357110567112, "observed_vs_predicted": "task-independent disagreement is measured on trained representations; no exact decay slope is identifiable from final snapshots", "confirmed": false }, "idea_sweep": [ { "cfg": { "lr": 0.01, "consensus": 0.0 }, "result": { "mean": 0.0033386775467079133, "std": 0.000882734589731385, "per_seed": [ 0.0032974749337881804, 0.004293782636523247, 0.00453130342066288, 0.003945973236113787, 0.003240686608478427, 0.001959612825885415, 0.0020674322731792927, 0.003373154439032078 ], "n": 8 } }, { "cfg": { "lr": 0.01, "consensus": 0.01 }, "result": { "mean": 0.003485470893792808, "std": 0.0008992386183535255, "per_seed": [ 0.0035131555050611496, 0.0043441238813102245, 0.004703593906015158, 0.004132850561290979, 0.003451108932495117, 0.00200086017139256, 0.002212213585153222, 0.003525860607624054 ], "n": 8 } }, { "cfg": { "lr": 0.01, "consensus": 0.0 }, "result": { "mean": 0.0033386775467079133, "std": 0.000882734589731385, "per_seed": [ 0.0032974749337881804, 0.004293782636523247, 0.00453130342066288, 0.003945973236113787, 0.003240686608478427, 0.001959612825885415, 0.0020674322731792927, 0.003373154439032078 ], "n": 8 } } ], "baseline_sweep_union": [ { "lr": 0.001, "consensus": 0.0 }, { "lr": 0.001, "consensus": 0.01 }, { "lr": 0.001, "consensus": 0.05 }, { "lr": 0.003, "consensus": 0.0 }, { "lr": 0.003, "consensus": 0.01 }, { "lr": 0.003, "consensus": 0.05 }, { "lr": 0.01, "consensus": 0.0 }, { "lr": 0.01, "consensus": 0.01 }, { "lr": 0.01, "consensus": 0.05 } ] }