{ "bench_version": 1, "track": "dynamics", "model": "rnn_small", "metric_direction": "lower is better", "n_seeds": 8, "baseline": { "best_cfg": [ 0.006, 0.0 ], "sweep": [ { "cfg": [ 0.001, 0.0 ], "mean": 0.0015310924500226974 }, { "cfg": [ 0.001, 0.0001 ], "mean": 0.0015161814808379859 }, { "cfg": [ 0.003, 0.0 ], "mean": 0.0008559521666029468 }, { "cfg": [ 0.003, 0.0001 ], "mean": 0.0008401070081163198 }, { "cfg": [ 0.006, 0.0 ], "mean": 0.0005687399534508586 }, { "cfg": [ 0.006, 0.0001 ], "mean": 0.000572658478631638 } ], "full": { "mean": 0.0005194859513721894, "std": 0.0001693891077925739, "per_seed": [ 0.0005914251087233424, 0.0007362987380474806, 0.00035295303678140044, 0.0005942829302512109, 0.0002958264376502484, 0.0005069610779173672, 0.00032333534909412265, 0.0007548049325123429 ], "n": 8 } }, "idea": { "mean": 0.0005190527626837138, "std": 0.00016528570799671346, "per_seed": [ 0.0005434696213342249, 0.0007388722151517868, 0.00032320327591151, 0.000590407638810575, 0.00030803284607827663, 0.0005485645961016417, 0.0003513387346174568, 0.0007485331734642386 ], "n": 8 }, "comparison": { "delta_mean": -4.3318868847563863e-07, "idea_wins": 4, "n_pairs": 8, "per_seed_diffs": [ -4.795548738911748e-05, 2.573477104306221e-06, -2.974976086989045e-05, -3.8752914406359196e-06, 1.2206408428028226e-05, 4.1603518184274435e-05, 2.8003385523334146e-05, -6.271759048104286e-06 ], "p_value": 0.9775, "mde": 2.429226669015372e-05, "mde_rel_pct": 4.67621244154673, "verdict": "no measurable effect", "system_worked": false, "idea_cfg_sweep": [ { "cfg": [ 0.006, 0.005 ], "result": { "mean": 0.0005225717504799832, "std": 0.0001655050714685202, "per_seed": [ 0.0005708694807253778, 0.0007390371174551547, 0.0003488508809823543, 0.0006015055696479976, 0.00029773524147458375, 0.0005109026096761227, 0.0003550440014805645, 0.0007566291023977101 ], "n": 8 } }, { "cfg": [ 0.006, 0.01 ], "result": { "mean": 0.0005221629617153667, "std": 0.00016535253075975801, "per_seed": [ 0.0005585983162745833, 0.0007406040094792843, 0.0003366354794707149, 0.0005960776470601559, 0.0003025302430614829, 0.0005268516251817346, 0.00035928949364461005, 0.0007567168795503676 ], "n": 8 } }, { "cfg": [ 0.006, 0.02 ], "result": { "mean": 0.0005190527626837138, "std": 0.00016528570799671346, "per_seed": [ 0.0005434696213342249, 0.0007388722151517868, 0.00032320327591151, 0.000590407638810575, 0.00030803284607827663, 0.0005485645961016417, 0.0003513387346174568, 0.0007485331734642386 ], "n": 8 } } ] }, "mechanism_signature": { "signature": { "prediction": "PK training should reduce recurrent ensemble spread and phase KL to P_x relative to unregularized rnn_small", "observed_baseline": { "pairwise_hidden_distance": 1.643260881304741, "phase_kl_to_Px": 0.6458364666976848, "phase_kl_to_uniform": 0.6656140625776023 }, "observed_idea": { "pairwise_hidden_distance": 1.6309331208467484, "phase_kl_to_Px": 2.571629603478935, "phase_kl_to_uniform": 2.7556800191465998 }, "confirmed": false }, "idea_cfg": [ 0.006, 0.02 ], "baseline_grid": [ [ 0.001, 0.0 ], [ 0.001, 0.0001 ], [ 0.003, 0.0 ], [ 0.003, 0.0001 ], [ 0.006, 0.0 ], [ 0.006, 0.0001 ] ], "idea_grid": [ [ 0.006, 0.005 ], [ 0.006, 0.01 ], [ 0.006, 0.02 ] ] } }