{ "bench_version": 1, "track": "dynamics", "model": "rnn_small", "metric_direction": "lower is better", "n_seeds": 8, "baseline": { "best_cfg": { "lr": 0.006, "epochs": 18, "rho": 0.9, "k": 2 }, "sweep": [ { "cfg": { "lr": 0.001, "epochs": 18, "rho": 0.9, "k": 2 }, "mean": 0.0026806407840922475 }, { "cfg": { "lr": 0.003, "epochs": 18, "rho": 0.9, "k": 2 }, "mean": 0.001453446806408465 }, { "cfg": { "lr": 0.006, "epochs": 18, "rho": 0.9, "k": 2 }, "mean": 0.0007141287642298266 } ], "full": { "mean": 0.0007108385761966929, "std": 0.00020260791778280052, "per_seed": [ 0.0008331689168699086, 0.0007008879329077899, 0.0006333848577924073, 0.0008832181920297444, 0.0010298240231350064, 0.0005573644884862006, 0.00032093568006530404, 0.0007279245182871819 ], "n": 8 } }, "idea": { "mean": 0.0006244764626899268, "std": 0.00017259395969689844, "per_seed": [ 0.0005345472018234432, 0.0004471810825634748, 0.0004362085019238293, 0.0008414528565481305, 0.00048033404164016247, 0.0008765239617787302, 0.0005815455224364996, 0.0007980185328051448 ], "n": 8 }, "comparison": { "delta_mean": -8.636211350676604e-05, "idea_wins": 5, "n_pairs": 8, "per_seed_diffs": [ -0.0002986217150464654, -0.00025370685034431517, -0.00019717635586857796, -4.1765335481613874e-05, -0.000549489981494844, 0.0003191594732925296, 0.00026060984237119555, 7.009401451796293e-05 ], "p_value": 0.47205, "mde": 0.0002470609130160734, "mde_rel_pct": 34.75626130730844, "verdict": "no significant win", "system_worked": false }, "sweep_parity": { "union_grid": [ { "lr": 0.001, "epochs": 18, "rho": 0.9, "k": 2 }, { "lr": 0.003, "epochs": 18, "rho": 0.9, "k": 2 }, { "lr": 0.006, "epochs": 18, "rho": 0.9, "k": 2 } ], "idea_sweep": [ { "cfg": { "lr": 0.001, "epochs": 18, "rho": 0.9, "k": 2 }, "mean": 0.0019245385192334652 }, { "cfg": { "lr": 0.003, "epochs": 18, "rho": 0.9, "k": 2 }, "mean": 0.0012154859578004107 }, { "cfg": { "lr": 0.006, "epochs": 18, "rho": 0.9, "k": 2 }, "mean": 0.0005648474107147194 } ] }, "adaptation": { "rho": 0.9, "k": 2, "probe_budget": "one batch per epoch" }, "mechanism_signature": { "claim": "discounted probe gap is lower late than over training on trained dynamics models", "predicted_late_gap_less_than_mean": true, "observed_mean_gap": 0.0, "observed_late_gap": 0.0, "relative_change": 0.0, "trained_model_measurements": [ { "seed": 0, "gap_mean": 0.0, "gap_last": 0.0, "final_lr": 0.006, "down_events": 0, "test_mse": 0.0005345472018234432 }, { "seed": 1, "gap_mean": 0.0, "gap_last": 0.0, "final_lr": 0.006, "down_events": 0, "test_mse": 0.0004471810825634748 }, { "seed": 2, "gap_mean": 0.0, "gap_last": 0.0, "final_lr": 0.006, "down_events": 0, "test_mse": 0.0004362085019238293 }, { "seed": 3, "gap_mean": 0.0, "gap_last": 0.0, "final_lr": 0.006, "down_events": 0, "test_mse": 0.0008414528565481305 }, { "seed": 4, "gap_mean": 0.0, "gap_last": 0.0, "final_lr": 0.006, "down_events": 0, "test_mse": 0.00048033404164016247 }, { "seed": 5, "gap_mean": 0.0, "gap_last": 0.0, "final_lr": 0.006, "down_events": 0, "test_mse": 0.0008765239617787302 }, { "seed": 6, "gap_mean": 0.0, "gap_last": 0.0, "final_lr": 0.006, "down_events": 0, "test_mse": 0.0005815455224364996 }, { "seed": 7, "gap_mean": 0.0, "gap_last": 0.0, "final_lr": 0.006, "down_events": 0, "test_mse": 0.0007980185328051448 } ], "confirmed": false } }