{ "bench_version": 1, "track": "dynamics", "model": "rnn_small", "metric_direction": "lower is better", "n_seeds": 8, "baseline": { "best_cfg": { "lr": 0.006, "epochs": 10 }, "sweep": [ { "cfg": { "lr": 0.0015, "epochs": 10 }, "mean": 0.012571729021146894 }, { "cfg": { "lr": 0.003, "epochs": 10 }, "mean": 0.00390045705717057 }, { "cfg": { "lr": 0.006, "epochs": 10 }, "mean": 0.0027824681892525405 } ], "full": { "mean": 0.003422115682042204, "std": 0.0013572789915321942, "per_seed": [ 0.003793726908043027, 0.0012769249733537436, 0.004308650735765696, 0.0017505701398476958, 0.005116218701004982, 0.00515680992975831, 0.0032697871793061495, 0.002704236889258027 ], "n": 8 } }, "idea": { "mean": 0.007973545085405931, "std": 0.002709377013131552, "per_seed": [ 0.0038756646681576967, 0.01088617742061615, 0.004916933830827475, 0.007167609874159098, 0.00999990664422512, 0.011676865629851818, 0.009276396594941616, 0.0059888060204684734 ], "n": 8 }, "comparison": { "delta_mean": 0.004551429403363727, "idea_wins": 0, "n_pairs": 8, "per_seed_diffs": [ 8.19377601146698e-05, 0.009609252447262406, 0.000608283095061779, 0.005417039734311402, 0.0048836879432201385, 0.006520055700093508, 0.006006609415635467, 0.0032845691312104464 ], "p_value": 0.0081, "mde": 0.0026359025513121824, "mde_rel_pct": 77.02552444805619, "verdict": "idea worse (significant)", "system_worked": false }, "math_check": { "ess_in_range": true, "ess_shift_error": 1.1102230246251565e-16 }, "idea_sweep": [ { "cfg": { "lr": 0.0015, "epochs": 10 }, "mean": 0.010918576503172517 }, { "cfg": { "lr": 0.003, "epochs": 10 }, "mean": 0.006711596448440105 }, { "cfg": { "lr": 0.006, "epochs": 10 }, "mean": 0.006873207807075232 } ], "runtime_sec": 28.547458171844482, "mechanism_signature": { "mean_eta": 0.7777270545781338, "min_eta": 0.6528541115925, "mean_drift": 0.32532993668262633, "low_eta_levels": 0, "initial_K": 4, "final_K": 1, "total_steps": 40, "predicted_low_eta_under_drift": true, "observed_low_eta_fraction": 0.0, "confirmed": false } }