{ "bench_version": 1, "track": "dynamics", "model": "rnn_small", "metric_direction": "lower is better", "n_seeds": 8, "baseline": { "best_cfg": { "lr": 0.01, "penalty": 0.0 }, "sweep": [ { "cfg": { "lr": 0.001, "penalty": 0.0 }, "mean": 0.11797566118184477 }, { "cfg": { "lr": 0.003, "penalty": 0.0 }, "mean": 0.007828571717254817 }, { "cfg": { "lr": 0.01, "penalty": 0.0 }, "mean": 0.0025760137650649995 } ], "full": { "mean": 0.002240322035504505, "std": 0.0007111673246843795, "per_seed": [ 0.0027267802506685257, 0.003143619978800416, 0.0015068432549014688, 0.0029268115758895874, 0.0025003517512232065, 0.001474660588428378, 0.002521744929254055, 0.0011217639548704028 ], "n": 8 } }, "idea": { "mean": 0.0023943046835483983, "std": 0.0006552643263981685, "per_seed": [ 0.001565085374750197, 0.001931023900397122, 0.003373584244400263, 0.002406168496236205, 0.0027771489694714546, 0.0014064890565350652, 0.002705090679228306, 0.002989846747368574 ], "n": 8 }, "comparison": { "delta_mean": 0.00015398264804389328, "idea_wins": 4, "n_pairs": 8, "per_seed_diffs": [ -0.0011616948759183288, -0.001212596078403294, 0.001866740989498794, -0.0005206430796533823, 0.0002767972182482481, -6.817153189331293e-05, 0.0001833457499742508, 0.0018680827924981713 ], "p_value": 0.69925, "mde": 0.0009989272382128146, "mde_rel_pct": 44.58855568002585, "verdict": "no significant win", "system_worked": false }, "math_sanity": { "a": 0.8, "sigma": [ [ 0.001565085374750197, 1.0062328577041626, 1.0018754711727258 ], [ 0.001931023900397122, 1.0306692123413086, 1.001999129195911 ], [ 0.003373584244400263, 1.0256351232528687, 1.0008405618216547 ], [ 0.002406168496236205, 1.0819001197814941, 1.000112452055684 ], [ 0.0027771489694714546, 0.9877385497093201, 1.001914544541687 ], [ 0.0014064890565350652, 1.1168031692504883, 1.0022314286996865 ], [ 0.002705090679228306, 1.0017019510269165, 0.9949402147998869 ], [ 0.002989846747368574, 0.9434056282043457, 0.9980177719281845 ] ], "K_scalar": 1.0 }, "idea_sweep": { "configs": [ { "lr": 0.01, "penalty": 1.0 }, { "lr": 0.001, "penalty": 3.0 }, { "lr": 0.003, "penalty": 10.0 } ], "best_cfg": { "lr": 0.01, "penalty": 1.0 } }, "mechanism_signature": { "noise_sigma": 0.2, "predicted_lifted_rho_mean": 1.024260826408863, "observed_hidden_second_moment_ratio_mean": 1.0002414467769276, "relative_error": 0.02345045227996197, "confirmed": true, "source": "trained idea GRU models on dynamics test rollout" } }