{ "bench_version": 1, "track": "dynamics", "model": "factor_rnn", "metric_direction": "lower is better", "n_seeds": 8, "baseline": { "best_cfg": { "lr": 0.006, "epochs": 18, "beta": 0.0 }, "sweep": [ { "cfg": { "lr": 0.0015, "epochs": 18, "beta": 0.0 }, "mean": 0.11639470420777798 }, { "cfg": { "lr": 0.003, "epochs": 18, "beta": 0.0 }, "mean": 0.058107024524360895 }, { "cfg": { "lr": 0.006, "epochs": 18, "beta": 0.0 }, "mean": 0.026168195763602853 } ], "full": { "mean": 0.02109241997823119, "std": 0.014265532680015599, "per_seed": [ 0.05811716988682747, 0.019254598766565323, 0.013698350638151169, 0.01360266376286745, 0.014953133650124073, 0.012289082631468773, 0.021011028438806534, 0.015813332051038742 ], "n": 8 }, "full_all_union": [ { "cfg": { "lr": 0.0015, "epochs": 18, "beta": 0.0 }, "mean": 0.08842666260898113, "std": 0.06345898927987136, "per_seed": [ 0.2491457462310791, 0.04528465121984482, 0.08107621967792511, 0.09007219970226288, 0.05925949290394783, 0.04771618917584419, 0.09064487367868423, 0.044213928282260895 ], "n": 8 }, { "cfg": { "lr": 0.003, "epochs": 18, "beta": 0.0 }, "mean": 0.04415802680887282, "std": 0.03152132845115148, "per_seed": [ 0.1255890429019928, 0.02912258543074131, 0.03296443447470665, 0.04475203529000282, 0.029448043555021286, 0.025108061730861664, 0.041623830795288086, 0.024656180292367935 ], "n": 8 }, { "cfg": { "lr": 0.006, "epochs": 18, "beta": 0.0 }, "mean": 0.02109241997823119, "std": 0.014265532680015599, "per_seed": [ 0.05811716988682747, 0.019254598766565323, 0.013698350638151169, 0.01360266376286745, 0.014953133650124073, 0.012289082631468773, 0.021011028438806534, 0.015813332051038742 ], "n": 8 } ] }, "idea": { "mean": 0.022512523224577308, "std": 0.012331270086282655, "per_seed": [ 0.04500043764710426, 0.017105672508478165, 0.03219568356871605, 0.034598458558321, 0.01256189402192831, 0.008819940499961376, 0.019357675686478615, 0.010460423305630684 ], "n": 8 }, "comparison": { "delta_mean": 0.001420103246346116, "idea_wins": 6, "n_pairs": 8, "per_seed_diffs": [ -0.013116732239723206, -0.002148926258087158, 0.01849733293056488, 0.02099579479545355, -0.0023912396281957626, -0.0034691421315073967, -0.001653352752327919, -0.005352908745408058 ], "p_value": 0.78325, "mde": 0.009957143075416026, "mde_rel_pct": 47.20721038976311, "verdict": "no significant win", "system_worked": false }, "mechanism_signature": { "track_structure": "controlled pendulum multi-step dynamics", "metric": 0.04500043764710426, "max_component_violation": -0.35021981596946716, "max_observed_ratio": 0.7172038555145264, "predicted_bound": "nonpositive violation", "observed_envelope_row_sum": 2.4505488872528076, "observed_sum_abs_A": 45.71932601928711, "observed_sum_P": 65.28011322021484, "confirmed": true, "config": { "lr": 0.006, "epochs": 18, "beta": 0.02, "target": 0.92 }, "wall_seconds": 27.75654865699471 }, "idea_grid": [ { "cfg": { "lr": 0.0015, "epochs": 18, "beta": 0.005, "target": 0.92 }, "mean": 0.09474506694823503, "std": 0.10094635313979229, "per_seed": [ 0.35983920097351074, 0.059099163860082626, 0.058137185871601105, 0.07874950021505356, 0.054427292197942734, 0.044902503490448, 0.0674169585108757, 0.035388730466365814 ], "n": 8 }, { "cfg": { "lr": 0.003, "epochs": 18, "beta": 0.01, "target": 0.92 }, "mean": 0.036793723003938794, "std": 0.02819267034786451, "per_seed": [ 0.1090393140912056, 0.0328064002096653, 0.026808833703398705, 0.040870074182748795, 0.023899797350168228, 0.01856924220919609, 0.024410061538219452, 0.017946060746908188 ], "n": 8 }, { "cfg": { "lr": 0.006, "epochs": 18, "beta": 0.02, "target": 0.92 }, "mean": 0.022512523224577308, "std": 0.012331270086282655, "per_seed": [ 0.04500043764710426, 0.017105672508478165, 0.03219568356871605, 0.034598458558321, 0.01256189402192831, 0.008819940499961376, 0.019357675686478615, 0.010460423305630684 ], "n": 8 } ], "device": "cuda", "note": "Baseline and idea are end-to-end trained systems with identical FactorRNN architecture; only envelope loss differs. All shared learning rates were evaluated on the same eight paired seeds." }