{ "bench_version": 1, "track": "dynamics", "model": "rnn_small", "metric_direction": "lower is better", "n_seeds": 8, "baseline": { "best_cfg": { "lr": 0.01 }, "sweep": [ { "cfg": { "lr": 0.001 }, "mean": 0.015694387606345117 }, { "cfg": { "lr": 0.003 }, "mean": 0.0023102034465409815 }, { "cfg": { "lr": 0.01 }, "mean": 0.0013842678163200617 } ], "full": { "mean": 0.0015652802903787233, "std": 0.0007422459790989128, "per_seed": [ 0.0013847877271473408, 0.0011940097901970148, 0.0015944147016853094, 0.0013638590462505817, 0.0008487981976941228, 0.000910585920792073, 0.001885351026430726, 0.0033404359128326178 ], "n": 8 } }, "idea": { "mean": 0.0015269540235749446, "std": 0.000787764827387549, "per_seed": [ 0.0010921545326709747, 0.0012567200465127826, 0.0015678050694987178, 0.0012287304271012545, 0.0008476584334857762, 0.0009015121031552553, 0.0018893856322392821, 0.0034316659439355135 ], "n": 8 }, "comparison": { "delta_mean": -3.832626680377871e-05, "idea_wins": 5, "n_pairs": 8, "per_seed_diffs": [ -0.00029263319447636604, 6.271025631576777e-05, -2.6609632186591625e-05, -0.00013512861914932728, -1.1397642083466053e-06, -9.073817636817694e-06, 4.03460580855608e-06, 9.123003110289574e-05 ], "p_value": 0.46705, "mde": 0.00010250800277371827, "mde_rel_pct": 6.548859230120136, "verdict": "no significant win", "system_worked": false }, "mechanism_signature": { "prediction": "finite-horizon gradient energy should contract on average and unstable training should have positive residual violations", "trained_model_measurements": { "idea_cfg": { "lr": 0.01 }, "idea_signature_per_seed": [ { "violation_rate": 0.02631578947368421, "mean_v_ratio": 2.168702542242643, "tail_grad_std": 0.46059960229461117, "tail_loss_std": 0.11873548939891664 }, { "violation_rate": 0.05263157894736842, "mean_v_ratio": 3.6939305728301406, "tail_grad_std": 0.4575504708189517, "tail_loss_std": 0.1556151981825947 }, { "violation_rate": 0.02631578947368421, "mean_v_ratio": 2.2387936332900273, "tail_grad_std": 0.3685155160785214, "tail_loss_std": 0.14080336151872447 }, { "violation_rate": 0.02631578947368421, "mean_v_ratio": 1.2345037685805245, "tail_grad_std": 0.38392368145194206, "tail_loss_std": 0.14072047870995807 }, { "violation_rate": 0.05263157894736842, "mean_v_ratio": 0.8230216467851087, "tail_grad_std": 0.36693779977631946, "tail_loss_std": 0.10801473858501799 }, { "violation_rate": 0.02631578947368421, "mean_v_ratio": 1.8151202782204277, "tail_grad_std": 0.44894377114615497, "tail_loss_std": 0.16700399421982076 }, { "violation_rate": 0.05263157894736842, "mean_v_ratio": 1.0862176747698533, "tail_grad_std": 0.3875248868001556, "tail_loss_std": 0.14996397260121175 }, { "violation_rate": 0.05263157894736842, "mean_v_ratio": 1.5587420168479806, "tail_grad_std": 0.40622251364286266, "tail_loss_std": 0.1526901696628486 } ] }, "confirmed": false, "idea_sweep": [ { "cfg": { "lr": 0.001 }, "mean": 0.01564739688183181 }, { "cfg": { "lr": 0.003 }, "mean": 0.002292555815074593 }, { "cfg": { "lr": 0.01 }, "mean": 0.0012863525189459324 } ], "certificate": { "M": 4, "alpha": 0.1, "lambda": 0.002, "beta": 0.9 }, "observed_mean_v_ratio": 1.8273790166958381, "observed_violation_rate": 0.039473684210526314 } }