{ "bench_version": 1, "track": "dynamics", "model": "residual_rnn_small", "metric_direction": "lower is better", "n_seeds": 8, "baseline": { "best_cfg": { "lr": 0.003 }, "sweep": [ { "cfg": { "lr": 0.001 }, "mean": 0.08261195849627256 }, { "cfg": { "lr": 0.003 }, "mean": 0.06586439814418554 }, { "cfg": { "lr": 0.01 }, "mean": 0.15003963327035308 } ], "full": { "mean": 0.061237716814503074, "std": 0.027211549075682028, "per_seed": [ 0.04314250871539116, 0.09609165042638779, 0.08621135354042053, 0.038012079894542694, 0.07434208691120148, 0.028976354748010635, 0.09323041886091232, 0.029895281419157982 ], "n": 8 } }, "idea": { "mean": 0.0020011790038552135, "std": 0.0007409600802683955, "per_seed": [ 0.0010639947140589356, 0.0032321331091225147, 0.0009753473568707705, 0.0024151953402906656, 0.002823632676154375, 0.0017429819563403726, 0.0018509947694838047, 0.0019051521085202694 ], "n": 8 }, "comparison": { "delta_mean": -0.05923653781064786, "idea_wins": 8, "n_pairs": 8, "per_seed_diffs": [ -0.04207851400133222, -0.09285951731726527, -0.08523600618354976, -0.03559688455425203, -0.0715184542350471, -0.027233372791670263, -0.09137942409142852, -0.027990129310637712 ], "p_value": 0.0081, "mde": 0.02416027485033725, "mde_rel_pct": 39.453258722107215, "verdict": "idea better (significant)", "system_worked": true }, "math_check": { "h": [ 0.5, 1.0, 2.0, 4.0, 8.0, 32.0 ], "q": [ 0.4, 0.6666666666666666, 1.0, 1.3333333333333333, 1.6, 1.8823529411764706 ], "q_bound": 2.0, "euler_amplification": [ 0.5, 0.0, 1.0, 3.0, 7.0, 31.0 ], "damped_amplification": [ 0.6, 0.33333333333333337, 0.0, 0.33333333333333326, 0.6000000000000001, 0.8823529411764706 ], "predicted_bounded_effective_step": true, "damped_nonexpansive_test": true, "euler_nonexpansive_test": false }, "idea_config": { "lr": 0.001 }, "idea_sweep": [ { "cfg": { "lr": 0.001 }, "result": { "mean": 0.0020011790038552135, "std": 0.0007409600802683955, "per_seed": [ 0.0010639947140589356, 0.0032321331091225147, 0.0009753473568707705, 0.0024151953402906656, 0.002823632676154375, 0.0017429819563403726, 0.0018509947694838047, 0.0019051521085202694 ], "n": 8 } }, { "cfg": { "lr": 0.003 }, "result": { "mean": 0.002582564891781658, "std": 0.000729676529186581, "per_seed": [ 0.0016574665205553174, 0.001894353306852281, 0.002129645086824894, 0.0034991740249097347, 0.0038091319147497416, 0.003046745667234063, 0.0024077408015727997, 0.002216261811554432 ], "n": 8 } }, { "cfg": { "lr": 0.01 }, "result": { "mean": 0.03438545443350449, "std": 0.037436245598765676, "per_seed": [ 0.009465613402426243, 0.010761785320937634, 0.054800208657979965, 0.007569439243525267, 0.007234271615743637, 0.014039256609976292, 0.12095119804143906, 0.05026186257600784 ], "n": 8 } } ], "mechanism_signature": { "prediction": "denominator block has smaller trained-state update proxy at h=4", "nominal_h": 4.0, "alpha": 0.5, "observed_baseline_update": 21.13020896911621, "observed_idea_update": 4.463923364877701, "observed_update_ratio": 0.21125789013266005, "predicted_upper_ratio_from_q_over_h": 0.3333333333333333, "confirmed": true } }