{ "bench_version": 1, "track": "dynamics", "model": "rnn_small", "metric_direction": "lower is better", "n_seeds": 8, "baseline": { "best_cfg": { "lr": 0.006, "epochs": 10 }, "sweep": [ { "cfg": { "lr": 0.001, "epochs": 10 }, "mean": 0.02098797250073403 }, { "cfg": { "lr": 0.003, "epochs": 10 }, "mean": 0.003764481545658782 }, { "cfg": { "lr": 0.006, "epochs": 10 }, "mean": 0.002816903230268508 } ], "full": { "mean": 0.0035593539651017636, "std": 0.001430033924501602, "per_seed": [ 0.003789895214140415, 0.0012226301478222013, 0.004499303642660379, 0.001755783916451037, 0.005420389119535685, 0.0051945955492556095, 0.0037620163056999445, 0.0028302178252488375 ], "n": 8 } }, "idea": { "mean": 0.0036058283294551075, "std": 0.0012201842547257958, "per_seed": [ 0.004097327124327421, 0.0013652343768626451, 0.0035981065593659878, 0.0025071303825825453, 0.0055099669843912125, 0.0048635597340762615, 0.0037585990503430367, 0.0031467024236917496 ], "n": 8 }, "comparison": { "delta_mean": 4.6474364353343844e-05, "idea_wins": 3, "n_pairs": 8, "per_seed_diffs": [ 0.000307431910187006, 0.0001426042290404439, -0.0009011970832943916, 0.0007513464661315084, 8.957786485552788e-05, -0.000331035815179348, -3.4172553569078445e-06, 0.0003164845984429121 ], "p_value": 0.81695, "mde": 0.00041109428784617027, "mde_rel_pct": 11.549688282671736, "verdict": "no significant win", "system_worked": false }, "sanity_check": { "containment": [ 1.0, 1.0, 1.0, 1.0 ], "h": [ 0.2, 0.1, 0.05, 0.025 ], "mean_width": [ 0.2894333333333333, 0.18980000000000002, 0.14003333333333334, 0.11466666666666667 ], "all_contained": true, "width_decreases": true }, "idea_config_sweep": [ { "cfg": { "lr": 0.006, "epochs": 10 }, "result": { "mean": 0.0036058283294551075, "std": 0.0012201842547257958, "per_seed": [ 0.004097327124327421, 0.0013652343768626451, 0.0035981065593659878, 0.0025071303825825453, 0.0055099669843912125, 0.0048635597340762615, 0.0037585990503430367, 0.0031467024236917496 ], "n": 8 } }, { "cfg": { "lr": 0.001, "epochs": 10 }, "result": { "mean": 0.023580193694215268, "std": 0.009230619863742425, "per_seed": [ 0.0067050703801214695, 0.030281851068139076, 0.026058034971356392, 0.023178257048130035, 0.010180371813476086, 0.03046376071870327, 0.03332953527569771, 0.028444668278098106 ], "n": 8 } }, { "cfg": { "lr": 0.003, "epochs": 10 }, "result": { "mean": 0.004334091427153908, "std": 0.0020653212924998296, "per_seed": [ 0.0013217671075835824, 0.005213679280132055, 0.0035173860378563404, 0.0064000352285802364, 0.0018205104861408472, 0.003039174247533083, 0.007091913837939501, 0.006268265191465616 ], "n": 8 } } ], "protocol_note": "Baseline and idea share rnn_small, dataset, lr/epoch union, batch and seeds; idea differs only by interval training loss.", "mechanism_signature": { "predicted": "smaller h should reduce interval width while residual inflation preserves containment", "observed_containment_mean": 0.7031250298023224, "observed_width_mean": 0.1384880207479, "observed_violation_mean": 0.010517213333514519, "confirmed": false }, "custom_track": null }