{ "bench_version": 1, "track": "dynamics", "model": "rnn_small", "metric_direction": "lower is better", "n_seeds": 8, "baseline": { "best_cfg": { "lr": 0.01, "epochs": 10 }, "sweep": [ { "cfg": { "lr": 0.001, "epochs": 10 }, "mean": 0.02325876720715314, "std": 0.009097045470607702, "per_seed": [ 0.006040765903890133, 0.03010248765349388, 0.02543320134282112, 0.024085573852062225, 0.010201698169112206, 0.030222969129681587, 0.031349945813417435, 0.028633495792746544 ], "n": 8 }, { "cfg": { "lr": 0.003, "epochs": 10 }, "mean": 0.003875804533890914, "std": 0.0019874791140290942, "per_seed": [ 0.0009708286379463971, 0.003958100453019142, 0.004776353016495705, 0.005382170435041189, 0.0012958660954609513, 0.002271931618452072, 0.006541829090565443, 0.005809356924146414 ], "n": 8 }, { "cfg": { "lr": 0.01, "epochs": 10 }, "mean": 0.002775895278318785, "std": 0.0017084856346187775, "per_seed": [ 0.0014615225372835994, 0.004334237892180681, 0.0012712624156847596, 0.006652707699686289, 0.0020110509358346462, 0.0024756770581007004, 0.0018914247630164027, 0.0021092789247632027 ], "n": 8 } ], "harness_tuning": { "best_cfg": { "lr": 0.01, "epochs": 10 }, "sweep": [ { "cfg": { "lr": 0.001, "epochs": 10 }, "mean": 0.02141550718806684 }, { "cfg": { "lr": 0.003, "epochs": 10 }, "mean": 0.0037718631356256083 }, { "cfg": { "lr": 0.01, "epochs": 10 }, "mean": 0.0034299326362088323 } ], "full": { "mean": 0.002775895278318785, "std": 0.0017084856346187775, "per_seed": [ 0.0014615225372835994, 0.004334237892180681, 0.0012712624156847596, 0.006652707699686289, 0.0020110509358346462, 0.0024756770581007004, 0.0018914247630164027, 0.0021092789247632027 ], "n": 8 } }, "full": { "mean": 0.002775895278318785, "std": 0.0017084856346187775, "per_seed": [ 0.0014615225372835994, 0.004334237892180681, 0.0012712624156847596, 0.006652707699686289, 0.0020110509358346462, 0.0024756770581007004, 0.0018914247630164027, 0.0021092789247632027 ], "n": 8 } }, "idea": { "per_seed": [ 0.0018240498611703515, 0.0038136225193738937, 0.001709936186671257, 0.005960390437394381, 0.001420309068635106, 0.0025334814563393593, 0.002282342640683055, 0.0019062625942751765 ], "mean": 0.0026812993455678225, "std": 0.0014179568156557768, "n": 8 }, "comparison": { "delta_mean": -9.459593275096267e-05, "idea_wins": 4, "n_pairs": 8, "per_seed_diffs": [ 0.00036252732388675213, -0.0005206153728067875, 0.0004386737709864974, -0.0006923172622919083, -0.0005907418671995401, 5.7804398238658905e-05, 0.0003909178776666522, -0.00020301633048802614 ], "p_value": 0.58435, "mde": 0.00039333102068697407, "mde_rel_pct": 14.16951942528589, "verdict": "no significant win", "system_worked": false }, "mechanism_signature": { "idea_sweep": [ { "cfg": { "lr": 0.001, "epochs": 10, "shield_lambda": 0.01 }, "mean": 0.022998466796707362, "std": 0.009109715346858763, "per_seed": [ 0.005741507280617952, 0.029806293547153473, 0.02514277957379818, 0.02393505349755287, 0.00990633387118578, 0.029928065836429596, 0.031049689278006554, 0.02847801148891449 ], "n": 8 }, { "cfg": { "lr": 0.003, "epochs": 10, "shield_lambda": 0.03 }, "mean": 0.0036644875799538568, "std": 0.001954599449464149, "per_seed": [ 0.0011084122816100717, 0.0033393101766705513, 0.005045472178608179, 0.0046833050437271595, 0.0011171806836500764, 0.0019260895205661654, 0.006277866195887327, 0.0058182645589113235 ], "n": 8 }, { "cfg": { "lr": 0.01, "epochs": 10, "shield_lambda": 0.06 }, "mean": 0.0026812993455678225, "std": 0.0014179568156557768, "per_seed": [ 0.0018240498611703515, 0.0038136225193738937, 0.001709936186671257, 0.005960390437394381, 0.001420309068635106, 0.0025334814563393593, 0.002282342640683055, 0.0019062625942751765 ], "n": 8 } ], "mechanism_signature": { "prediction": "online residual zonotope contracts after burn-in while held-out residual coverage remains high", "trained_test_mse": 0.0011084122816100717, "observed_residual_center": 1.96993350982666e-05, "observed_residual_radius_q": 3.6635516929626464, "heldout_residual_coverage": 1.0, "unsafe_point_prediction_rate": 0.05999999865889549, "unsafe_reachable_interval_rate": 1.0, "confirmed": false } }, "math_check": { "cases": 1000, "containment_disagreements": 0, "max_sample_support_gap": 0.0 }, "protocol_note": "Eight paired seeds; baseline and idea share rnn_small, data, Adam, epochs, batch, and union learning rates. Lower test MSE is primary." }