{ "bench_version": 1, "track": "dynamics", "model": "rnn_small", "metric_direction": "lower is better", "n_seeds": 8, "baseline": { "best_cfg": { "lr": 0.006, "epochs": 10, "branches": 1 }, "sweep": [ { "cfg": { "lr": 0.001, "epochs": 10, "branches": 1 }, "mean": 0.0019458123424556106 }, { "cfg": { "lr": 0.003, "epochs": 10, "branches": 1 }, "mean": 0.000998065312160179 }, { "cfg": { "lr": 0.006, "epochs": 10, "branches": 1 }, "mean": 0.0007849872272345237 } ], "full": { "mean": 0.0007333773064601701, "std": 0.00023119481143299165, "per_seed": [ 0.0007082645315676928, 0.0011445400305092335, 0.00047928086132742465, 0.0008078634855337441, 0.00035395112354308367, 0.0006696216878481209, 0.0007750760996714234, 0.0009284206316806376 ], "n": 8 } }, "idea": { "cfg": { "lr": 0.006, "epochs": 10, "branches": 5 }, "mean": 0.0008847052595228888, "std": 0.00026667546357193395, "per_seed": [ 0.0010930252028629184, 0.0010985390981659293, 0.0007570339366793633, 0.001170001458376646, 0.00035861978540197015, 0.0010039987973868847, 0.0006030820077285171, 0.0009933417895808816 ], "n": 8 }, "comparison": { "delta_mean": 0.00015132795306271873, "idea_wins": 2, "n_pairs": 8, "per_seed_diffs": [ 0.0003847606712952256, -4.600093234330416e-05, 0.0002777530753519386, 0.00036213797284290195, 4.66866185888648e-06, 0.00033437710953876376, -0.00017199409194290638, 6.4921157900244e-05 ], "p_value": 0.08585, "mde": 0.00017902087041145347, "mde_rel_pct": 24.410473140427907, "verdict": "no significant win", "system_worked": false }, "idea_sweep": [ { "cfg": { "lr": 0.001, "epochs": 10, "branches": 5 }, "mean": 0.00476446797256358, "std": 0.0010113119245195041, "per_seed": [ 0.004423358011990786, 0.00587823148816824, 0.006476645823568106, 0.0045180427841842175, 0.0030923711601644754, 0.004275563172996044, 0.005356233566999435, 0.004095297772437334 ], "n": 8 }, { "cfg": { "lr": 0.003, "epochs": 10, "branches": 5 }, "mean": 0.0016875666624400765, "std": 0.00044316453275384946, "per_seed": [ 0.0008459890959784389, 0.0019791238009929657, 0.0021841360721737146, 0.001931163715198636, 0.0013305676402524114, 0.0013080938952043653, 0.0018005802994593978, 0.002120878780260682 ], "n": 8 }, { "cfg": { "lr": 0.006, "epochs": 10, "branches": 5 }, "mean": 0.0008847052595228888, "std": 0.00026667546357193395, "per_seed": [ 0.0010930252028629184, 0.0010985390981659293, 0.0007570339366793633, 0.001170001458376646, 0.00035861978540197015, 0.0010039987973868847, 0.0006030820077285171, 0.0009933417895808816 ], "n": 8 } ], "budget": { "n_train": 800, "n_test": 300, "epochs": 10, "batch": 128, "lr_union": [ 0.001, 0.003, 0.006 ] }, "mechanism_signature": { "trained_model": true, "soft_minus_hard_mean": 0.004501420073211193, "soft_minus_hard_std": 0.008464416489005089, "branch_spread_mean": 0.2787400186061859, "subset_refinement": [ { "M": 2, "mean_abs_to_full": 0.5144225358963013 }, { "M": 3, "mean_abs_to_full": 0.035924121737480164 }, { "M": 5, "mean_abs_to_full": 0.0 } ], "confirmed": true, "note": "values measured on the seed-0 trained dynamics model" } }