{ "bench_version": 1, "track": "dynamics", "model": "rnn_small", "metric_direction": "lower is better", "n_seeds": 8, "baseline": { "best_cfg": { "lr": 0.006, "epochs": 18 }, "sweep": [ { "cfg": { "lr": 0.001, "epochs": 18 }, "mean": 0.0018504196486901492 }, { "cfg": { "lr": 0.003, "epochs": 18 }, "mean": 0.00105226032610517 }, { "cfg": { "lr": 0.006, "epochs": 18 }, "mean": 0.0007705322786932811 } ], "full": { "mean": 0.0007801908141118474, "std": 0.000154764005468824, "per_seed": [ 0.0007548112771473825, 0.0008833256433717906, 0.0005147535703144968, 0.0009292386239394546, 0.0005692947888746858, 0.0008575883111916482, 0.0007604749407619238, 0.0009720393572933972 ], "n": 8 } }, "idea": { "mean": 0.0015543624467682093, "std": 0.0004092240958003843, "per_seed": [ 0.0015412603970617056, 0.0010829424718394876, 0.0010121178347617388, 0.0014807143015787005, 0.001438742270693183, 0.0017851066077128053, 0.0016824236372485757, 0.0024115920532494783 ], "n": 8 }, "comparison": { "delta_mean": 0.0007741716326563619, "idea_wins": 0, "n_pairs": 8, "per_seed_diffs": [ 0.0007864491199143231, 0.0001996168284676969, 0.000497364264447242, 0.000551475677639246, 0.0008694474818184972, 0.000927518296521157, 0.0009219486964866519, 0.0014395526959560812 ], "p_value": 0.0081, "mde": 0.00030862416250668516, "mde_rel_pct": 39.55752322693216, "verdict": "idea worse (significant)", "system_worked": false }, "mechanism_signature": { "prediction": "conditioning retains 100% of selected terminal-failure trajectories; replay should increase rare-event exposure", "predicted_valid_fraction": 1.0, "observed_valid_fraction": 1.0, "predicted_replay_fraction": 0.5, "observed_replay_fraction": 0.5, "confirmed": true }, "idea_sweep": [ { "cfg": { "lr": 0.006, "epochs": 18 }, "result": { "mean": 0.001735811325488612, "std": 0.0007333066277889873, "per_seed": [ 0.001395401661284268, 0.0006777255330234766, 0.00144183577504009, 0.0015068890061229467, 0.0025884252972900867, 0.001887585036456585, 0.0012569716200232506, 0.003131656674668193 ], "n": 8 } }, { "cfg": { "lr": 0.001, "epochs": 18 }, "result": { "mean": 0.0015543624467682093, "std": 0.0004092240958003843, "per_seed": [ 0.0015412603970617056, 0.0010829424718394876, 0.0010121178347617388, 0.0014807143015787005, 0.001438742270693183, 0.0017851066077128053, 0.0016824236372485757, 0.0024115920532494783 ], "n": 8 } }, { "cfg": { "lr": 0.003, "epochs": 18 }, "result": { "mean": 0.001693843849352561, "std": 0.0009678744347819918, "per_seed": [ 0.0007645400473847985, 0.0025881300680339336, 0.0006857462576590478, 0.0029576336964964867, 0.0006684368127025664, 0.0008722841739654541, 0.0022166145499795675, 0.002797365188598633 ], "n": 8 } } ], "runtime_sec": 69.70142459869385 }