{ "bench_version": 1, "track": "dynamics", "model": "rnn_small", "metric_direction": "lower is better", "n_seeds": 8, "baseline": { "best_cfg": { "lr": 0.006, "epochs": 6, "alpha": 0.0, "weighted": false }, "sweep": [ { "cfg": { "lr": 0.001, "epochs": 6, "alpha": 0.0, "weighted": false }, "mean": 0.15612634923309088 }, { "cfg": { "lr": 0.003, "epochs": 6, "alpha": 0.0, "weighted": false }, "mean": 0.022599048796109855 }, { "cfg": { "lr": 0.006, "epochs": 6, "alpha": 0.0, "weighted": false }, "mean": 0.013443514122627676 } ], "full": { "mean": 0.013443514122627676, "std": 0.0034362747708833723, "per_seed": [ 0.015814311802387238, 0.011003119871020317, 0.014025969430804253, 0.013154271990060806, 0.01978541910648346, 0.015274417586624622, 0.010594896040856838, 0.00789570715278387 ], "n": 8 } }, "idea": { "mean": 0.016453448799438775, "std": 0.003337952311107532, "per_seed": [ 0.012871215119957924, 0.01926228776574135, 0.019986655563116074, 0.01737268455326557, 0.009503618814051151, 0.017524683848023415, 0.016284719109535217, 0.018821725621819496 ], "n": 8 }, "comparison": { "delta_mean": 0.003009934676811099, "idea_wins": 2, "n_pairs": 8, "per_seed_diffs": [ -0.0029430966824293137, 0.008259167894721031, 0.005960686132311821, 0.004218412563204765, -0.010281800292432308, 0.0022502662613987923, 0.005689823068678379, 0.010926018469035625 ], "p_value": 0.24735, "mde": 0.005655673555602832, "mde_rel_pct": 42.06990452059994, "verdict": "no significant win", "system_worked": false }, "mechanism_signature": { "mechanism_signature": { "metric": 0.012871215119957924, "critic_bce": 0.09358271956443787, "failure_rate": 0.0625, "predicted_enrichment": 2.64437198638916, "observed_enrichment": 2.55679988861084, "ess_fraction": 0.9292901097924411, "weighted_pool_loss": 0.013131698593497276, "uniform_pool_loss": 0.013131696730852127 }, "math_check": { "rows": [ { "alpha": 0.5, "predicted_enrichment": 1.1935695059810845, "sampled_enrichment": 1.1971491228070177, "identity_l2": 2.180444593116775e-16, "ess_fraction": 0.7844566886686185 }, { "alpha": 1.0, "predicted_enrichment": 1.3319936587355161, "sampled_enrichment": 1.3263157894736841, "identity_l2": 1.6025315005387115e-16, "ess_fraction": 0.35981862086454786 }, { "alpha": 2.0, "predicted_enrichment": 1.5119809457893971, "sampled_enrichment": 1.5087719298245612, "identity_l2": 2.1315227208338676e-16, "ess_fraction": 0.08387276797729101 } ], "max_identity_l2": 2.180444593116775e-16, "confirmed_identity": true }, "prediction": "criticality proposal enrichment equals E_q[y]/E_p[y] while weighted expectation preserves uniform loss", "confirmed": true, "idea_sweep": [ { "cfg": { "lr": 0.006, "epochs": 6, "alpha": 0.5, "weighted": true }, "result": { "mean": 0.016453448799438775, "std": 0.003337952311107532, "per_seed": [ 0.012871215119957924, 0.01926228776574135, 0.019986655563116074, 0.01737268455326557, 0.009503618814051151, 0.017524683848023415, 0.016284719109535217, 0.018821725621819496 ], "n": 8 } }, { "cfg": { "lr": 0.006, "epochs": 6, "alpha": 1.0, "weighted": true }, "result": { "mean": 0.01651376229710877, "std": 0.0028040435177098303, "per_seed": [ 0.01849322021007538, 0.01740805059671402, 0.017674783244729042, 0.018753860145807266, 0.014908691868185997, 0.014080381020903587, 0.010877873748540878, 0.019913237541913986 ], "n": 8 } }, { "cfg": { "lr": 0.006, "epochs": 6, "alpha": 2.0, "weighted": true }, "result": { "mean": 0.01855568215250969, "std": 0.006122484793310474, "per_seed": [ 0.025685645639896393, 0.020075352862477303, 0.025499150156974792, 0.0117742158472538, 0.01591908372938633, 0.008489308878779411, 0.016218945384025574, 0.024783754721283913 ], "n": 8 } } ], "track_justification": "dynamics is the built-in structural match for rollout failure/control states" } }