{ "bench_version": 1, "track": "dynamics", "model": "rnn_small", "metric_direction": "lower is better", "n_seeds": 8, "baseline": { "best_cfg": { "lr": 0.01, "epochs": 12 }, "sweep": [ { "cfg": { "lr": 0.001, "epochs": 12 }, "mean": 0.004103701037820429 }, { "cfg": { "lr": 0.003, "epochs": 12 }, "mean": 0.0033861721749417484 }, { "cfg": { "lr": 0.01, "epochs": 12 }, "mean": 0.0014241317112464458 } ], "full": { "mean": 0.001394080012687482, "std": 0.0003941947646392458, "per_seed": [ 0.0008339877240359783, 0.0018332540057599545, 0.001035665743984282, 0.0019936193712055683, 0.0009847625624388456, 0.0013270708732306957, 0.0016533465823158622, 0.0014909332385286689 ], "n": 8 } }, "idea": { "mean": 0.0013935517708887346, "std": 0.0003435936282481101, "per_seed": [ 0.000962425721809268, 0.0018949415534734726, 0.0011497323866933584, 0.0018263080855831504, 0.0009521312895230949, 0.0014383804518729448, 0.0016268157633021474, 0.0012976789148524404 ], "n": 8 }, "comparison": { "delta_mean": -5.282417987473309e-07, "idea_wins": 4, "n_pairs": 8, "per_seed_diffs": [ 0.00012843799777328968, 6.168754771351814e-05, 0.0001140666427090764, -0.00016731128562241793, -3.263127291575074e-05, 0.00011130957864224911, -2.653081901371479e-05, -0.00019325432367622852 ], "p_value": 0.98515, "mde": 0.0001061475231632145, "mde_rel_pct": 7.614162902930173, "verdict": "no measurable effect", "system_worked": false }, "mechanism_signature": { "prediction": "accepted Petri successors remain admissible", "closure_violations": 0, "predicted_unsafe_accepted_rate": 0.0, "observed_unsafe_prediction_rate_trained_idea": 0.07, "observed_rejection_rate_trained_task_inputs": 0.05347656179219484, "trained_model_rows": [ { "seed": 0, "baseline_metric": 0.0008339877240359783, "idea_metric": 0.000962425721809268, "baseline_unsafe_prediction_rate": 0.045, "idea_unsafe_prediction_rate": 0.0425, "shield_rejection_rate": 0.03531249985098839 }, { "seed": 1, "baseline_metric": 0.0018332540057599545, "idea_metric": 0.0018949415534734726, "baseline_unsafe_prediction_rate": 0.095, "idea_unsafe_prediction_rate": 0.0975, "shield_rejection_rate": 0.059687498956918716 }, { "seed": 2, "baseline_metric": 0.001035665743984282, "idea_metric": 0.0011497323866933584, "baseline_unsafe_prediction_rate": 0.055, "idea_unsafe_prediction_rate": 0.055, "shield_rejection_rate": 0.051874998956918716 }, { "seed": 3, "baseline_metric": 0.0019936193712055683, "idea_metric": 0.0018263080855831504, "baseline_unsafe_prediction_rate": 0.1225, "idea_unsafe_prediction_rate": 0.1225, "shield_rejection_rate": 0.0793749988079071 }, { "seed": 4, "baseline_metric": 0.0009847625624388456, "idea_metric": 0.0009521312895230949, "baseline_unsafe_prediction_rate": 0.0725, "idea_unsafe_prediction_rate": 0.07, "shield_rejection_rate": 0.054999999701976776 }, { "seed": 5, "baseline_metric": 0.0013270708732306957, "idea_metric": 0.0014383804518729448, "baseline_unsafe_prediction_rate": 0.0325, "idea_unsafe_prediction_rate": 0.0325, "shield_rejection_rate": 0.03312499821186066 }, { "seed": 6, "baseline_metric": 0.0016533465823158622, "idea_metric": 0.0016268157633021474, "baseline_unsafe_prediction_rate": 0.055, "idea_unsafe_prediction_rate": 0.0575, "shield_rejection_rate": 0.05843750014901161 }, { "seed": 7, "baseline_metric": 0.0014909332385286689, "idea_metric": 0.0012976789148524404, "baseline_unsafe_prediction_rate": 0.0825, "idea_unsafe_prediction_rate": 0.0825, "shield_rejection_rate": 0.054999999701976776 } ], "confirmed": true }, "idea_sweep": [ { "cfg": { "lr": 0.001, "epochs": 12 }, "result": { "mean": 0.004844218114158139, "std": 0.0021060335026899866, "per_seed": [ 0.0076133571565151215, 0.0035649114288389683, 0.001954183680936694, 0.002968552988022566, 0.00587603310123086, 0.004371007438749075, 0.00404327642172575, 0.008362422697246075 ], "n": 8 } }, { "cfg": { "lr": 0.003, "epochs": 12 }, "result": { "mean": 0.002841877590981312, "std": 0.0016170159627390552, "per_seed": [ 0.0020566112361848354, 0.0030648154206573963, 0.0009700310183688998, 0.006774549372494221, 0.0028293621726334095, 0.002948844339698553, 0.002073001815006137, 0.002017805352807045 ], "n": 8 } }, { "cfg": { "lr": 0.01, "epochs": 12 }, "result": { "mean": 0.0013935517708887346, "std": 0.0003435936282481101, "per_seed": [ 0.000962425721809268, 0.0018949415534734726, 0.0011497323866933584, 0.0018263080855831504, 0.0009521312895230949, 0.0014383804518729448, 0.0016268157633021474, 0.0012976789148524404 ], "n": 8 } } ], "selected_idea_cfg": { "lr": 0.01, "epochs": 12 }, "track_justification": "dynamics is the matched control/stability benchmark: actuated pendulum rollouts." }