{ "bench_version": 1, "track": "dynamics", "model": "rnn_small", "metric_direction": "lower is better", "n_seeds": 8, "baseline": { "best_cfg": { "lr": 0.00665 }, "sweep": [ { "cfg": { "lr": 0.001 }, "mean": 0.0009722943214001134 }, { "cfg": { "lr": 0.002 }, "mean": 0.0006509074009954929 }, { "cfg": { "lr": 0.003 }, "mean": 0.0004595852587954141 }, { "cfg": { "lr": 0.004 }, "mean": 0.0003482927131699398 }, { "cfg": { "lr": 0.005 }, "mean": 0.00024859366021701135 }, { "cfg": { "lr": 0.00067 }, "mean": 0.0011799605708802119 }, { "cfg": { "lr": 0.00134 }, "mean": 0.0008329209085786715 }, { "cfg": { "lr": 0.00268 }, "mean": 0.0005083113646833226 }, { "cfg": { "lr": 0.00402 }, "mean": 0.0003466853668214753 }, { "cfg": { "lr": 0.00536 }, "mean": 0.00022448933304985985 }, { "cfg": { "lr": 0.00665 }, "mean": 0.00013951877372164745 } ], "full": { "mean": 0.00011474007897049887, "std": 4.026902293849407e-05, "per_seed": [ 0.0001932993473019451, 0.0001438440231140703, 8.013794285943732e-05, 0.0001407937816111371, 0.00011875866039190441, 8.25471433927305e-05, 6.331295298878103e-05, 9.522678010398522e-05 ], "n": 8 } }, "idea": { "mean": 0.05237803841009736, "std": 0.008875649004641814, "per_seed": [ 0.04106063395738602, 0.058054666966199875, 0.0539846234023571, 0.06823215633630753, 0.05530509725213051, 0.03805254027247429, 0.05319170653820038, 0.05114288255572319 ], "n": 8 }, "comparison": { "delta_mean": 0.05226329833112686, "idea_wins": 0, "n_pairs": 8, "per_seed_diffs": [ 0.04086733461008407, 0.057910822943085805, 0.053904485459497664, 0.06809136255469639, 0.055186338591738604, 0.03796999312908156, 0.0531283935852116, 0.051047655775619205 ], "p_value": 0.0081, "mde": 0.007932781978214037, "mde_rel_pct": 6913.697506042031, "verdict": "idea worse (significant)", "system_worked": false }, "mechanism_signature": { "farkas_shield": { "constraint_count_full": 64, "constraint_count_retained": 2, "retained_fraction": 0.03125, "certificate_max_residual": 0.0, "certificate_max_offset_violation": 0.0, "trained_test_samples": 400, "full_reduced_max_output_difference": 0.0, "full_reduced_decision_disagreement": 0.0, "predicted_zero_disagreement_observed": true, "confirmed": true } }, "idea_sweep": [ { "cfg": { "lr": 0.00665 }, "result": { "mean": 0.05238204402849078, "std": 0.008873981965744437, "per_seed": [ 0.04106547310948372, 0.0580538772046566, 0.0539894662797451, 0.06823457032442093, 0.055308111011981964, 0.03805993124842644, 0.053193967789411545, 0.05115095525979996 ], "n": 8 } }, { "cfg": { "lr": 0.0044555 }, "result": { "mean": 0.05238870158791542, "std": 0.008873361924843962, "per_seed": [ 0.04107039421796799, 0.0580560676753521, 0.053996019065380096, 0.06824300438165665, 0.055311888456344604, 0.03807036951184273, 0.053200963884592056, 0.05116090551018715 ], "n": 8 } }, { "cfg": { "lr": 0.0088445 }, "result": { "mean": 0.05237803841009736, "std": 0.008875649004641814, "per_seed": [ 0.04106063395738602, 0.058054666966199875, 0.0539846234023571, 0.06823215633630753, 0.05530509725213051, 0.03805254027247429, 0.05319170653820038, 0.05114288255572319 ], "n": 8 } } ], "protocol_notes": { "task_match": "controlled pendulum dynamics; safety/control idea", "epochs": 15, "n_train": 1200, "n_test": 400, "idea_uses_same_base_architecture": true } }