{ "bench_version": 1, "track": "tabular", "model": "mlp_tiny", "metric_direction": "lower is better", "n_seeds": 8, "baseline": { "best_cfg": { "lr": 0.003, "temperature": 0.0005 }, "sweep": [ { "cfg": { "lr": 0.001, "temperature": 0.0005 }, "mean": 6.877625823020935 }, { "cfg": { "lr": 0.001, "temperature": 0.002 }, "mean": 6.878889203071594 }, { "cfg": { "lr": 0.003, "temperature": 0.0005 }, "mean": 6.73323667049408 }, { "cfg": { "lr": 0.003, "temperature": 0.002 }, "mean": 6.734855055809021 }, { "cfg": { "lr": 0.006, "temperature": 0.0005 }, "mean": 7.187614321708679 }, { "cfg": { "lr": 0.006, "temperature": 0.002 }, "mean": 7.431662321090698 } ], "full": { "mean": 6.753931879997253, "std": 0.15501289580001476, "per_seed": [ 6.430861949920654, 6.871230602264404, 6.933614253997803, 6.697239875793457, 6.64493465423584, 6.860416412353516, 6.7199554443359375, 6.873201847076416 ], "n": 8 } }, "idea": { "mean": 6.753931879997253, "std": 0.15501289580001476, "per_seed": [ 6.430861949920654, 6.871230602264404, 6.933614253997803, 6.697239875793457, 6.64493465423584, 6.860416412353516, 6.7199554443359375, 6.873201847076416 ], "n": 8 }, "comparison": { "delta_mean": 0.0, "idea_wins": 0, "n_pairs": 8, "per_seed_diffs": [ 0.0, 0.0, 0.0, 0.0, 0.0, 0.0, 0.0, 0.0 ], "p_value": 1.0, "mde": 0.0, "mde_rel_pct": 0.0, "verdict": "no measurable effect", "system_worked": false }, "idea_sweep": [ [ 6.877625823020935, { "lr": 0.001, "temperature": 0.0005 } ], [ 6.878889203071594, { "lr": 0.001, "temperature": 0.002 } ], [ 6.73323667049408, { "lr": 0.003, "temperature": 0.0005 } ] ], "protocol_note": "Official bench tabular track; custom Langevin loop is the intervention.", "mechanism_signature": { "prediction": "observed unsafe frequency should not exceed certificate envelope", "predicted_final_bound": 1.0, "observed_mean_unsafe_frequency": 1.0, "observed_post_stop_unsafe_frequency": 1.0, "n_trained_models": 8, "confirmed": true } }