{ "seed": 1448, "math_checks": { "odds_slope_observed": 1.2999999999999996, "odds_slope_predicted": 1.3, "odds_max_abs_identity_error": 8.881784197001252e-16, "boundary_beta_observed": 1.5, "boundary_beta_predicted": 1.5, "boundary_abs_error": 0.0, "beta0_max_transition_difference": 0.0, "beta0_sweep_scales": [ 0.0, 0.5, 1.0, 3.0, 10.0 ], "beta0_sweep_max_errors": [ 0.0, 0.0, 0.0, 0.0, 0.0 ], "predictions_confirmed": true }, "mini_experiment": { "n_episodes": 160, "one_step_mse": { "baseline": 0.025127682580169907, "stl": 0.0252477885589946 }, "rollout_50_mse": { "baseline": 3.115207491006956, "stl": 3.5306199564239877 }, "mode2_selection_rate": { "baseline": 0.43125, "stl": 0.20625 }, "beta_sweep_same_protocol": { "0.0": { "one_step_mse": 0.027298106786175846, "mode2_selection_rate": 0.41875 }, "0.5": { "one_step_mse": 0.025657513167276536, "mode2_selection_rate": 0.40625 }, "1.0": { "one_step_mse": 0.02570714521150827, "mode2_selection_rate": 0.39375 }, "2.8": { "one_step_mse": 0.02604671855802617, "mode2_selection_rate": 0.175 }, "5.0": { "one_step_mse": 0.025344349841651525, "mode2_selection_rate": 0.0375 } }, "robustness_beta": 2.8, "note": "Synthetic fixed expert dynamics; no learned parameters or training loop." } }