{ "bench_version": 1, "track": "dynamics", "model": "rnn_small", "metric_direction": "lower is better", "n_seeds": 8, "baseline": { "best_cfg": { "lr": 0.006 }, "sweep": [ { "cfg": { "lr": 0.001 }, "mean": 0.002213045780081302 }, { "cfg": { "lr": 0.003 }, "mean": 0.0012938299914821982 }, { "cfg": { "lr": 0.006 }, "mean": 0.0008639455263619311 } ], "full": { "mean": 0.0008775176265771734, "std": 0.00041096163132504026, "per_seed": [ 0.001323710079304874, 0.0006511765532195568, 0.0011043122503906488, 0.00037658322253264487, 0.000189727041288279, 0.0012001291615888476, 0.0008290691766887903, 0.0013454335276037455 ], "n": 8 } }, "idea": { "mean": 0.001929120291606523, "std": 0.0004547231425667336, "per_seed": [ 0.0011107437312602997, 0.0021070733200758696, 0.0020455883350223303, 0.0018574997084215283, 0.0012957339640706778, 0.002259141532704234, 0.002478449372574687, 0.002278732368722558 ], "n": 8 }, "comparison": { "delta_mean": 0.0010516026650293497, "idea_wins": 1, "n_pairs": 8, "per_seed_diffs": [ -0.00021296634804457426, 0.0014558967668563128, 0.0009412760846316814, 0.0014809164858888835, 0.0011060069227823988, 0.0010590123711153865, 0.0016493801958858967, 0.0009332988411188126 ], "p_value": 0.01485, "mde": 0.00048276249835535186, "mde_rel_pct": 55.01456423598066, "verdict": "idea worse (significant)", "system_worked": false }, "mechanism_signature": { "prediction": "margin controller enforces effective q <= target and response bound is 1/(1-q)", "trained_model_mean_effective_q": 0.6, "trained_model_target_q": 0.6, "trained_model_mean_output_sensitivity": 0.38982123136520386, "predicted_response_bound": 2.5, "q_control_confirmed": true, "confirmed": true }, "idea_sweep": [ { "cfg": { "lr": 0.006, "target": 0.6 }, "result": { "mean": 0.001929120291606523, "std": 0.0004547231425667336, "per_seed": [ 0.0011107437312602997, 0.0021070733200758696, 0.0020455883350223303, 0.0018574997084215283, 0.0012957339640706778, 0.002259141532704234, 0.002478449372574687, 0.002278732368722558 ], "n": 8 } }, { "cfg": { "lr": 0.006, "target": 0.8 }, "result": { "mean": 0.0025976505276048556, "std": 0.0003476950956672743, "per_seed": [ 0.001884700614027679, 0.0026726529467850924, 0.0027921730652451515, 0.0024179157335311174, 0.002342166379094124, 0.0027011220809072256, 0.0030428729951381683, 0.0029276004061102867 ], "n": 8 } }, { "cfg": { "lr": 0.006, "target": 1.0 }, "result": { "mean": 0.003261449688579887, "std": 0.00026401711929885917, "per_seed": [ 0.002826732350513339, 0.0032471036538481712, 0.003457295009866357, 0.003004746977239847, 0.00318548665381968, 0.003147166920825839, 0.003600216470658779, 0.0036228494718670845 ], "n": 8 } } ], "toy_check": { "gamma": 2.9411699999999996, "q_slope_observed": 2.9411699999999983, "q_slope_predicted": 2.9411699999999996, "max_response_relative_error": 1.2408396532492817e-16, "passed": true }, "protocol_notes": { "n_train": 800, "n_test": 400, "epochs": 12, "track_choice": "dynamics matches stability/control structure; paired architecture is shared GreenResidualDynamics", "baseline_grid": [ { "lr": 0.001 }, { "lr": 0.003 }, { "lr": 0.006 } ], "idea_grid": [ { "lr": 0.006, "target": 0.6 }, { "lr": 0.006, "target": 0.8 }, { "lr": 0.006, "target": 1.0 } ] } }