{ "bench_version": 1, "track": "inverse_gain_control", "model": "rnn_small", "metric_direction": "lower is better", "n_seeds": 8, "baseline": { "best_cfg": { "lr": 0.003 }, "sweep": [ { "cfg": { "lr": 0.001 }, "mean": 5.920182824134827 }, { "cfg": { "lr": 0.002 }, "mean": 4.574557304382324 }, { "cfg": { "lr": 0.003 }, "mean": 3.198916256427765 } ], "full": { "mean": 3.670998603105545, "std": 0.63283622936479, "per_seed": [ 3.7461042404174805, 3.104163408279419, 2.9681482315063477, 2.9772491455078125, 4.229879379272461, 4.706507682800293, 4.304690361022949, 3.3312463760375977 ], "n": 8 } }, "idea": { "mean": 1.5069266557693481, "std": 0.23555139171685704, "per_seed": [ 1.5180333852767944, 1.335729956626892, 1.2053886651992798, 1.2145419120788574, 1.7869166135787964, 1.6817357540130615, 1.8618539571762085, 1.451213002204895 ], "n": 8 }, "comparison": { "delta_mean": -2.164071947336197, "idea_wins": 8, "n_pairs": 8, "per_seed_diffs": [ -2.228070855140686, -1.7684334516525269, -1.7627595663070679, -1.762707233428955, -2.4429627656936646, -3.0247719287872314, -2.4428364038467407, -1.8800333738327026 ], "p_value": 0.0081, "mde": 0.3818346490175283, "mde_rel_pct": 10.40138366422991, "verdict": "idea better (significant)", "system_worked": true }, "custom_track": { "name": "inverse_gain_control", "file": "custom_inverse_gain_track.py", "domain": "dynamics" }, "idea_sweep": [ { "cfg": { "lr": 0.001 }, "mean": 2.0682411789894104 }, { "cfg": { "lr": 0.002 }, "mean": 1.5857862532138824 }, { "cfg": { "lr": 0.003 }, "mean": 1.318423479795456 } ], "idea_best_cfg": { "lr": 0.003 }, "protocol_note": "Both systems use identical GRU(3,64), Adam, epochs, batch, data, and the same lr union; only the output parameterization differs.", "mechanism_signature": { "n_test": 400, "observed_action_error_mean_abs": 0.7880314588546753, "predicted_factor_error_mean_abs": 0.7880314588546753, "slope_observed_on_predicted": 1.0, "correlation": 0.9999999999999957, "relative_residual": 9.462353034450643e-08, "inverse_gain_mae": 0.8039304614067078, "prediction": "action_error=(qhat-q_observed)*z", "confirmed": true } }