{ "bench_version": 1, "track": "dynamics", "model": "rnn_small", "metric_direction": "lower is better", "n_seeds": 8, "baseline": { "best_cfg": { "lr": 0.01, "epochs": 8 }, "sweep": [ { "cfg": { "lr": 0.001, "epochs": 8 }, "mean": 0.0228443113155663 }, { "cfg": { "lr": 0.003, "epochs": 8 }, "mean": 0.006279829074628651 }, { "cfg": { "lr": 0.01, "epochs": 8 }, "mean": 0.005194205295993015 } ], "full": { "mean": 0.004214190877974033, "std": 0.0026682777355217157, "per_seed": [ 0.002182353986427188, 0.008899358101189137, 0.0017826670082286, 0.007912442088127136, 0.003060318995267153, 0.0012072835816070437, 0.0036685036029666662, 0.005000599659979343 ], "n": 8 } }, "idea": { "mean": 0.004029877163702622, "std": 0.0015034226018154422, "per_seed": [ 0.0031153184827417135, 0.0026313886046409607, 0.006552070379257202, 0.0028610709123313427, 0.005238592624664307, 0.002022449392825365, 0.004396332893520594, 0.005421794019639492 ], "n": 8, "selected_cfg": { "lr": 0.01, "epochs": 8 } }, "comparison": { "delta_mean": -0.0001843137142714113, "idea_wins": 2, "n_pairs": 8, "per_seed_diffs": [ 0.0009329644963145256, -0.006267969496548176, 0.004769403371028602, -0.0050513711757957935, 0.002178273629397154, 0.0008151658112183213, 0.0007278292905539274, 0.0004211943596601486 ], "p_value": 0.9399, "mde": 0.003068421703670571, "mde_rel_pct": 72.81164504693035, "verdict": "no significant win", "system_worked": false }, "mechanism_signature": { "prediction": "recursive predicted variance should calibrate observed squared error near 1 and track heteroscedasticity", "predicted_vs_observed": { "mean_q_recursive": 0.8105446696281433, "mean_observed_squared_error": 0.005421794019639492, "calibration_ratio_mean": 0.005157590081528752, "calibration_ratio_per_seed": [ 0.003714949226948883, 0.0034924976914672296, 0.00926556392303059, 0.003918822999611737, 0.006340776802686519, 0.002460186822311339, 0.005378848268044676, 0.00668907491812904 ], "q_error_correlation_mean": -0.09872341295990021 }, "confirmed": false }, "protocol_notes": { "structural_match": "multi-step stochastic actuated pendulum rollout; recursive uncertainty applies to transition branches", "baseline": "standard MSE training", "idea": "mean/variance RNN with detached recursive child q plus between-child variance", "n_train": 400, "n_test": 200, "branch_count": 4, "grid_union": [ { "lr": 0.001, "epochs": 8 }, { "lr": 0.003, "epochs": 8 }, { "lr": 0.01, "epochs": 8 } ] } }