{ "bench_version": 1, "track": "dynamics", "model": "rnn_small", "metric_direction": "lower is better", "n_seeds": 8, "baseline": { "best_cfg": { "lr": 0.003, "noise": 0.05 }, "sweep": [ { "cfg": { "lr": 0.001, "noise": 0.0 }, "mean": 0.004072679847013205 }, { "cfg": { "lr": 0.001, "noise": 0.05 }, "mean": 0.004067454778123647 }, { "cfg": { "lr": 0.001, "noise": 0.12 }, "mean": 0.004125235078390688 }, { "cfg": { "lr": 0.003, "noise": 0.0 }, "mean": 0.0009398171678185463 }, { "cfg": { "lr": 0.003, "noise": 0.05 }, "mean": 0.0009230706054950133 }, { "cfg": { "lr": 0.003, "noise": 0.12 }, "mean": 0.0010494974412722513 }, { "cfg": { "lr": 0.006, "noise": 0.0 }, "mean": 0.00099106683046557 }, { "cfg": { "lr": 0.006, "noise": 0.05 }, "mean": 0.0010217856470262632 }, { "cfg": { "lr": 0.006, "noise": 0.12 }, "mean": 0.0012236582988407463 } ], "full": { "mean": 0.0013185284115024842, "std": 0.00047476113201356173, "per_seed": [ 0.0008951174677349627, 0.0010742346057668328, 0.0008329956326633692, 0.0008899347158148885, 0.0012180092744529247, 0.0017242580652236938, 0.001678277039900422, 0.00223540049046278 ], "n": 8 } }, "idea": { "mean": 0.0013091382279526442, "std": 0.00047291421988416747, "per_seed": [ 0.0008530844934284687, 0.0012209241976961493, 0.0008412626339122653, 0.0008439973462373018, 0.0011196484556421638, 0.0017749746330082417, 0.0016231484478339553, 0.002196065615862608 ], "n": 8 }, "comparison": { "delta_mean": -9.390183549840003e-06, "idea_wins": 5, "n_pairs": 8, "per_seed_diffs": [ -4.2032974306494e-05, 0.00014668959192931652, 8.267001248896122e-06, -4.593736957758665e-05, -9.836081881076097e-05, 5.0716567784547806e-05, -5.512859206646681e-05, -3.933487460017204e-05 ], "p_value": 0.8087, "mde": 6.445221887975781e-05, "mde_rel_pct": 4.888193406944753, "verdict": "no measurable effect", "system_worked": false }, "mechanism_signature": { "math_sanity": { "identity_kl": 0.0, "identity_is_minimum": true, "small_scale_kl_over_d_eps2": [ 0.9966914683191119, 0.9934317595506632, 0.987054279199204 ], "quadratic_ratio_mean": 0.9923925023563264, "predicted_quadratic_limit": 1.0, "dimension_linearity_check": 2.0, "predicted_dimension_ratio": 2.0 }, "selected_idea_cfg": { "lr": 0.003, "scale": 1.0 }, "signature_cfg": { "lr": 0.003, "scale": 1.04 }, "idea_sweep": [ { "cfg": { "lr": 0.001, "scale": 1.0 }, "mean": 0.004072679847013205 }, { "cfg": { "lr": 0.001, "scale": 1.04 }, "mean": 0.003918257338227704 }, { "cfg": { "lr": 0.001, "scale": 1.08 }, "mean": 0.003774982877075672 }, { "cfg": { "lr": 0.003, "scale": 1.0 }, "mean": 0.0009398171678185463 }, { "cfg": { "lr": 0.003, "scale": 1.04 }, "mean": 0.0009415723325219005 }, { "cfg": { "lr": 0.003, "scale": 1.08 }, "mean": 0.0009481702145421878 }, { "cfg": { "lr": 0.006, "scale": 1.0 }, "mean": 0.00099106683046557 }, { "cfg": { "lr": 0.006, "scale": 1.04 }, "mean": 0.0009713326871860772 }, { "cfg": { "lr": 0.006, "scale": 1.08 }, "mean": 0.0009424890304217115 } ], "map": "T(x)=grad(.5*s*||x||^2)=s*x", "predicted_mean_displacement": 0.1655000495910646, "observed_mean_displacement_model_inputs": 0.16549988090991974, "displacement_relative_error": 1.0192211136694558e-06, "predicted_gaussian_kl": 0.0379028843212495, "observed_pushforward_kl_from_exact_gaussian_formula": 0.0379028843212495, "confirmed": true, "trained_model_test_mse": 0.0013091382279526442 }, "custom_track": null, "track_justification": "Dynamics is structurally matched because the idea targets globally coherent perturbations of controlled state/action rollout distributions; rnn_small is shared." }