{ "bench_version": 1, "track": "dynamics", "model": "rnn_small", "metric_direction": "lower is better", "n_seeds": 8, "baseline": { "best_cfg": { "lr": 0.002, "weight_decay": 0.0001 }, "sweep": [ { "cfg": { "lr": 0.0005, "weight_decay": 0.0 }, "mean": 0.11454633437097073 }, { "cfg": { "lr": 0.0005, "weight_decay": 0.0001 }, "mean": 0.11465956829488277 }, { "cfg": { "lr": 0.001, "weight_decay": 0.0 }, "mean": 0.005499854683876038 }, { "cfg": { "lr": 0.001, "weight_decay": 0.0001 }, "mean": 0.005453515565022826 }, { "cfg": { "lr": 0.002, "weight_decay": 0.0 }, "mean": 0.004555012041237205 }, { "cfg": { "lr": 0.002, "weight_decay": 0.0001 }, "mean": 0.004531972575932741 } ], "full": { "mean": 0.004597172053763643, "std": 0.0008625188036902094, "per_seed": [ 0.004187586717307568, 0.006327331997454166, 0.0038855248130857944, 0.003727446775883436, 0.005093815270811319, 0.005022076889872551, 0.004930851981043816, 0.0036027419846504927 ], "n": 8 }, "all_union_configs": [ { "lr": 0.0005, "weight_decay": 0.0 }, { "lr": 0.0005, "weight_decay": 0.0001 }, { "lr": 0.001, "weight_decay": 0.0 }, { "lr": 0.001, "weight_decay": 0.0001 }, { "lr": 0.002, "weight_decay": 0.0 }, { "lr": 0.002, "weight_decay": 0.0001 } ] }, "idea": { "mean": 0.7925681881606579, "std": 0.47593743937124783, "per_seed": [ 0.9278137683868408, 1.54276442527771, 0.2908315360546112, 1.384081244468689, 0.39941179752349854, 0.5426146984100342, 1.049137830734253, 0.20389020442962646 ], "n": 8 }, "comparison": { "delta_mean": 0.7879710161068942, "idea_wins": 0, "n_pairs": 8, "per_seed_diffs": [ 0.9236261816695333, 1.5364370932802558, 0.2869460112415254, 1.3803537976928055, 0.3943179822526872, 0.5375926215201616, 1.0442069787532091, 0.20028746244497597 ], "p_value": 0.0081, "mde": 0.4250928421498136, "mde_rel_pct": 9246.833426688821, "verdict": "idea worse (significant)", "system_worked": false }, "mechanism_signature": { "quantity": "sigma(theta) at ||theta||=sqrt(d), measured formula in trained-update state space", "predicted_slope": 0.6931471805599453, "observed_slope": 0.6931471805599447, "max_abs_error": 0.0, "confirmed": true, "note": "The update mechanism was exercised by trained dynamics-track models; this signature tests coefficient scaling, not sampling ESS." }, "idea_sweep": [ { "cfg": { "lr": 0.002, "weight_decay": 0.0001, "alpha": 0.05 }, "full": { "mean": 2.3324266374111176, "std": 0.4043937352445423, "per_seed": [ 2.4503955841064453, 2.867910385131836, 2.2843286991119385, 1.803705096244812, 2.6125521659851074, 2.8163137435913086, 2.085012912750244, 1.7391945123672485 ], "n": 8 } }, { "cfg": { "lr": 0.0005, "weight_decay": 0.0001, "alpha": 0.05 }, "full": { "mean": 0.7925681881606579, "std": 0.47593743937124783, "per_seed": [ 0.9278137683868408, 1.54276442527771, 0.2908315360546112, 1.384081244468689, 0.39941179752349854, 0.5426146984100342, 1.049137830734253, 0.20389020442962646 ], "n": 8 } }, { "cfg": { "lr": 0.002, "weight_decay": 0.0001, "alpha": 0.05 }, "full": { "mean": 2.3324266374111176, "std": 0.4043937352445423, "per_seed": [ 2.4503955841064453, 2.867910385131836, 2.2843286991119385, 1.803705096244812, 2.6125521659851074, 2.8163137435913086, 2.085012912750244, 1.7391945123672485 ], "n": 8 } } ], "transfer_note": "No built-in latent/energy sampler track exists; dynamics is the closest structural stability/control track. The intervention is therefore a parameter-space Langevin transfer, not latent-state sampling." }