{ "bench_version": 1, "track": "dynamics", "model": "rnn_small", "metric_direction": "lower is better", "n_seeds": 8, "baseline": { "best_cfg": { "lr": 0.01, "mu": 0.0 }, "sweep": [ { "cfg": { "lr": 0.001, "mu": 0.0 }, "mean": 0.004298779065720737 }, { "cfg": { "lr": 0.001, "mu": 0.05 }, "mean": 0.004298779065720737 }, { "cfg": { "lr": 0.001, "mu": 0.2 }, "mean": 0.004298779065720737 }, { "cfg": { "lr": 0.001, "mu": 0.5 }, "mean": 0.004298779065720737 }, { "cfg": { "lr": 0.003, "mu": 0.0 }, "mean": 0.0034615940821822733 }, { "cfg": { "lr": 0.003, "mu": 0.05 }, "mean": 0.0034615940821822733 }, { "cfg": { "lr": 0.003, "mu": 0.2 }, "mean": 0.0034615940821822733 }, { "cfg": { "lr": 0.003, "mu": 0.5 }, "mean": 0.0034615940821822733 }, { "cfg": { "lr": 0.01, "mu": 0.0 }, "mean": 0.0014865802077110857 }, { "cfg": { "lr": 0.01, "mu": 0.05 }, "mean": 0.0014865802077110857 }, { "cfg": { "lr": 0.01, "mu": 0.2 }, "mean": 0.0014865802077110857 }, { "cfg": { "lr": 0.01, "mu": 0.5 }, "mean": 0.0014865802077110857 } ], "full": { "mean": 0.0014198302378645167, "std": 0.00039839114901047844, "per_seed": [ 0.0009327387670055032, 0.0018641706556081772, 0.0010785290505737066, 0.0020708823576569557, 0.0009260809747502208, 0.0014055331703275442, 0.0016443432541564107, 0.001436363672837615 ], "n": 8 } }, "idea": { "mean": 0.0013042011414654553, "std": 0.0005283693045785661, "per_seed": [ 0.0023362392093986273, 0.0014533286448568106, 0.0007090693688951433, 0.0012600651243701577, 0.0010053017176687717, 0.001083051203750074, 0.0007225603912957013, 0.0018639934714883566 ], "n": 8, "best_cfg": { "lr": 0.01, "mu": 0.05 }, "sweep": [ { "cfg": { "lr": 0.001, "mu": 0.05 }, "mean": 0.004056878213305026 }, { "cfg": { "lr": 0.001, "mu": 0.2 }, "mean": 0.004066162509843707 }, { "cfg": { "lr": 0.001, "mu": 0.5 }, "mean": 0.004089910595212132 }, { "cfg": { "lr": 0.003, "mu": 0.05 }, "mean": 0.003846683946903795 }, { "cfg": { "lr": 0.003, "mu": 0.2 }, "mean": 0.003857339732348919 }, { "cfg": { "lr": 0.003, "mu": 0.5 }, "mean": 0.0038832707796245813 }, { "cfg": { "lr": 0.01, "mu": 0.05 }, "mean": 0.0014396755868801847 }, { "cfg": { "lr": 0.01, "mu": 0.2 }, "mean": 0.0014551622880389914 }, { "cfg": { "lr": 0.01, "mu": 0.5 }, "mean": 0.001473813972552307 } ] }, "comparison": { "delta_mean": -0.00011562909639906138, "idea_wins": 5, "n_pairs": 8, "per_seed_diffs": [ 0.001403500442393124, -0.0004108420107513666, -0.00036945968167856336, -0.000810817233286798, 7.922074291855097e-05, -0.0003224819665774703, -0.0009217828628607094, 0.0004276297986507416 ], "p_value": 0.6789, "mde": 0.0006295704392970048, "mde_rel_pct": 44.341247460957355, "verdict": "no significant win", "system_worked": false }, "track_justification": "Dynamics is structurally matched: the task is controlled pendulum rollout and the intervention constrains predicted outputs under empirical error scenarios.", "idea_sweep": [ { "cfg": { "lr": 0.001, "mu": 0.05 }, "mean": 0.004056878213305026 }, { "cfg": { "lr": 0.001, "mu": 0.2 }, "mean": 0.004066162509843707 }, { "cfg": { "lr": 0.001, "mu": 0.5 }, "mean": 0.004089910595212132 }, { "cfg": { "lr": 0.003, "mu": 0.05 }, "mean": 0.003846683946903795 }, { "cfg": { "lr": 0.003, "mu": 0.2 }, "mean": 0.003857339732348919 }, { "cfg": { "lr": 0.003, "mu": 0.5 }, "mean": 0.0038832707796245813 }, { "cfg": { "lr": 0.01, "mu": 0.05 }, "mean": 0.0014396755868801847 }, { "cfg": { "lr": 0.01, "mu": 0.2 }, "mean": 0.0014551622880389914 }, { "cfg": { "lr": 0.01, "mu": 0.5 }, "mean": 0.001473813972552307 } ], "custom_track": null, "mechanism_signature": { "baseline_residual_std": 0.034058332443237305, "idea_residual_std": 0.031945905182510614, "baseline_mean_slack": 0.0, "idea_mean_slack": 0.0, "prediction": "scenario penalty reduces empirical residual-boundary slack", "confirmed": false } }