{ "bench_version": 1, "track": "tabular", "model": "mlp_tiny", "metric_direction": "lower is better", "n_seeds": 8, "baseline": { "best_cfg": { "lr": 0.01 }, "sweep": [ { "cfg": { "lr": 0.001 }, "mean": 25.60164165496826 }, { "cfg": { "lr": 0.003 }, "mean": 13.860755920410156 }, { "cfg": { "lr": 0.01 }, "mean": 8.352817177772522 } ], "full": { "mean": 8.567867696285248, "std": 0.9045233203943077, "per_seed": [ 7.95448637008667, 9.628232955932617, 7.726639747619629, 8.101909637451172, 7.126259803771973, 8.949170112609863, 9.36670970916748, 9.689533233642578 ], "n": 8 } }, "idea": { "mean": 8.567867696285248, "std": 0.9045233203943077, "per_seed": [ 7.95448637008667, 9.628232955932617, 7.726639747619629, 8.101909637451172, 7.126259803771973, 8.949170112609863, 9.36670970916748, 9.689533233642578 ], "n": 8 }, "comparison": { "delta_mean": 0.0, "idea_wins": 0, "n_pairs": 8, "per_seed_diffs": [ 0.0, 0.0, 0.0, 0.0, 0.0, 0.0, 0.0, 0.0 ], "p_value": 1.0, "mde": 0.0, "mde_rel_pct": 0.0, "verdict": "no measurable effect", "system_worked": false }, "mechanism_signature": { "prediction": "persistent stale-feedback should lower no-delay posterior and trigger intervention", "observed": "trained tabular MLP monitor posterior/alarm telemetry across paired runs", "confirmed": false, "note": "No injected delay is available in the canonical bench; signature is behavioral telemetry, not toy arithmetic." }, "idea_sweep": [ { "cfg": { "lr": 0.01 }, "mean": 8.567867696285248 }, { "cfg": { "lr": 0.001 }, "mean": 25.929206609725952 }, { "cfg": { "lr": 0.003 }, "mean": 14.512071013450623 } ], "selected_idea_cfg": { "lr": 0.01 } }