IMM Stale-Feedback Detector / bench_report.json

Failed on benchmark

Raw ⬇ ZIP
  1{
  2  "bench_version": 1,
  3  "track": "tabular",
  4  "model": "mlp_tiny",
  5  "metric_direction": "lower is better",
  6  "n_seeds": 8,
  7  "baseline": {
  8    "best_cfg": {
  9      "lr": 0.01
 10    },
 11    "sweep": [
 12      {
 13        "cfg": {
 14          "lr": 0.001
 15        },
 16        "mean": 25.60164165496826
 17      },
 18      {
 19        "cfg": {
 20          "lr": 0.003
 21        },
 22        "mean": 13.860755920410156
 23      },
 24      {
 25        "cfg": {
 26          "lr": 0.01
 27        },
 28        "mean": 8.352817177772522
 29      }
 30    ],
 31    "full": {
 32      "mean": 8.567867696285248,
 33      "std": 0.9045233203943077,
 34      "per_seed": [
 35        7.95448637008667,
 36        9.628232955932617,
 37        7.726639747619629,
 38        8.101909637451172,
 39        7.126259803771973,
 40        8.949170112609863,
 41        9.36670970916748,
 42        9.689533233642578
 43      ],
 44      "n": 8
 45    }
 46  },
 47  "idea": {
 48    "mean": 8.567867696285248,
 49    "std": 0.9045233203943077,
 50    "per_seed": [
 51      7.95448637008667,
 52      9.628232955932617,
 53      7.726639747619629,
 54      8.101909637451172,
 55      7.126259803771973,
 56      8.949170112609863,
 57      9.36670970916748,
 58      9.689533233642578
 59    ],
 60    "n": 8
 61  },
 62  "comparison": {
 63    "delta_mean": 0.0,
 64    "idea_wins": 0,
 65    "n_pairs": 8,
 66    "per_seed_diffs": [
 67      0.0,
 68      0.0,
 69      0.0,
 70      0.0,
 71      0.0,
 72      0.0,
 73      0.0,
 74      0.0
 75    ],
 76    "p_value": 1.0,
 77    "mde": 0.0,
 78    "mde_rel_pct": 0.0,
 79    "verdict": "no measurable effect",
 80    "system_worked": false
 81  },
 82  "mechanism_signature": {
 83    "prediction": "persistent stale-feedback should lower no-delay posterior and trigger intervention",
 84    "observed": "trained tabular MLP monitor posterior/alarm telemetry across paired runs",
 85    "confirmed": false,
 86    "note": "No injected delay is available in the canonical bench; signature is behavioral telemetry, not toy arithmetic."
 87  },
 88  "idea_sweep": [
 89    {
 90      "cfg": {
 91        "lr": 0.01
 92      },
 93      "mean": 8.567867696285248
 94    },
 95    {
 96      "cfg": {
 97        "lr": 0.001
 98      },
 99      "mean": 25.929206609725952
100    },
101    {
102      "cfg": {
103        "lr": 0.003
104      },
105      "mean": 14.512071013450623
106    }
107  ],
108  "selected_idea_cfg": {
109    "lr": 0.01
110  }
111}