IMM Stale-Feedback Detector / bench_report.json
Failed on benchmark
1{
2 "bench_version": 1,
3 "track": "tabular",
4 "model": "mlp_tiny",
5 "metric_direction": "lower is better",
6 "n_seeds": 8,
7 "baseline": {
8 "best_cfg": {
9 "lr": 0.01
10 },
11 "sweep": [
12 {
13 "cfg": {
14 "lr": 0.001
15 },
16 "mean": 25.60164165496826
17 },
18 {
19 "cfg": {
20 "lr": 0.003
21 },
22 "mean": 13.860755920410156
23 },
24 {
25 "cfg": {
26 "lr": 0.01
27 },
28 "mean": 8.352817177772522
29 }
30 ],
31 "full": {
32 "mean": 8.567867696285248,
33 "std": 0.9045233203943077,
34 "per_seed": [
35 7.95448637008667,
36 9.628232955932617,
37 7.726639747619629,
38 8.101909637451172,
39 7.126259803771973,
40 8.949170112609863,
41 9.36670970916748,
42 9.689533233642578
43 ],
44 "n": 8
45 }
46 },
47 "idea": {
48 "mean": 8.567867696285248,
49 "std": 0.9045233203943077,
50 "per_seed": [
51 7.95448637008667,
52 9.628232955932617,
53 7.726639747619629,
54 8.101909637451172,
55 7.126259803771973,
56 8.949170112609863,
57 9.36670970916748,
58 9.689533233642578
59 ],
60 "n": 8
61 },
62 "comparison": {
63 "delta_mean": 0.0,
64 "idea_wins": 0,
65 "n_pairs": 8,
66 "per_seed_diffs": [
67 0.0,
68 0.0,
69 0.0,
70 0.0,
71 0.0,
72 0.0,
73 0.0,
74 0.0
75 ],
76 "p_value": 1.0,
77 "mde": 0.0,
78 "mde_rel_pct": 0.0,
79 "verdict": "no measurable effect",
80 "system_worked": false
81 },
82 "mechanism_signature": {
83 "prediction": "persistent stale-feedback should lower no-delay posterior and trigger intervention",
84 "observed": "trained tabular MLP monitor posterior/alarm telemetry across paired runs",
85 "confirmed": false,
86 "note": "No injected delay is available in the canonical bench; signature is behavioral telemetry, not toy arithmetic."
87 },
88 "idea_sweep": [
89 {
90 "cfg": {
91 "lr": 0.01
92 },
93 "mean": 8.567867696285248
94 },
95 {
96 "cfg": {
97 "lr": 0.001
98 },
99 "mean": 25.929206609725952
100 },
101 {
102 "cfg": {
103 "lr": 0.003
104 },
105 "mean": 14.512071013450623
106 }
107 ],
108 "selected_idea_cfg": {
109 "lr": 0.01
110 }
111}