Interval-Certified Equilibrium Layer / bench_report.json

Failed on benchmark

Raw ⬇ ZIP
  1{
  2  "bench_version": 1,
  3  "track": "dynamics",
  4  "model": "custom_equilibrium_rnn",
  5  "metric_direction": "lower is better",
  6  "n_seeds": 8,
  7  "baseline": {
  8    "best_cfg": {
  9      "lr": 0.006,
 10      "iters": 24
 11    },
 12    "sweep": [
 13      {
 14        "cfg": {
 15          "lr": 0.001,
 16          "iters": 8
 17        },
 18        "mean": 0.04040969908237457
 19      },
 20      {
 21        "cfg": {
 22          "lr": 0.003,
 23          "iters": 16
 24        },
 25        "mean": 0.008657814585603774
 26      },
 27      {
 28        "cfg": {
 29          "lr": 0.006,
 30          "iters": 24
 31        },
 32        "mean": 0.004971429007127881
 33      }
 34    ],
 35    "full": {
 36      "mean": 0.004260060406522825,
 37      "std": 0.0017312099173934859,
 38      "per_seed": [
 39        0.00337711232714355,
 40        0.007119504269212484,
 41        0.007134149316698313,
 42        0.002254950115457177,
 43        0.003825985360890627,
 44        0.003774178447201848,
 45        0.0037776767276227474,
 46        0.0028169266879558563
 47      ],
 48      "n": 8
 49    }
 50  },
 51  "idea": {
 52    "mean": 0.004260060406522825,
 53    "std": 0.0017312099173934859,
 54    "per_seed": [
 55      0.00337711232714355,
 56      0.007119504269212484,
 57      0.007134149316698313,
 58      0.002254950115457177,
 59      0.003825985360890627,
 60      0.003774178447201848,
 61      0.0037776767276227474,
 62      0.0028169266879558563
 63    ],
 64    "n": 8,
 65    "best_cfg": {
 66      "lr": 0.006,
 67      "iters": 24
 68    },
 69    "sweep": [
 70      {
 71        "cfg": {
 72          "lr": 0.001,
 73          "iters": 8
 74        },
 75        "mean": 0.044312840327620506
 76      },
 77      {
 78        "cfg": {
 79          "lr": 0.003,
 80          "iters": 16
 81        },
 82        "mean": 0.008995423908345401
 83      },
 84      {
 85        "cfg": {
 86          "lr": 0.006,
 87          "iters": 24
 88        },
 89        "mean": 0.004260060406522825
 90      }
 91    ]
 92  },
 93  "comparison": {
 94    "delta_mean": 0.0,
 95    "idea_wins": 0,
 96    "n_pairs": 8,
 97    "per_seed_diffs": [
 98      0.0,
 99      0.0,
100      0.0,
101      0.0,
102      0.0,
103      0.0,
104      0.0,
105      0.0
106    ],
107    "p_value": 1.0,
108    "mde": 0.0,
109    "mde_rel_pct": 0.0,
110    "verdict": "no measurable effect",
111    "system_worked": false
112  },
113  "architecture_note": "Both arms train the same implicit tanh recurrent layer; baseline always iterates, idea certifies then falls back.",
114  "runtime_sec": 50.54426717758179,
115  "mechanism_signature": {
116    "prediction": "trained-model local q below 0.8 predicts certification; q near/above 1 predicts fallback",
117    "n_models": 8,
118    "predicted_low_q_count": 0,
119    "observed_certified_low_q_count": 0,
120    "mean_q": 3.819756507873535,
121    "min_q": 3.59490966796875,
122    "max_q": 4.270003318786621,
123    "q_values": [
124      3.786127805709839,
125      3.7302780151367188,
126      3.6078004837036133,
127      3.59490966796875,
128      3.9719083309173584,
129      4.270003318786621,
130      3.7772746086120605,
131      3.8197498321533203
132    ],
133    "certified_flags": [
134      0,
135      0,
136      0,
137      0,
138      0,
139      0,
140      0,
141      0
142    ],
143    "confirmed": false
144  }
145}