Interval-Certified Equilibrium Layer / bench_report.json
Failed on benchmark
1{
2 "bench_version": 1,
3 "track": "dynamics",
4 "model": "custom_equilibrium_rnn",
5 "metric_direction": "lower is better",
6 "n_seeds": 8,
7 "baseline": {
8 "best_cfg": {
9 "lr": 0.006,
10 "iters": 24
11 },
12 "sweep": [
13 {
14 "cfg": {
15 "lr": 0.001,
16 "iters": 8
17 },
18 "mean": 0.04040969908237457
19 },
20 {
21 "cfg": {
22 "lr": 0.003,
23 "iters": 16
24 },
25 "mean": 0.008657814585603774
26 },
27 {
28 "cfg": {
29 "lr": 0.006,
30 "iters": 24
31 },
32 "mean": 0.004971429007127881
33 }
34 ],
35 "full": {
36 "mean": 0.004260060406522825,
37 "std": 0.0017312099173934859,
38 "per_seed": [
39 0.00337711232714355,
40 0.007119504269212484,
41 0.007134149316698313,
42 0.002254950115457177,
43 0.003825985360890627,
44 0.003774178447201848,
45 0.0037776767276227474,
46 0.0028169266879558563
47 ],
48 "n": 8
49 }
50 },
51 "idea": {
52 "mean": 0.004260060406522825,
53 "std": 0.0017312099173934859,
54 "per_seed": [
55 0.00337711232714355,
56 0.007119504269212484,
57 0.007134149316698313,
58 0.002254950115457177,
59 0.003825985360890627,
60 0.003774178447201848,
61 0.0037776767276227474,
62 0.0028169266879558563
63 ],
64 "n": 8,
65 "best_cfg": {
66 "lr": 0.006,
67 "iters": 24
68 },
69 "sweep": [
70 {
71 "cfg": {
72 "lr": 0.001,
73 "iters": 8
74 },
75 "mean": 0.044312840327620506
76 },
77 {
78 "cfg": {
79 "lr": 0.003,
80 "iters": 16
81 },
82 "mean": 0.008995423908345401
83 },
84 {
85 "cfg": {
86 "lr": 0.006,
87 "iters": 24
88 },
89 "mean": 0.004260060406522825
90 }
91 ]
92 },
93 "comparison": {
94 "delta_mean": 0.0,
95 "idea_wins": 0,
96 "n_pairs": 8,
97 "per_seed_diffs": [
98 0.0,
99 0.0,
100 0.0,
101 0.0,
102 0.0,
103 0.0,
104 0.0,
105 0.0
106 ],
107 "p_value": 1.0,
108 "mde": 0.0,
109 "mde_rel_pct": 0.0,
110 "verdict": "no measurable effect",
111 "system_worked": false
112 },
113 "architecture_note": "Both arms train the same implicit tanh recurrent layer; baseline always iterates, idea certifies then falls back.",
114 "runtime_sec": 50.54426717758179,
115 "mechanism_signature": {
116 "prediction": "trained-model local q below 0.8 predicts certification; q near/above 1 predicts fallback",
117 "n_models": 8,
118 "predicted_low_q_count": 0,
119 "observed_certified_low_q_count": 0,
120 "mean_q": 3.819756507873535,
121 "min_q": 3.59490966796875,
122 "max_q": 4.270003318786621,
123 "q_values": [
124 3.786127805709839,
125 3.7302780151367188,
126 3.6078004837036133,
127 3.59490966796875,
128 3.9719083309173584,
129 4.270003318786621,
130 3.7772746086120605,
131 3.8197498321533203
132 ],
133 "certified_flags": [
134 0,
135 0,
136 0,
137 0,
138 0,
139 0,
140 0,
141 0
142 ],
143 "confirmed": false
144 }
145}