GQL Safe Residual Layer / bench_report.json
Failed on benchmark
1{
2 "bench_version": 1,
3 "track": "custom_relativistic_conservative_regression",
4 "model": "mlp_tiny",
5 "metric_direction": "lower is better",
6 "n_seeds": 8,
7 "baseline": {
8 "best_cfg": {
9 "lr": 0.006,
10 "epochs": 12
11 },
12 "sweep": [
13 {
14 "cfg": {
15 "lr": 0.001,
16 "epochs": 12
17 },
18 "mean": 0.95502670109272
19 },
20 {
21 "cfg": {
22 "lr": 0.003,
23 "epochs": 12
24 },
25 "mean": 0.2731384299695492
26 },
27 {
28 "cfg": {
29 "lr": 0.006,
30 "epochs": 12
31 },
32 "mean": 0.2562924362719059
33 }
34 ],
35 "full": {
36 "mean": 0.25546916387975216,
37 "std": 0.020297905471986302,
38 "per_seed": [
39 0.26548606157302856,
40 0.26569655537605286,
41 0.222167506814003,
42 0.2718196213245392,
43 0.24948517978191376,
44 0.23331035673618317,
45 0.2888605296611786,
46 0.24692749977111816
47 ],
48 "n": 8
49 }
50 },
51 "idea": {
52 "mean": 0.2924688458442688,
53 "std": 0.11434509573619478,
54 "per_seed": [
55 0.24210484325885773,
56 0.26006338000297546,
57 0.22749106585979462,
58 0.2767752707004547,
59 0.5917121171951294,
60 0.23255784809589386,
61 0.2707672119140625,
62 0.23827902972698212
63 ],
64 "n": 8
65 },
66 "comparison": {
67 "delta_mean": 0.03699968196451664,
68 "idea_wins": 5,
69 "n_pairs": 8,
70 "per_seed_diffs": [
71 -0.023381218314170837,
72 -0.005633175373077393,
73 0.005323559045791626,
74 0.004955649375915527,
75 0.34222693741321564,
76 -0.0007525086402893066,
77 -0.01809331774711609,
78 -0.008648470044136047
79 ],
80 "p_value": 0.92165,
81 "mde": 0.10347551087691399,
82 "mde_rel_pct": 40.504109891563786,
83 "verdict": "no significant win",
84 "system_worked": false
85 },
86 "custom_track": {
87 "name": "relativistic_conservative_regression",
88 "file": "gql_track.py",
89 "domain": "conservative_state_admissibility"
90 },
91 "sweep_parity": {
92 "union_grid": [
93 {
94 "lr": 0.001,
95 "epochs": 12
96 },
97 {
98 "lr": 0.003,
99 "epochs": 12
100 },
101 {
102 "lr": 0.006,
103 "epochs": 12
104 }
105 ],
106 "idea_sweep": [
107 {
108 "cfg": {
109 "lr": 0.001,
110 "epochs": 12
111 },
112 "mean": 0.7376375496387482
113 },
114 {
115 "cfg": {
116 "lr": 0.003,
117 "epochs": 12
118 },
119 "mean": 0.2556793764233589
120 },
121 {
122 "cfg": {
123 "lr": 0.006,
124 "epochs": 12
125 },
126 "mean": 0.25160863995552063
127 }
128 ]
129 },
130 "mechanism_signature": {
131 "claim": "limiting a valid baseline candidate along the complete residual enforces admissibility",
132 "predicted_invalid_rate_after_limit": 0.0,
133 "observed_invalid_rate_after_limit": 0.019999999552965164,
134 "observed_raw_invalid_rate": 0.1299999998882413,
135 "trained_model_measurements": [
136 {
137 "seed": 0,
138 "invalid_raw": 0.029999999329447746,
139 "invalid_limited": 0.0,
140 "mean_theta": 0.9987504482269287
141 },
142 {
143 "seed": 1,
144 "invalid_raw": 0.009999999776482582,
145 "invalid_limited": 0.0,
146 "mean_theta": 0.9990912079811096
147 },
148 {
149 "seed": 2,
150 "invalid_raw": 0.0,
151 "invalid_limited": 0.0,
152 "mean_theta": 1.0
153 },
154 {
155 "seed": 3,
156 "invalid_raw": 0.0,
157 "invalid_limited": 0.0,
158 "mean_theta": 1.0
159 },
160 {
161 "seed": 4,
162 "invalid_raw": 1.0,
163 "invalid_limited": 0.1599999964237213,
164 "mean_theta": 0.5550016164779663
165 },
166 {
167 "seed": 5,
168 "invalid_raw": 0.0,
169 "invalid_limited": 0.0,
170 "mean_theta": 1.0
171 },
172 {
173 "seed": 6,
174 "invalid_raw": 0.0,
175 "invalid_limited": 0.0,
176 "mean_theta": 1.0
177 },
178 {
179 "seed": 7,
180 "invalid_raw": 0.0,
181 "invalid_limited": 0.0,
182 "mean_theta": 1.0
183 }
184 ],
185 "confirmed": false
186 }
187}