GQL Safe Residual Layer / bench_report.json

Failed on benchmark

Raw ⬇ ZIP
  1{
  2  "bench_version": 1,
  3  "track": "custom_relativistic_conservative_regression",
  4  "model": "mlp_tiny",
  5  "metric_direction": "lower is better",
  6  "n_seeds": 8,
  7  "baseline": {
  8    "best_cfg": {
  9      "lr": 0.006,
 10      "epochs": 12
 11    },
 12    "sweep": [
 13      {
 14        "cfg": {
 15          "lr": 0.001,
 16          "epochs": 12
 17        },
 18        "mean": 0.95502670109272
 19      },
 20      {
 21        "cfg": {
 22          "lr": 0.003,
 23          "epochs": 12
 24        },
 25        "mean": 0.2731384299695492
 26      },
 27      {
 28        "cfg": {
 29          "lr": 0.006,
 30          "epochs": 12
 31        },
 32        "mean": 0.2562924362719059
 33      }
 34    ],
 35    "full": {
 36      "mean": 0.25546916387975216,
 37      "std": 0.020297905471986302,
 38      "per_seed": [
 39        0.26548606157302856,
 40        0.26569655537605286,
 41        0.222167506814003,
 42        0.2718196213245392,
 43        0.24948517978191376,
 44        0.23331035673618317,
 45        0.2888605296611786,
 46        0.24692749977111816
 47      ],
 48      "n": 8
 49    }
 50  },
 51  "idea": {
 52    "mean": 0.2924688458442688,
 53    "std": 0.11434509573619478,
 54    "per_seed": [
 55      0.24210484325885773,
 56      0.26006338000297546,
 57      0.22749106585979462,
 58      0.2767752707004547,
 59      0.5917121171951294,
 60      0.23255784809589386,
 61      0.2707672119140625,
 62      0.23827902972698212
 63    ],
 64    "n": 8
 65  },
 66  "comparison": {
 67    "delta_mean": 0.03699968196451664,
 68    "idea_wins": 5,
 69    "n_pairs": 8,
 70    "per_seed_diffs": [
 71      -0.023381218314170837,
 72      -0.005633175373077393,
 73      0.005323559045791626,
 74      0.004955649375915527,
 75      0.34222693741321564,
 76      -0.0007525086402893066,
 77      -0.01809331774711609,
 78      -0.008648470044136047
 79    ],
 80    "p_value": 0.92165,
 81    "mde": 0.10347551087691399,
 82    "mde_rel_pct": 40.504109891563786,
 83    "verdict": "no significant win",
 84    "system_worked": false
 85  },
 86  "custom_track": {
 87    "name": "relativistic_conservative_regression",
 88    "file": "gql_track.py",
 89    "domain": "conservative_state_admissibility"
 90  },
 91  "sweep_parity": {
 92    "union_grid": [
 93      {
 94        "lr": 0.001,
 95        "epochs": 12
 96      },
 97      {
 98        "lr": 0.003,
 99        "epochs": 12
100      },
101      {
102        "lr": 0.006,
103        "epochs": 12
104      }
105    ],
106    "idea_sweep": [
107      {
108        "cfg": {
109          "lr": 0.001,
110          "epochs": 12
111        },
112        "mean": 0.7376375496387482
113      },
114      {
115        "cfg": {
116          "lr": 0.003,
117          "epochs": 12
118        },
119        "mean": 0.2556793764233589
120      },
121      {
122        "cfg": {
123          "lr": 0.006,
124          "epochs": 12
125        },
126        "mean": 0.25160863995552063
127      }
128    ]
129  },
130  "mechanism_signature": {
131    "claim": "limiting a valid baseline candidate along the complete residual enforces admissibility",
132    "predicted_invalid_rate_after_limit": 0.0,
133    "observed_invalid_rate_after_limit": 0.019999999552965164,
134    "observed_raw_invalid_rate": 0.1299999998882413,
135    "trained_model_measurements": [
136      {
137        "seed": 0,
138        "invalid_raw": 0.029999999329447746,
139        "invalid_limited": 0.0,
140        "mean_theta": 0.9987504482269287
141      },
142      {
143        "seed": 1,
144        "invalid_raw": 0.009999999776482582,
145        "invalid_limited": 0.0,
146        "mean_theta": 0.9990912079811096
147      },
148      {
149        "seed": 2,
150        "invalid_raw": 0.0,
151        "invalid_limited": 0.0,
152        "mean_theta": 1.0
153      },
154      {
155        "seed": 3,
156        "invalid_raw": 0.0,
157        "invalid_limited": 0.0,
158        "mean_theta": 1.0
159      },
160      {
161        "seed": 4,
162        "invalid_raw": 1.0,
163        "invalid_limited": 0.1599999964237213,
164        "mean_theta": 0.5550016164779663
165      },
166      {
167        "seed": 5,
168        "invalid_raw": 0.0,
169        "invalid_limited": 0.0,
170        "mean_theta": 1.0
171      },
172      {
173        "seed": 6,
174        "invalid_raw": 0.0,
175        "invalid_limited": 0.0,
176        "mean_theta": 1.0
177      },
178      {
179        "seed": 7,
180        "invalid_raw": 0.0,
181        "invalid_limited": 0.0,
182        "mean_theta": 1.0
183      }
184    ],
185    "confirmed": false
186  }
187}