Risk-Calibrated World-Model Gates / results.json
Failed on benchmark
1{
2 "checks": {
3 "max_exact_abs_error": 0.0027159743000001457,
4 "max_probe_abs_error": 8.191216885759106e-05,
5 "all_sizing_rows_meet_delta": true,
6 "all_probe_rows_improve_over_baseline": true
7 },
8 "exact_miss_sweep": [
9 {
10 "r": 0.01,
11 "N": 5,
12 "observed_miss": 0.95172,
13 "predicted_miss": 0.9509900498999999,
14 "abs_error": 0.0007299501000000985
15 },
16 {
17 "r": 0.01,
18 "N": 20,
19 "observed_miss": 0.81884,
20 "predicted_miss": 0.8179069375972308,
21 "abs_error": 0.0009330624027692469
22 },
23 {
24 "r": 0.01,
25 "N": 50,
26 "observed_miss": 0.60504,
27 "predicted_miss": 0.6050060671375364,
28 "abs_error": 3.393286246367033e-05
29 },
30 {
31 "r": 0.03,
32 "N": 5,
33 "observed_miss": 0.86145,
34 "predicted_miss": 0.8587340256999999,
35 "abs_error": 0.0027159743000001457
36 },
37 {
38 "r": 0.03,
39 "N": 20,
40 "observed_miss": 0.54361,
41 "predicted_miss": 0.543794342926747,
42 "abs_error": 0.00018434292674696096
43 },
44 {
45 "r": 0.03,
46 "N": 50,
47 "observed_miss": 0.21829,
48 "predicted_miss": 0.2180653753474073,
49 "abs_error": 0.0002246246525927087
50 },
51 {
52 "r": 0.1,
53 "N": 5,
54 "observed_miss": 0.59122,
55 "predicted_miss": 0.5904900000000001,
56 "abs_error": 0.0007299999999998974
57 },
58 {
59 "r": 0.1,
60 "N": 20,
61 "observed_miss": 0.12256,
62 "predicted_miss": 0.12157665459056935,
63 "abs_error": 0.0009833454094306526
64 },
65 {
66 "r": 0.1,
67 "N": 50,
68 "observed_miss": 0.00551,
69 "predicted_miss": 0.00515377520732012,
70 "abs_error": 0.00035622479267988054
71 },
72 {
73 "r": 0.25,
74 "N": 5,
75 "observed_miss": 0.23822,
76 "predicted_miss": 0.2373046875,
77 "abs_error": 0.0009153124999999873
78 },
79 {
80 "r": 0.25,
81 "N": 20,
82 "observed_miss": 0.00325,
83 "predicted_miss": 0.0031712119389339932,
84 "abs_error": 7.878806106600663e-05
85 },
86 {
87 "r": 0.25,
88 "N": 50,
89 "observed_miss": 0.0,
90 "predicted_miss": 5.663216564269376e-07,
91 "abs_error": 5.663216564269376e-07
92 }
93 ],
94 "required_count_sweep": [
95 {
96 "r": 0.005,
97 "N_required": 598,
98 "exact_miss": 0.04991169123005841,
99 "target_delta": 0.05,
100 "small_r_approx_N": 599.1464547107981,
101 "N_over_approx": 0.998086520079049
102 },
103 {
104 "r": 0.01,
105 "N_required": 299,
106 "exact_miss": 0.04953625663766235,
107 "target_delta": 0.05,
108 "small_r_approx_N": 299.57322735539907,
109 "N_over_approx": 0.998086520079049
110 },
111 {
112 "r": 0.02,
113 "N_required": 149,
114 "exact_miss": 0.04928165433008947,
115 "target_delta": 0.05,
116 "small_r_approx_N": 149.78661367769953,
117 "N_over_approx": 0.9947484380720956
118 },
119 {
120 "r": 0.05,
121 "N_required": 59,
122 "exact_miss": 0.048494525249423104,
123 "target_delta": 0.05,
124 "small_r_approx_N": 59.914645471079815,
125 "N_over_approx": 0.9847341920512356
126 },
127 {
128 "r": 0.1,
129 "N_required": 29,
130 "exact_miss": 0.047101286972462485,
131 "target_delta": 0.05,
132 "small_r_approx_N": 29.957322735539908,
133 "N_over_approx": 0.9680437820164688
134 }
135 ],
136 "matched_budget_probe_sweep": [
137 {
138 "r": 0.005,
139 "probe_rate_q": 0.15,
140 "baseline_miss_observed": 0.77877,
141 "baseline_miss_predicted": 0.7783125570686419,
142 "idea_miss_observed": 0.03343,
143 "idea_miss_predicted": 0.03334808783114241,
144 "detection_gain": -0.74534,
145 "probe_scaling_factor_q_over_r": 30.0
146 },
147 {
148 "r": 0.01,
149 "probe_rate_q": 0.3,
150 "baseline_miss_observed": 0.60664,
151 "baseline_miss_predicted": 0.6050060671375364,
152 "idea_miss_observed": 0.00065,
153 "idea_miss_predicted": 0.0005902236917384061,
154 "detection_gain": -0.6059899999999999,
155 "probe_scaling_factor_q_over_r": 30.0
156 },
157 {
158 "r": 0.02,
159 "probe_rate_q": 0.6,
160 "baseline_miss_observed": 0.36528,
161 "baseline_miss_predicted": 0.36416968008711675,
162 "idea_miss_observed": 0.0,
163 "idea_miss_predicted": 5.997663519304674e-09,
164 "detection_gain": -0.36528000000000005,
165 "probe_scaling_factor_q_over_r": 30.0
166 },
167 {
168 "r": 0.05,
169 "probe_rate_q": 0.6,
170 "baseline_miss_observed": 0.07742,
171 "baseline_miss_predicted": 0.07694497527671315,
172 "idea_miss_observed": 0.0,
173 "idea_miss_predicted": 2.3599781672672784e-09,
174 "detection_gain": -0.07742000000000004,
175 "probe_scaling_factor_q_over_r": 11.999999999999998
176 }
177 ]
178}