Resolution-Gated Dual Masking / bench_report.json
Mechanism confirmed, baseline not beaten
1{
2 "bench_version": 1,
3 "track": "tabular",
4 "model": "mlp_tiny",
5 "metric_direction": "lower is better",
6 "n_seeds": 8,
7 "baseline": {
8 "best_cfg": {
9 "lr": 0.006,
10 "weight_decay": 0.0001,
11 "epochs": 12
12 },
13 "sweep": [
14 {
15 "cfg": {
16 "lr": 0.0015,
17 "weight_decay": 0.0,
18 "epochs": 12
19 },
20 "mean": 13.675705671310425
21 },
22 {
23 "cfg": {
24 "lr": 0.003,
25 "weight_decay": 0.0,
26 "epochs": 12
27 },
28 "mean": 9.352656126022339
29 },
30 {
31 "cfg": {
32 "lr": 0.006,
33 "weight_decay": 0.0,
34 "epochs": 12
35 },
36 "mean": 7.226524114608765
37 },
38 {
39 "cfg": {
40 "lr": 0.0015,
41 "weight_decay": 0.0001,
42 "epochs": 12
43 },
44 "mean": 13.609990000724792
45 },
46 {
47 "cfg": {
48 "lr": 0.003,
49 "weight_decay": 0.0001,
50 "epochs": 12
51 },
52 "mean": 9.076743841171265
53 },
54 {
55 "cfg": {
56 "lr": 0.006,
57 "weight_decay": 0.0001,
58 "epochs": 12
59 },
60 "mean": 7.0532397627830505
61 }
62 ],
63 "full": {
64 "mean": 7.0532397627830505,
65 "std": 0.2264412705403704,
66 "per_seed": [
67 6.572167873382568,
68 7.1756792068481445,
69 7.042057037353516,
70 7.032951831817627,
71 7.018033504486084,
72 7.022153854370117,
73 7.112776756286621,
74 7.450098037719727
75 ],
76 "n": 8
77 }
78 },
79 "idea": {
80 "mean": 7.014131605625153,
81 "std": 0.24308566746895208,
82 "per_seed": [
83 6.6641693115234375,
84 7.260889053344727,
85 6.737545013427734,
86 6.856451034545898,
87 6.927297592163086,
88 7.039077281951904,
89 7.303320407867432,
90 7.324303150177002
91 ],
92 "n": 8
93 },
94 "comparison": {
95 "delta_mean": -0.03910815715789795,
96 "idea_wins": 4,
97 "n_pairs": 8,
98 "per_seed_diffs": [
99 0.09200143814086914,
100 0.08520984649658203,
101 -0.30451202392578125,
102 -0.17650079727172852,
103 -0.09073591232299805,
104 0.01692342758178711,
105 0.19054365158081055,
106 -0.1257948875427246
107 ],
108 "p_value": 0.50145,
109 "mde": 0.13703746835599878,
110 "mde_rel_pct": 1.9429010350546605,
111 "verdict": "no measurable effect",
112 "system_worked": false
113 },
114 "selection_details": "Entropy and validation-risk masks selected from train split; final systems use identical mlp_tiny/training.",
115 "mechanism_signature": {
116 "prediction": "kappa>=0.90 routes away from entropy mask and avoids materially worse trained-model MSE",
117 "observed": [
118 {
119 "seed": 0,
120 "kappa": 1.0,
121 "gamma": 13.140283130679085,
122 "used_entropy": false,
123 "predicted_fallback": true,
124 "observed_subset_minus_full_mse": 0.09200143814086914
125 },
126 {
127 "seed": 1,
128 "kappa": 1.0,
129 "gamma": 16.30871552694337,
130 "used_entropy": false,
131 "predicted_fallback": true,
132 "observed_subset_minus_full_mse": 0.08520984649658203
133 },
134 {
135 "seed": 2,
136 "kappa": 1.0,
137 "gamma": 12.264759413539208,
138 "used_entropy": false,
139 "predicted_fallback": true,
140 "observed_subset_minus_full_mse": -0.30451202392578125
141 },
142 {
143 "seed": 3,
144 "kappa": 1.0,
145 "gamma": 13.648493168331017,
146 "used_entropy": false,
147 "predicted_fallback": true,
148 "observed_subset_minus_full_mse": -0.17650079727172852
149 },
150 {
151 "seed": 4,
152 "kappa": 1.0,
153 "gamma": 15.0961523290884,
154 "used_entropy": false,
155 "predicted_fallback": true,
156 "observed_subset_minus_full_mse": -0.09073591232299805
157 },
158 {
159 "seed": 5,
160 "kappa": 1.0,
161 "gamma": 11.799654276914342,
162 "used_entropy": false,
163 "predicted_fallback": true,
164 "observed_subset_minus_full_mse": 0.01692342758178711
165 },
166 {
167 "seed": 6,
168 "kappa": 1.0,
169 "gamma": 15.35830490498792,
170 "used_entropy": false,
171 "predicted_fallback": true,
172 "observed_subset_minus_full_mse": 0.19054365158081055
173 },
174 {
175 "seed": 7,
176 "kappa": 1.0,
177 "gamma": 13.753987138531764,
178 "used_entropy": false,
179 "predicted_fallback": true,
180 "observed_subset_minus_full_mse": -0.1257948875427246
181 }
182 ],
183 "high_kappa_n": 8,
184 "high_kappa_observed_mean_delta": -0.03910815715789795,
185 "confirmed": true
186 }
187}