Uncertainty-guided family sampling / bench_report.json
Mechanism confirmed, baseline not beaten
1{
2 "bench_version": 1,
3 "track": "tabular",
4 "model": "mlp_tiny",
5 "metric_direction": "lower is better",
6 "n_seeds": 8,
7 "baseline": {
8 "best_cfg": {
9 "lr": 0.006
10 },
11 "sweep": [
12 {
13 "cfg": {
14 "lr": 0.001
15 },
16 "mean": 17.482568740844727
17 },
18 {
19 "cfg": {
20 "lr": 0.003
21 },
22 "mean": 12.535736083984375
23 },
24 {
25 "cfg": {
26 "lr": 0.006
27 },
28 "mean": 9.091599702835083
29 }
30 ],
31 "full": {
32 "mean": 9.481420636177063,
33 "std": 0.9072998646400672,
34 "per_seed": [
35 8.627572059631348,
36 8.736048698425293,
37 8.82056999206543,
38 10.182208061218262,
39 8.84079647064209,
40 9.23827075958252,
41 11.380922317504883,
42 10.02497673034668
43 ],
44 "n": 8
45 }
46 },
47 "idea": {
48 "mean": 9.610056400299072,
49 "std": 1.0356528912793441,
50 "per_seed": [
51 9.995634078979492,
52 8.813212394714355,
53 8.717215538024902,
54 9.493178367614746,
55 8.498827934265137,
56 9.12738037109375,
57 11.815202713012695,
58 10.4197998046875
59 ],
60 "n": 8
61 },
62 "comparison": {
63 "delta_mean": 0.12863576412200928,
64 "idea_wins": 4,
65 "n_pairs": 8,
66 "per_seed_diffs": [
67 1.3680620193481445,
68 0.0771636962890625,
69 -0.10335445404052734,
70 -0.6890296936035156,
71 -0.3419685363769531,
72 -0.11089038848876953,
73 0.4342803955078125,
74 0.3948230743408203
75 ],
76 "p_value": 0.61945,
77 "mde": 0.5197178870759055,
78 "mde_rel_pct": 5.481434766145522,
79 "verdict": "no significant win",
80 "system_worked": false
81 },
82 "mechanism_signature": {
83 "signature": {
84 "quantity": "family allocation variance proxy sum(u_c^2/n_c)",
85 "predicted_mean": 0.0982159124687314,
86 "observed_mean": 0.09136932715773582,
87 "relative_error": 0.06970953218171544,
88 "confirmed": true,
89 "note": "u and n are computed from trained model residuals; observed proxy uses held-out family residual variances."
90 },
91 "idea_sweep": [
92 {
93 "cfg": {
94 "lr": 0.001,
95 "epsilon": 0.05
96 },
97 "result": {
98 "mean": 18.78651201725006,
99 "std": 2.1210090381527644,
100 "per_seed": [
101 17.013912200927734,
102 15.361128807067871,
103 21.161161422729492,
104 16.918540954589844,
105 19.89978790283203,
106 17.97165870666504,
107 20.517269134521484,
108 21.448637008666992
109 ],
110 "n": 8
111 }
112 },
113 {
114 "cfg": {
115 "lr": 0.003,
116 "epsilon": 0.15
117 },
118 "result": {
119 "mean": 13.162447214126587,
120 "std": 1.3889931613668718,
121 "per_seed": [
122 13.541401863098145,
123 11.67493724822998,
124 12.949481964111328,
125 12.458735466003418,
126 11.737956047058105,
127 12.227039337158203,
128 15.25829792022705,
129 15.451727867126465
130 ],
131 "n": 8
132 }
133 },
134 {
135 "cfg": {
136 "lr": 0.006,
137 "epsilon": 0.3
138 },
139 "result": {
140 "mean": 9.610056400299072,
141 "std": 1.0356528912793441,
142 "per_seed": [
143 9.995634078979492,
144 8.813212394714355,
145 8.717215538024902,
146 9.493178367614746,
147 8.498827934265137,
148 9.12738037109375,
149 11.815202713012695,
150 10.4197998046875
151 ],
152 "n": 8
153 }
154 }
155 ],
156 "track_rationale": "Family-conditioned minibatch selection is an optimizer/training-data mechanism; tabular regression is the mandated structural track for optimizer/data mechanics."
157 },
158 "stage2_protocol": {
159 "paired_seeds": [
160 0,
161 1,
162 2,
163 3,
164 4,
165 5,
166 6,
167 7
168 ],
169 "epochs": 12,
170 "batch": 64,
171 "baseline_grid": [
172 {
173 "lr": 0.001
174 },
175 {
176 "lr": 0.003
177 },
178 {
179 "lr": 0.006
180 }
181 ],
182 "idea_grid": [
183 {
184 "lr": 0.001,
185 "epsilon": 0.05
186 },
187 {
188 "lr": 0.003,
189 "epsilon": 0.15
190 },
191 {
192 "lr": 0.006,
193 "epsilon": 0.3
194 }
195 ]
196 }
197}