Conditional-copula probabilistic head / bench_report.json
Mechanism confirmed, baseline not beaten
1{
2 "bench_version": 1,
3 "track": "correlated_multitask_regression",
4 "model": "mlp_tiny",
5 "metric_direction": "lower is better",
6 "n_seeds": 8,
7 "baseline": {
8 "best_cfg": {
9 "lr": 0.006,
10 "epochs": 18
11 },
12 "sweep": [
13 {
14 "cfg": {
15 "lr": 0.001,
16 "epochs": 18
17 },
18 "mean": 0.33924729377031326
19 },
20 {
21 "cfg": {
22 "lr": 0.003,
23 "epochs": 18
24 },
25 "mean": 0.2891158163547516
26 },
27 {
28 "cfg": {
29 "lr": 0.006,
30 "epochs": 18
31 },
32 "mean": 0.2687482498586178
33 }
34 ],
35 "full": {
36 "mean": 0.26368178986012936,
37 "std": 0.012707367791430902,
38 "per_seed": [
39 0.28817808628082275,
40 0.2641679346561432,
41 0.27657756209373474,
42 0.24606941640377045,
43 0.26166772842407227,
44 0.26569777727127075,
45 0.2544151544570923,
46 0.2526806592941284
47 ],
48 "n": 8
49 }
50 },
51 "idea": {
52 "mean": 0.2741883806884289,
53 "std": 0.00900021034383701,
54 "per_seed": [
55 0.28664544224739075,
56 0.2656421661376953,
57 0.2874869704246521,
58 0.2784552276134491,
59 0.273226797580719,
60 0.2612801492214203,
61 0.2741454243659973,
62 0.2666248679161072
63 ],
64 "n": 8
65 },
66 "comparison": {
67 "delta_mean": 0.010506590828299522,
68 "idea_wins": 2,
69 "n_pairs": 8,
70 "per_seed_diffs": [
71 -0.0015326440334320068,
72 0.001474231481552124,
73 0.010909408330917358,
74 0.03238581120967865,
75 0.011559069156646729,
76 -0.004417628049850464,
77 0.01973026990890503,
78 0.01394420862197876
79 ],
80 "p_value": 0.0552,
81 "mde": 0.010123642152049727,
82 "mde_rel_pct": 3.839340652769324,
83 "verdict": "no significant win",
84 "system_worked": false
85 },
86 "mechanism_signature": {
87 "signature": {
88 "prediction": "copula dependence on uniform/standardized scale captures positive cross-output residual dependence",
89 "predicted_mean_offdiag_corr": 0.11426236107945442,
90 "observed_mean_offdiag_residual_corr": 0.17040012543923766,
91 "abs_error": 0.05613776435978324,
92 "confirmed": true,
93 "per_seed": [
94 {
95 "seed": 0,
96 "observed_residual_corr_mean": 0.17705640620883495,
97 "predicted_copula_corr_mean": 0.11108794808387756,
98 "baseline_mse": 0.28817808628082275,
99 "idea_mse": 0.28664544224739075
100 },
101 {
102 "seed": 1,
103 "observed_residual_corr_mean": 0.15009457541756535,
104 "predicted_copula_corr_mean": 0.13055425882339478,
105 "baseline_mse": 0.2641679346561432,
106 "idea_mse": 0.2656421661376953
107 },
108 {
109 "seed": 2,
110 "observed_residual_corr_mean": 0.17330186510250142,
111 "predicted_copula_corr_mean": 0.10499031096696854,
112 "baseline_mse": 0.27657756209373474,
113 "idea_mse": 0.2874869704246521
114 },
115 {
116 "seed": 3,
117 "observed_residual_corr_mean": 0.14522062344436665,
118 "predicted_copula_corr_mean": 0.09687795490026474,
119 "baseline_mse": 0.24606941640377045,
120 "idea_mse": 0.2784552276134491
121 },
122 {
123 "seed": 4,
124 "observed_residual_corr_mean": 0.15387426022763864,
125 "predicted_copula_corr_mean": 0.1175244003534317,
126 "baseline_mse": 0.26166772842407227,
127 "idea_mse": 0.273226797580719
128 },
129 {
130 "seed": 5,
131 "observed_residual_corr_mean": 0.1745235061227068,
132 "predicted_copula_corr_mean": 0.11502358317375183,
133 "baseline_mse": 0.26569777727127075,
134 "idea_mse": 0.2612801492214203
135 },
136 {
137 "seed": 6,
138 "observed_residual_corr_mean": 0.19859785188941909,
139 "predicted_copula_corr_mean": 0.12316668778657913,
140 "baseline_mse": 0.2544151544570923,
141 "idea_mse": 0.2741454243659973
142 },
143 {
144 "seed": 7,
145 "observed_residual_corr_mean": 0.19053191510086853,
146 "predicted_copula_corr_mean": 0.1148737445473671,
147 "baseline_mse": 0.2526806592941284,
148 "idea_mse": 0.2666248679161072
149 }
150 ]
151 },
152 "idea_sweep": [
153 {
154 "lr": 0.001,
155 "result": {
156 "mean": 0.35608335956931114,
157 "std": 0.01715514284052541,
158 "per_seed": [
159 0.34133413434028625,
160 0.32555291056632996,
161 0.3722515404224396,
162 0.3699086010456085,
163 0.3756076693534851,
164 0.3562084138393402,
165 0.3673454523086548,
166 0.3404581546783447
167 ],
168 "n": 8
169 }
170 },
171 {
172 "lr": 0.003,
173 "result": {
174 "mean": 0.31745627894997597,
175 "std": 0.012492207053464112,
176 "per_seed": [
177 0.30626440048217773,
178 0.2969795763492584,
179 0.3294920027256012,
180 0.3298030495643616,
181 0.3205186724662781,
182 0.31924760341644287,
183 0.3326553404331207,
184 0.30468958616256714
185 ],
186 "n": 8
187 }
188 },
189 {
190 "lr": 0.006,
191 "result": {
192 "mean": 0.2741883806884289,
193 "std": 0.00900021034383701,
194 "per_seed": [
195 0.28664544224739075,
196 0.2656421661376953,
197 0.2874869704246521,
198 0.2784552276134491,
199 0.273226797580719,
200 0.2612801492214203,
201 0.2741454243659973,
202 0.2666248679161072
203 ],
204 "n": 8
205 }
206 }
207 ],
208 "custom_track": {
209 "name": "correlated_multitask_regression",
210 "file": "/home/maxwelhelp/all/math2nn/bench/custom_tracks/correlated_multitask_regression.py",
211 "domain": "multi_task_learning"
212 }
213 }
214}