Conditional-copula probabilistic head / bench_report.json

Mechanism confirmed, baseline not beaten

Raw ⬇ ZIP
  1{
  2  "bench_version": 1,
  3  "track": "correlated_multitask_regression",
  4  "model": "mlp_tiny",
  5  "metric_direction": "lower is better",
  6  "n_seeds": 8,
  7  "baseline": {
  8    "best_cfg": {
  9      "lr": 0.006,
 10      "epochs": 18
 11    },
 12    "sweep": [
 13      {
 14        "cfg": {
 15          "lr": 0.001,
 16          "epochs": 18
 17        },
 18        "mean": 0.33924729377031326
 19      },
 20      {
 21        "cfg": {
 22          "lr": 0.003,
 23          "epochs": 18
 24        },
 25        "mean": 0.2891158163547516
 26      },
 27      {
 28        "cfg": {
 29          "lr": 0.006,
 30          "epochs": 18
 31        },
 32        "mean": 0.2687482498586178
 33      }
 34    ],
 35    "full": {
 36      "mean": 0.26368178986012936,
 37      "std": 0.012707367791430902,
 38      "per_seed": [
 39        0.28817808628082275,
 40        0.2641679346561432,
 41        0.27657756209373474,
 42        0.24606941640377045,
 43        0.26166772842407227,
 44        0.26569777727127075,
 45        0.2544151544570923,
 46        0.2526806592941284
 47      ],
 48      "n": 8
 49    }
 50  },
 51  "idea": {
 52    "mean": 0.2741883806884289,
 53    "std": 0.00900021034383701,
 54    "per_seed": [
 55      0.28664544224739075,
 56      0.2656421661376953,
 57      0.2874869704246521,
 58      0.2784552276134491,
 59      0.273226797580719,
 60      0.2612801492214203,
 61      0.2741454243659973,
 62      0.2666248679161072
 63    ],
 64    "n": 8
 65  },
 66  "comparison": {
 67    "delta_mean": 0.010506590828299522,
 68    "idea_wins": 2,
 69    "n_pairs": 8,
 70    "per_seed_diffs": [
 71      -0.0015326440334320068,
 72      0.001474231481552124,
 73      0.010909408330917358,
 74      0.03238581120967865,
 75      0.011559069156646729,
 76      -0.004417628049850464,
 77      0.01973026990890503,
 78      0.01394420862197876
 79    ],
 80    "p_value": 0.0552,
 81    "mde": 0.010123642152049727,
 82    "mde_rel_pct": 3.839340652769324,
 83    "verdict": "no significant win",
 84    "system_worked": false
 85  },
 86  "mechanism_signature": {
 87    "signature": {
 88      "prediction": "copula dependence on uniform/standardized scale captures positive cross-output residual dependence",
 89      "predicted_mean_offdiag_corr": 0.11426236107945442,
 90      "observed_mean_offdiag_residual_corr": 0.17040012543923766,
 91      "abs_error": 0.05613776435978324,
 92      "confirmed": true,
 93      "per_seed": [
 94        {
 95          "seed": 0,
 96          "observed_residual_corr_mean": 0.17705640620883495,
 97          "predicted_copula_corr_mean": 0.11108794808387756,
 98          "baseline_mse": 0.28817808628082275,
 99          "idea_mse": 0.28664544224739075
100        },
101        {
102          "seed": 1,
103          "observed_residual_corr_mean": 0.15009457541756535,
104          "predicted_copula_corr_mean": 0.13055425882339478,
105          "baseline_mse": 0.2641679346561432,
106          "idea_mse": 0.2656421661376953
107        },
108        {
109          "seed": 2,
110          "observed_residual_corr_mean": 0.17330186510250142,
111          "predicted_copula_corr_mean": 0.10499031096696854,
112          "baseline_mse": 0.27657756209373474,
113          "idea_mse": 0.2874869704246521
114        },
115        {
116          "seed": 3,
117          "observed_residual_corr_mean": 0.14522062344436665,
118          "predicted_copula_corr_mean": 0.09687795490026474,
119          "baseline_mse": 0.24606941640377045,
120          "idea_mse": 0.2784552276134491
121        },
122        {
123          "seed": 4,
124          "observed_residual_corr_mean": 0.15387426022763864,
125          "predicted_copula_corr_mean": 0.1175244003534317,
126          "baseline_mse": 0.26166772842407227,
127          "idea_mse": 0.273226797580719
128        },
129        {
130          "seed": 5,
131          "observed_residual_corr_mean": 0.1745235061227068,
132          "predicted_copula_corr_mean": 0.11502358317375183,
133          "baseline_mse": 0.26569777727127075,
134          "idea_mse": 0.2612801492214203
135        },
136        {
137          "seed": 6,
138          "observed_residual_corr_mean": 0.19859785188941909,
139          "predicted_copula_corr_mean": 0.12316668778657913,
140          "baseline_mse": 0.2544151544570923,
141          "idea_mse": 0.2741454243659973
142        },
143        {
144          "seed": 7,
145          "observed_residual_corr_mean": 0.19053191510086853,
146          "predicted_copula_corr_mean": 0.1148737445473671,
147          "baseline_mse": 0.2526806592941284,
148          "idea_mse": 0.2666248679161072
149        }
150      ]
151    },
152    "idea_sweep": [
153      {
154        "lr": 0.001,
155        "result": {
156          "mean": 0.35608335956931114,
157          "std": 0.01715514284052541,
158          "per_seed": [
159            0.34133413434028625,
160            0.32555291056632996,
161            0.3722515404224396,
162            0.3699086010456085,
163            0.3756076693534851,
164            0.3562084138393402,
165            0.3673454523086548,
166            0.3404581546783447
167          ],
168          "n": 8
169        }
170      },
171      {
172        "lr": 0.003,
173        "result": {
174          "mean": 0.31745627894997597,
175          "std": 0.012492207053464112,
176          "per_seed": [
177            0.30626440048217773,
178            0.2969795763492584,
179            0.3294920027256012,
180            0.3298030495643616,
181            0.3205186724662781,
182            0.31924760341644287,
183            0.3326553404331207,
184            0.30468958616256714
185          ],
186          "n": 8
187        }
188      },
189      {
190        "lr": 0.006,
191        "result": {
192          "mean": 0.2741883806884289,
193          "std": 0.00900021034383701,
194          "per_seed": [
195            0.28664544224739075,
196            0.2656421661376953,
197            0.2874869704246521,
198            0.2784552276134491,
199            0.273226797580719,
200            0.2612801492214203,
201            0.2741454243659973,
202            0.2666248679161072
203          ],
204          "n": 8
205        }
206      }
207    ],
208    "custom_track": {
209      "name": "correlated_multitask_regression",
210      "file": "/home/maxwelhelp/all/math2nn/bench/custom_tracks/correlated_multitask_regression.py",
211      "domain": "multi_task_learning"
212    }
213  }
214}