Joint Modeling for Stochastic Interventions / custom_bench_results.json
Mechanism confirmed, baseline not beaten
1{
2 "track": {
3 "name": "stochastic_intervention_scm",
4 "domain": "causal-world-model",
5 "description": "Random intervention X causes mediator M and outcome Y; tests joint modeling under intervention shift and mediator selection."
6 },
7 "official_bench_available": false,
8 "infrastructure_note": "Specified /home/maxwelhelp/all/math2nn/bench and README.md were absent; this is the required-contract local fallback, not bench.make_report output.",
9 "math_check": {
10 "selected_m_equals_1": {
11 "sigma1": [
12 1.483637689390105,
13 1.5,
14 2617
15 ],
16 "sigma2": [
17 1.7395092655751987,
18 1.8,
19 1897
20 ]
21 },
22 "shift_observed": true
23 },
24 "budget": {
25 "seeds": [
26 0,
27 1,
28 2,
29 3,
30 4,
31 5,
32 6,
33 7
34 ],
35 "epochs": 90,
36 "batch": 128,
37 "lr_union": [
38 0.003,
39 0.01,
40 0.03
41 ]
42 },
43 "baseline_sweep": {
44 "0.003": 2.854752391576767,
45 "0.01": 2.711322247982025,
46 "0.03": 2.849326878786087
47 },
48 "idea_sweep": {
49 "0.003": 1.5709003955125809,
50 "0.01": 1.6843366771936417,
51 "0.03": 1.821063444018364
52 },
53 "best_baseline_lr": 0.01,
54 "best_idea_lr": 0.003,
55 "baseline_per_seed": [
56 {
57 "seed": 0,
58 "lr": 0.01,
59 "mse": 2.560922861099243,
60 "selected_pred": 1.608640432357788,
61 "selected_obs": 1.8415178060531616,
62 "n_selected": 145
63 },
64 {
65 "seed": 1,
66 "lr": 0.01,
67 "mse": 2.782212495803833,
68 "selected_pred": 1.5625216960906982,
69 "selected_obs": 2.0218238830566406,
70 "n_selected": 117
71 },
72 {
73 "seed": 2,
74 "lr": 0.01,
75 "mse": 2.7840850353240967,
76 "selected_pred": 1.3886590003967285,
77 "selected_obs": 1.9218453168869019,
78 "n_selected": 122
79 },
80 {
81 "seed": 3,
82 "lr": 0.01,
83 "mse": 2.6477458477020264,
84 "selected_pred": 1.7123332023620605,
85 "selected_obs": 1.9120752811431885,
86 "n_selected": 150
87 },
88 {
89 "seed": 4,
90 "lr": 0.01,
91 "mse": 2.5227646827697754,
92 "selected_pred": 1.793519377708435,
93 "selected_obs": 1.784800410270691,
94 "n_selected": 126
95 },
96 {
97 "seed": 5,
98 "lr": 0.01,
99 "mse": 2.7045862674713135,
100 "selected_pred": 1.6540354490280151,
101 "selected_obs": 1.926216721534729,
102 "n_selected": 132
103 },
104 {
105 "seed": 6,
106 "lr": 0.01,
107 "mse": 2.809804677963257,
108 "selected_pred": 1.7043554782867432,
109 "selected_obs": 1.8070753812789917,
110 "n_selected": 138
111 },
112 {
113 "seed": 7,
114 "lr": 0.01,
115 "mse": 2.8784561157226562,
116 "selected_pred": 1.50861656665802,
117 "selected_obs": 1.8454731702804565,
118 "n_selected": 132
119 }
120 ],
121 "idea_per_seed": [
122 {
123 "seed": 0,
124 "lr": 0.003,
125 "mse": 1.385545253753662,
126 "selected_pred": 1.8287450075149536,
127 "selected_obs": 1.8415178060531616,
128 "n_selected": 145
129 },
130 {
131 "seed": 1,
132 "lr": 0.003,
133 "mse": 1.5307773351669312,
134 "selected_pred": 1.9122552871704102,
135 "selected_obs": 2.0218238830566406,
136 "n_selected": 117
137 },
138 {
139 "seed": 2,
140 "lr": 0.003,
141 "mse": 1.6703295707702637,
142 "selected_pred": 1.9163973331451416,
143 "selected_obs": 1.9218453168869019,
144 "n_selected": 122
145 },
146 {
147 "seed": 3,
148 "lr": 0.003,
149 "mse": 1.5728068351745605,
150 "selected_pred": 1.8979436159133911,
151 "selected_obs": 1.9120752811431885,
152 "n_selected": 150
153 },
154 {
155 "seed": 4,
156 "lr": 0.003,
157 "mse": 1.3386306762695312,
158 "selected_pred": 1.7606240510940552,
159 "selected_obs": 1.784800410270691,
160 "n_selected": 126
161 },
162 {
163 "seed": 5,
164 "lr": 0.003,
165 "mse": 1.760671854019165,
166 "selected_pred": 1.8243013620376587,
167 "selected_obs": 1.926216721534729,
168 "n_selected": 132
169 },
170 {
171 "seed": 6,
172 "lr": 0.003,
173 "mse": 1.8169323205947876,
174 "selected_pred": 1.844454288482666,
175 "selected_obs": 1.8070753812789917,
176 "n_selected": 138
177 },
178 {
179 "seed": 7,
180 "lr": 0.003,
181 "mse": 1.4915093183517456,
182 "selected_pred": 1.7713148593902588,
183 "selected_obs": 1.8454731702804565,
184 "n_selected": 132
185 }
186 ],
187 "paired_delta_mean": -1.1404218524694443,
188 "paired_deltas": [
189 -1.175377607345581,
190 -1.2514351606369019,
191 -1.113755464553833,
192 -1.0749390125274658,
193 -1.1841340065002441,
194 -0.9439144134521484,
195 -0.9928723573684692,
196 -1.3869467973709106
197 ],
198 "permutation_p": 0.007782101167315175,
199 "mechanism_signature": {
200 "selected_m": 1.0,
201 "baseline_predicted_mean": 1.616585150361061,
202 "idea_predicted_mean": 1.844504475593567,
203 "observed_mean": 1.882603496313095,
204 "baseline_abs_error": 0.266018345952034,
205 "idea_abs_error": 0.0380990207195282,
206 "confirmed": true
207 },
208 "bench_report": {
209 "custom_track": {
210 "name": "stochastic_intervention_scm",
211 "file": "custom_stochastic_intervention_track.py",
212 "domain": "causal-world-model"
213 },
214 "verdict": "idea better (significant)",
215 "permutation_p": 0.007782101167315175,
216 "paired_delta_mean": -1.1404218524694443
217 },
218 "permutation_p_raw": 0.00390625
219}