Wasserstein-Controlled Gaussian-Mixture Rollouts / bench_report.json
Failed on benchmark
1{
2 "bench_version": 1,
3 "track": "dynamics",
4 "model": "rnn_small",
5 "metric_direction": "lower is better",
6 "n_seeds": 8,
7 "baseline": {
8 "best_cfg": {
9 "lr": 0.01
10 },
11 "sweep": [
12 {
13 "cfg": {
14 "lr": 0.001
15 },
16 "mean": 0.0011778276093536988
17 },
18 {
19 "cfg": {
20 "lr": 0.003
21 },
22 "mean": 0.0007040829586912878
23 },
24 {
25 "cfg": {
26 "lr": 0.01
27 },
28 "mean": 0.00020319201576057822
29 }
30 ],
31 "full": {
32 "mean": 0.00017096688088713563,
33 "std": 0.00010126879946081006,
34 "per_seed": [
35 0.00029771021218039095,
36 0.0003086627402808517,
37 8.670530223753303e-05,
38 0.00011968980834353715,
39 6.000406574457884e-05,
40 0.00017784061492420733,
41 4.760668889502995e-05,
42 0.00026951561449095607
43 ],
44 "n": 8
45 },
46 "idea_union_sweep_note": "baseline evaluated at every intervention learning rate; final baseline is its tuned best config"
47 },
48 "idea": {
49 "mean": 0.0006723387723468477,
50 "std": 0.00030822213357971823,
51 "per_seed": [
52 0.000751153624150902,
53 0.0005644314223900437,
54 0.0010974465403705835,
55 0.0007808454683981836,
56 0.00016198267985600978,
57 0.0005583118181675673,
58 0.0003655186155810952,
59 0.0010990200098603964
60 ],
61 "n": 8
62 },
63 "comparison": {
64 "delta_mean": 0.0005013718914597121,
65 "idea_wins": 0,
66 "n_pairs": 8,
67 "per_seed_diffs": [
68 0.0004534434119705111,
69 0.000255768682109192,
70 0.0010107412381330505,
71 0.0006611556600546464,
72 0.00010197861411143094,
73 0.0003804712032433599,
74 0.00031791192668606527,
75 0.0008295043953694403
76 ],
77 "p_value": 0.0081,
78 "mde": 0.0002573449693961294,
79 "mde_rel_pct": 150.52328735295612,
80 "verdict": "idea worse (significant)",
81 "system_worked": false
82 },
83 "mechanism_signature": {
84 "prediction": "A learned mixture should retain separated predictive modes and improve threshold-probability calibration when the trained task is multimodal.",
85 "idea_sweep": [
86 {
87 "cfg": {
88 "lr": 0.001
89 },
90 "mean": 0.0007984692638274282
91 },
92 {
93 "cfg": {
94 "lr": 0.003
95 },
96 "mean": 0.0057232904800912365
97 },
98 {
99 "cfg": {
100 "lr": 0.01
101 },
102 "mean": 0.012347540003247559
103 }
104 ],
105 "idea_nearby_full": {
106 "0.001": {
107 "mean": 0.0006723387723468477,
108 "std": 0.00030822213357971823,
109 "per_seed": [
110 0.000751153624150902,
111 0.0005644314223900437,
112 0.0010974465403705835,
113 0.0007808454683981836,
114 0.00016198267985600978,
115 0.0005583118181675673,
116 0.0003655186155810952,
117 0.0010990200098603964
118 ],
119 "n": 8
120 },
121 "0.003": {
122 "mean": 0.07285039079579292,
123 "std": 0.15517869917738045,
124 "per_seed": [
125 0.00048457394586876035,
126 0.00356022990308702,
127 0.0017170965438708663,
128 0.0171312615275383,
129 0.003046586411073804,
130 0.07597032189369202,
131 0.4785449206829071,
132 0.002348135458305478
133 ],
134 "n": 8
135 },
136 "0.01": {
137 "mean": 0.07427592801104765,
138 "std": 0.17273816889805907,
139 "per_seed": [
140 0.04037663713097572,
141 0.0033035422675311565,
142 0.0027636890299618244,
143 0.002946291584521532,
144 0.0012332660844549537,
145 0.007603917736560106,
146 0.5301817059516907,
147 0.005798374302685261
148 ],
149 "n": 8
150 }
151 },
152 "trained_model_signature": {
153 "n": 300,
154 "test_mse": 0.000751153624150902,
155 "predicted_mean_mode_separation": 0.5563346147537231,
156 "predicted_mean_component_sd": 0.01935468427836895,
157 "predicted_bimodal_fraction": 0.9566666483879089,
158 "mixture_chance_abs_error": 0.015057117938995335,
159 "moment_gaussian_chance_abs_error": 0.014270426034927342,
160 "observed_event_rate": 0.47,
161 "confirmed": false
162 }
163 },
164 "selection": {
165 "idea_best_cfg": {
166 "lr": 0.001
167 },
168 "epochs": 15,
169 "n_train": 800,
170 "n_test": 300,
171 "structural_match": "dynamics: controlled pendulum multi-step target"
172 }
173}