Wasserstein-Controlled Gaussian-Mixture Rollouts / bench_report.json

Failed on benchmark

Raw ⬇ ZIP
  1{
  2  "bench_version": 1,
  3  "track": "dynamics",
  4  "model": "rnn_small",
  5  "metric_direction": "lower is better",
  6  "n_seeds": 8,
  7  "baseline": {
  8    "best_cfg": {
  9      "lr": 0.01
 10    },
 11    "sweep": [
 12      {
 13        "cfg": {
 14          "lr": 0.001
 15        },
 16        "mean": 0.0011778276093536988
 17      },
 18      {
 19        "cfg": {
 20          "lr": 0.003
 21        },
 22        "mean": 0.0007040829586912878
 23      },
 24      {
 25        "cfg": {
 26          "lr": 0.01
 27        },
 28        "mean": 0.00020319201576057822
 29      }
 30    ],
 31    "full": {
 32      "mean": 0.00017096688088713563,
 33      "std": 0.00010126879946081006,
 34      "per_seed": [
 35        0.00029771021218039095,
 36        0.0003086627402808517,
 37        8.670530223753303e-05,
 38        0.00011968980834353715,
 39        6.000406574457884e-05,
 40        0.00017784061492420733,
 41        4.760668889502995e-05,
 42        0.00026951561449095607
 43      ],
 44      "n": 8
 45    },
 46    "idea_union_sweep_note": "baseline evaluated at every intervention learning rate; final baseline is its tuned best config"
 47  },
 48  "idea": {
 49    "mean": 0.0006723387723468477,
 50    "std": 0.00030822213357971823,
 51    "per_seed": [
 52      0.000751153624150902,
 53      0.0005644314223900437,
 54      0.0010974465403705835,
 55      0.0007808454683981836,
 56      0.00016198267985600978,
 57      0.0005583118181675673,
 58      0.0003655186155810952,
 59      0.0010990200098603964
 60    ],
 61    "n": 8
 62  },
 63  "comparison": {
 64    "delta_mean": 0.0005013718914597121,
 65    "idea_wins": 0,
 66    "n_pairs": 8,
 67    "per_seed_diffs": [
 68      0.0004534434119705111,
 69      0.000255768682109192,
 70      0.0010107412381330505,
 71      0.0006611556600546464,
 72      0.00010197861411143094,
 73      0.0003804712032433599,
 74      0.00031791192668606527,
 75      0.0008295043953694403
 76    ],
 77    "p_value": 0.0081,
 78    "mde": 0.0002573449693961294,
 79    "mde_rel_pct": 150.52328735295612,
 80    "verdict": "idea worse (significant)",
 81    "system_worked": false
 82  },
 83  "mechanism_signature": {
 84    "prediction": "A learned mixture should retain separated predictive modes and improve threshold-probability calibration when the trained task is multimodal.",
 85    "idea_sweep": [
 86      {
 87        "cfg": {
 88          "lr": 0.001
 89        },
 90        "mean": 0.0007984692638274282
 91      },
 92      {
 93        "cfg": {
 94          "lr": 0.003
 95        },
 96        "mean": 0.0057232904800912365
 97      },
 98      {
 99        "cfg": {
100          "lr": 0.01
101        },
102        "mean": 0.012347540003247559
103      }
104    ],
105    "idea_nearby_full": {
106      "0.001": {
107        "mean": 0.0006723387723468477,
108        "std": 0.00030822213357971823,
109        "per_seed": [
110          0.000751153624150902,
111          0.0005644314223900437,
112          0.0010974465403705835,
113          0.0007808454683981836,
114          0.00016198267985600978,
115          0.0005583118181675673,
116          0.0003655186155810952,
117          0.0010990200098603964
118        ],
119        "n": 8
120      },
121      "0.003": {
122        "mean": 0.07285039079579292,
123        "std": 0.15517869917738045,
124        "per_seed": [
125          0.00048457394586876035,
126          0.00356022990308702,
127          0.0017170965438708663,
128          0.0171312615275383,
129          0.003046586411073804,
130          0.07597032189369202,
131          0.4785449206829071,
132          0.002348135458305478
133        ],
134        "n": 8
135      },
136      "0.01": {
137        "mean": 0.07427592801104765,
138        "std": 0.17273816889805907,
139        "per_seed": [
140          0.04037663713097572,
141          0.0033035422675311565,
142          0.0027636890299618244,
143          0.002946291584521532,
144          0.0012332660844549537,
145          0.007603917736560106,
146          0.5301817059516907,
147          0.005798374302685261
148        ],
149        "n": 8
150      }
151    },
152    "trained_model_signature": {
153      "n": 300,
154      "test_mse": 0.000751153624150902,
155      "predicted_mean_mode_separation": 0.5563346147537231,
156      "predicted_mean_component_sd": 0.01935468427836895,
157      "predicted_bimodal_fraction": 0.9566666483879089,
158      "mixture_chance_abs_error": 0.015057117938995335,
159      "moment_gaussian_chance_abs_error": 0.014270426034927342,
160      "observed_event_rate": 0.47,
161      "confirmed": false
162    }
163  },
164  "selection": {
165    "idea_best_cfg": {
166      "lr": 0.001
167    },
168    "epochs": 15,
169    "n_train": 800,
170    "n_test": 300,
171    "structural_match": "dynamics: controlled pendulum multi-step target"
172  }
173}