Covariance-Conditioned Neural Rollouts / bench_report.json

Mechanism confirmed, baseline not beaten

Raw ⬇ ZIP
  1{
  2  "bench_version": 1,
  3  "track": "dynamics",
  4  "model": "rnn_small",
  5  "metric_direction": "lower is better",
  6  "n_seeds": 8,
  7  "baseline": {
  8    "best_cfg": {
  9      "lr": 0.006
 10    },
 11    "sweep": [
 12      {
 13        "cfg": {
 14          "lr": 0.001
 15        },
 16        "mean": 0.0007079141651047394
 17      },
 18      {
 19        "cfg": {
 20          "lr": 0.003
 21        },
 22        "mean": 0.00019564990725484677
 23      },
 24      {
 25        "cfg": {
 26          "lr": 0.006
 27        },
 28        "mean": 4.179111101620947e-05
 29      }
 30    ],
 31    "full": {
 32      "mean": 3.971884348175081e-05,
 33      "std": 7.221693826148878e-06,
 34      "per_seed": [
 35        4.624741632142104e-05,
 36        5.4139207350090146e-05,
 37        2.856133687600959e-05,
 38        3.82164835173171e-05,
 39        4.160348544246517e-05,
 40        3.6566088965628296e-05,
 41        3.5268141800770536e-05,
 42        3.714858758030459e-05
 43      ],
 44      "n": 8
 45    }
 46  },
 47  "idea": {
 48    "mean": 8.592086487624329e-05,
 49    "std": 7.508073923840228e-05,
 50    "per_seed": [
 51      0.00011502060806378722,
 52      6.843992014182732e-05,
 53      0.00027265894459560513,
 54      4.1655894165160134e-05,
 55      7.501575601054356e-05,
 56      4.787765283253975e-05,
 57      3.653249950730242e-05,
 58      3.0165643693180755e-05
 59    ],
 60    "n": 8
 61  },
 62  "comparison": {
 63    "delta_mean": 4.6202021394492476e-05,
 64    "idea_wins": 1,
 65    "n_pairs": 8,
 66    "per_seed_diffs": [
 67      6.877319174236618e-05,
 68      1.4300712791737169e-05,
 69      0.00024409760771959554,
 70      3.439410647843033e-06,
 71      3.3412270568078384e-05,
 72      1.1311563866911456e-05,
 73      1.2643577065318823e-06,
 74      -6.982943887123838e-06
 75    ],
 76    "p_value": 0.03865,
 77    "mde": 6.977709898395673e-05,
 78    "mde_rel_pct": 175.67756980642312,
 79    "verdict": "idea worse (significant)",
 80    "system_worked": false
 81  },
 82  "math_check": {
 83    "joint_min_eig": 0.542706194000172,
 84    "schur_min_eig": 0.6700584265307041,
 85    "psd": true
 86  },
 87  "idea_sweep": [
 88    {
 89      "cfg": {
 90        "lr": 0.001
 91      },
 92      "result": {
 93        "mean": 8.592086487624329e-05,
 94        "std": 7.508073923840228e-05,
 95        "per_seed": [
 96          0.00011502060806378722,
 97          6.843992014182732e-05,
 98          0.00027265894459560513,
 99          4.1655894165160134e-05,
100          7.501575601054356e-05,
101          4.787765283253975e-05,
102          3.653249950730242e-05,
103          3.0165643693180755e-05
104        ],
105        "n": 8
106      }
107    },
108    {
109      "cfg": {
110        "lr": 0.003
111      },
112      "result": {
113        "mean": 0.00017516915022497415,
114        "std": 0.00014182129868597662,
115        "per_seed": [
116          0.00031262406264431775,
117          4.148928201175295e-05,
118          0.0004854888829868287,
119          8.179861470125616e-05,
120          0.00012095236161258072,
121          5.18705346621573e-05,
122          0.00014855564222671092,
123          0.0001585738209541887
124        ],
125        "n": 8
126      }
127    },
128    {
129      "cfg": {
130        "lr": 0.006
131      },
132      "result": {
133        "mean": 0.0001611893669632991,
134        "std": 0.00019513377033064536,
135        "per_seed": [
136          1.1867330613313243e-05,
137          0.000506327603943646,
138          1.7718439266900532e-05,
139          0.00010111019219039008,
140          0.0004840953042730689,
141          2.954796582343988e-05,
142          8.626402268419042e-05,
143          5.2584076911443844e-05
144        ],
145        "n": 8
146      }
147    }
148  ],
149  "budget": {
150    "epochs": 18,
151    "batch": 128,
152    "n_train": 1600,
153    "n_test": 500
154  },
155  "mechanism_signature": {
156    "prediction": "joint Gaussian head yields calibrated predictive variance; 95% interval coverage near nominal 0.95",
157    "observed_nll": -2.5754659175872803,
158    "observed_coverage95": 1.0,
159    "observed_mean_variance": 0.0008512148051522672,
160    "confirmed": true
161  }
162}