Residual-screened Koopman latent bottleneck / bench_report.json

Mechanism confirmed, baseline not beaten

Raw ⬇ ZIP
  1{
  2  "bench_version": 1,
  3  "track": "dynamics",
  4  "model": "rnn_small",
  5  "metric_direction": "lower is better",
  6  "n_seeds": 8,
  7  "baseline": {
  8    "best_cfg": {
  9      "lr": 0.006
 10    },
 11    "sweep": [
 12      {
 13        "cfg": {
 14          "lr": 0.001
 15        },
 16        "mean": 0.006104337517172098
 17      },
 18      {
 19        "cfg": {
 20          "lr": 0.003
 21        },
 22        "mean": 0.0017399389762431383
 23      },
 24      {
 25        "cfg": {
 26          "lr": 0.006
 27        },
 28        "mean": 0.0012507251958595589
 29      }
 30    ],
 31    "full": {
 32      "mean": 0.001170862014987506,
 33      "std": 0.0004510333101838233,
 34      "per_seed": [
 35        0.000902677362319082,
 36        0.0019194456981495023,
 37        0.0005950153572484851,
 38        0.0015857623657211661,
 39        0.0008504731813445687,
 40        0.000836688035633415,
 41        0.0016707839677110314,
 42        0.001006050151772797
 43      ],
 44      "n": 8
 45    }
 46  },
 47  "idea": {
 48    "mean": 0.0011421147792134434,
 49    "std": 0.00044998942636985775,
 50    "per_seed": [
 51      0.0008761535282246768,
 52      0.0019359904108569026,
 53      0.0006074620177969337,
 54      0.0015396701637655497,
 55      0.0007932198350317776,
 56      0.0007940693758428097,
 57      0.0015995833091437817,
 58      0.0009907695930451155
 59    ],
 60    "n": 8
 61  },
 62  "comparison": {
 63    "delta_mean": -2.8747235774062574e-05,
 64    "idea_wins": 6,
 65    "n_pairs": 8,
 66    "per_seed_diffs": [
 67      -2.6523834094405174e-05,
 68      1.6544712707400322e-05,
 69      1.2446660548448563e-05,
 70      -4.6092201955616474e-05,
 71      -5.725334631279111e-05,
 72      -4.261865979060531e-05,
 73      -7.120065856724977e-05,
 74      -1.5280558727681637e-05
 75    ],
 76    "p_value": 0.05535,
 77    "mde": 2.6522118750884212e-05,
 78    "mde_rel_pct": 2.265178852109847,
 79    "verdict": "no significant win",
 80    "system_worked": false
 81  },
 82  "mechanism_signature": {
 83    "mechanism_signature": {
 84      "mean_residual": 0.6372732743620872,
 85      "retained_modes": 48.0,
 86      "retained_fraction": 0.75,
 87      "fit_rmse": 0.015746959019452333,
 88      "latent_step_rms": 0.16071157343685627,
 89      "predicted_vs_observed": {
 90        "predicted_retained_fraction": 0.75,
 91        "observed_retained_fraction": 0.75,
 92        "prediction": "screening retains approximately the lower 75% residual modes"
 93      },
 94      "confirmed": true
 95    },
 96    "idea_lr_runs": {
 97      "0.001": {
 98        "mean": 0.005698318331269547,
 99        "std": 0.0013604234038858917,
100        "per_seed": [
101          0.00519864447414875,
102          0.008421543054282665,
103          0.005426613613963127,
104          0.005435609724372625,
105          0.00428318977355957,
106          0.0038333924021571875,
107          0.006848391145467758,
108          0.006139162462204695
109        ],
110        "n": 8
111      },
112      "0.003": {
113        "mean": 0.0016669390752213076,
114        "std": 0.0002611493893328423,
115        "per_seed": [
116          0.002052778610959649,
117          0.0019236018415540457,
118          0.0013689034385606647,
119          0.0015125471400097013,
120          0.0015859621344134212,
121          0.0015673021553084254,
122          0.0019797401037067175,
123          0.0013446771772578359
124        ],
125        "n": 8
126      },
127      "0.006": {
128        "mean": 0.0011421147792134434,
129        "std": 0.00044998942636985775,
130        "per_seed": [
131          0.0008761535282246768,
132          0.0019359904108569026,
133          0.0006074620177969337,
134          0.0015396701637655497,
135          0.0007932198350317776,
136          0.0007940693758428097,
137          0.0015995833091437817,
138          0.0009907695930451155
139        ],
140        "n": 8
141      }
142    },
143    "architecture_match": "same bench rnn_small GRU and head; only residual loss differs",
144    "alpha": 0.03,
145    "quantile": 0.75
146  },
147  "protocol_notes": {
148    "baseline_grid": [
149      0.001,
150      0.003,
151      0.006
152    ],
153    "idea_grid": [
154      0.001,
155      0.003,
156      0.006
157    ],
158    "epochs": 15,
159    "batch": 128,
160    "n_train": 400,
161    "n_test": 400,
162    "selection": "baseline selected by four-seed sweep; idea best selected among same grid",
163    "structural_match": "controlled pendulum dynamics requires temporal latent stability"
164  }
165}