Koopman Skew-Dilation RNN / bench_report.json

Mechanism confirmed, baseline not beaten

Raw ⬇ ZIP
  1{
  2  "bench_version": 1,
  3  "track": "dynamics",
  4  "model": "rnn_small",
  5  "metric_direction": "lower is better",
  6  "n_seeds": 8,
  7  "baseline": {
  8    "best_cfg": {
  9      "lr": 0.01,
 10      "epochs": 12
 11    },
 12    "sweep": [
 13      {
 14        "cfg": {
 15          "lr": 0.001,
 16          "epochs": 12
 17        },
 18        "per_seed": [
 19          0.0070558576844632626,
 20          0.0025721259880810976,
 21          0.0027294710744172335,
 22          0.0034412096720188856,
 23          0.0046035656705498695,
 24          0.003881418611854315,
 25          0.003549819579347968,
 26          0.008237835951149464
 27        ],
 28        "mean": 0.004508913028985262,
 29        "std": 0.002062311810243919
 30      },
 31      {
 32        "cfg": {
 33          "lr": 0.003,
 34          "epochs": 12
 35        },
 36        "per_seed": [
 37          0.0019035028526559472,
 38          0.0020239646546542645,
 39          0.0036072093062102795,
 40          0.006420358084142208,
 41          0.0027512782253324986,
 42          0.0025861035101115704,
 43          0.0030072720255702734,
 44          0.0019430352840572596
 45        ],
 46        "mean": 0.0030303404928417876,
 47        "std": 0.0014911902872439856
 48      },
 49      {
 50        "cfg": {
 51          "lr": 0.01,
 52          "epochs": 12
 53        },
 54        "per_seed": [
 55          0.0018195160664618015,
 56          0.0012350792530924082,
 57          0.0008721873164176941,
 58          0.0027302715461701155,
 59          0.0014946963638067245,
 60          0.0011278137098997831,
 61          0.0009376407833769917,
 62          0.002133276779204607
 63        ],
 64        "mean": 0.0015438102273037657,
 65        "std": 0.0006459183721555687
 66      }
 67    ],
 68    "harness_tuning": {
 69      "best_cfg": {
 70        "lr": 0.01,
 71        "epochs": 12
 72      },
 73      "sweep": [
 74        {
 75          "cfg": {
 76            "lr": 0.001,
 77            "epochs": 12
 78          },
 79          "mean": 0.00394966610474512
 80        },
 81        {
 82          "cfg": {
 83            "lr": 0.003,
 84            "epochs": 12
 85          },
 86          "mean": 0.003488758724415675
 87        },
 88        {
 89          "cfg": {
 90            "lr": 0.01,
 91            "epochs": 12
 92          },
 93          "mean": 0.0016642635455355048
 94        }
 95      ],
 96      "full": {
 97        "mean": 0.0015438102273037657,
 98        "std": 0.0006042013121072209,
 99        "per_seed": [
100          0.0018195160664618015,
101          0.0012350792530924082,
102          0.0008721873164176941,
103          0.0027302715461701155,
104          0.0014946963638067245,
105          0.0011278137098997831,
106          0.0009376407833769917,
107          0.002133276779204607
108        ],
109        "n": 8
110      }
111    },
112    "full": {
113      "per_seed": [
114        0.0018195160664618015,
115        0.0012350792530924082,
116        0.0008721873164176941,
117        0.0027302715461701155,
118        0.0014946963638067245,
119        0.0011278137098997831,
120        0.0009376407833769917,
121        0.002133276779204607
122      ],
123      "mean": 0.0015438102273037657,
124      "std": 0.0006459183721555687
125    }
126  },
127  "idea": {
128    "per_seed": [
129      0.010384509339928627,
130      0.014125057496130466,
131      0.052780672907829285,
132      0.03464017063379288,
133      0.008677596226334572,
134      0.00931015145033598,
135      0.0071034664288163185,
136      0.005731561686843634
137    ],
138    "mean": 0.01784414827125147,
139    "std": 0.016865335320885074
140  },
141  "comparison": {
142    "delta_mean": 0.016300338043947704,
143    "idea_wins": 0,
144    "n_pairs": 8,
145    "per_seed_diffs": [
146      0.008564993273466825,
147      0.012889978243038058,
148      0.05190848559141159,
149      0.03190989908762276,
150      0.007182899862527847,
151      0.008182337740436196,
152      0.006165825645439327,
153      0.0035982849076390266
154    ],
155    "p_value": 0.0081,
156    "mde": 0.014119949734496392,
157    "mde_rel_pct": 914.6169318463842,
158    "verdict": "idea worse (significant)",
159    "system_worked": false
160  },
161  "mechanism_signature": {
162    "idea_sweep": [
163      {
164        "cfg": {
165          "lr": 0.001,
166          "epochs": 12
167        },
168        "per_seed": [
169          0.004393833689391613,
170          0.02482367865741253,
171          0.0714903250336647,
172          0.013632673770189285,
173          0.0009164400398731232,
174          0.009770718403160572,
175          0.024457935243844986,
176          0.019280623644590378
177        ],
178        "mean": 0.0210957785602659,
179        "std": 0.02216245868447279
180      },
181      {
182        "cfg": {
183          "lr": 0.003,
184          "epochs": 12
185        },
186        "per_seed": [
187          0.01244353037327528,
188          0.03397444263100624,
189          0.05305279791355133,
190          0.0075877052731812,
191          0.0036976668052375317,
192          0.003634050488471985,
193          0.02957206219434738,
194          0.011668341234326363
195        ],
196        "mean": 0.019453824614174664,
197        "std": 0.01769262402163577
198      },
199      {
200        "cfg": {
201          "lr": 0.01,
202          "epochs": 12
203        },
204        "per_seed": [
205          0.010384509339928627,
206          0.014125057496130466,
207          0.052780672907829285,
208          0.03464017063379288,
209          0.008677596226334572,
210          0.00931015145033598,
211          0.0071034664288163185,
212          0.005731561686843634
213        ],
214        "mean": 0.01784414827125147,
215        "std": 0.016865335320885074
216      }
217    ],
218    "mechanism_signature": {
219      "prediction": "Cayley preserves lifted norm; explicit Euler grows it",
220      "observed_cayley_relative_norm_error": 5.960464477539062e-07,
221      "observed_euler_20_step_norm_ratio": 1.003595232963562,
222      "trained_test_mse": 0.01244353037327528,
223      "confirmed": true
224    }
225  },
226  "custom_track": null
227}