Lag-Compensated Spectral Scheduler / bench_report.json

Failed on benchmark

Raw ⬇ ZIP
  1{
  2  "bench_version": 1,
  3  "track": "dynamics",
  4  "model": "rnn_small",
  5  "metric_direction": "lower is better",
  6  "n_seeds": 8,
  7  "baseline": {
  8    "best_cfg": {
  9      "lr": 0.006,
 10      "weight_decay": 0.0
 11    },
 12    "sweep": [
 13      {
 14        "cfg": {
 15          "lr": 0.001,
 16          "weight_decay": 0.0
 17        },
 18        "mean": 0.0720269184675999
 19      },
 20      {
 21        "cfg": {
 22          "lr": 0.003,
 23          "weight_decay": 0.0
 24        },
 25        "mean": 0.0028564660606207326
 26      },
 27      {
 28        "cfg": {
 29          "lr": 0.006,
 30          "weight_decay": 0.0
 31        },
 32        "mean": 0.00228094776684884
 33      }
 34    ],
 35    "full": {
 36      "mean": 0.00228094776684884,
 37      "std": 0.0008615682293713639,
 38      "per_seed": [
 39        0.002221147296950221,
 40        0.001970731420442462,
 41        0.0013024760410189629,
 42        0.0042177895084023476,
 43        0.0020735678263008595,
 44        0.0015317687066271901,
 45        0.002943465718999505,
 46        0.0019866356160491705
 47      ],
 48      "n": 8
 49    }
 50  },
 51  "idea": {
 52    "cfg": {
 53      "lr": 0.006,
 54      "weight_decay": 0.0,
 55      "kappa": 8.0
 56    },
 57    "mean": 0.002070821574307047,
 58    "std": 0.0007668985617216761,
 59    "per_seed": [
 60      0.0024689047131687403,
 61      0.0014718936290591955,
 62      0.0017854231409728527,
 63      0.0037137719336897135,
 64      0.0013458451721817255,
 65      0.0012669704155996442,
 66      0.0025451004039496183,
 67      0.0019686631858348846
 68    ],
 69    "n": 8
 70  },
 71  "comparison": {
 72    "delta_mean": -0.000210126192541793,
 73    "delta_std": 0.0003877800102460661,
 74    "p_value": 0.1702,
 75    "diffs": [
 76      0.0002477574162185192,
 77      -0.0004988377913832664,
 78      0.00048294709995388985,
 79      -0.0005040175747126341,
 80      -0.000727722654119134,
 81      -0.00026479829102754593,
 82      -0.0003983653150498867,
 83      -1.797243021428585e-05
 84    ]
 85  },
 86  "mechanism_signature": {
 87    "math_check": {
 88      "kappas": [
 89        1,
 90        2,
 91        4,
 92        8,
 93        16
 94      ],
 95      "delays": [
 96        0.9989999999999988,
 97        0.4989999999999988,
 98        0.24899999999999878,
 99        0.12399999999999878,
100        0.062000000000001165
101      ],
102      "predicted_offset_slope": 1.0,
103      "fit_slope": 0.9997204301075259,
104      "r2": 0.9999997339246215,
105      "passed": true
106    },
107    "idea_sweep": [
108      {
109        "cfg": {
110          "lr": 0.006,
111          "weight_decay": 0.0,
112          "kappa": 2.0
113        },
114        "mean": 0.002092966591590084,
115        "std": 0.0007941076298383792,
116        "per_seed": [
117          0.0025941352359950542,
118          0.0013959517236799002,
119          0.0019340378930792212,
120          0.0037612225860357285,
121          0.0012745162239298224,
122          0.0012861500727012753,
123          0.0025039087049663067,
124          0.0019938102923333645
125        ],
126        "n": 8
127      },
128      {
129        "cfg": {
130          "lr": 0.006,
131          "weight_decay": 0.0,
132          "kappa": 4.0
133        },
134        "mean": 0.0020771025301655754,
135        "std": 0.0007748204332654841,
136        "per_seed": [
137          0.002521086484193802,
138          0.0014459786470979452,
139          0.0018341594841331244,
140          0.003721740795299411,
141          0.0013138779904693365,
142          0.001272903406061232,
143          0.0025291924830526114,
144          0.0019778809510171413
145        ],
146        "n": 8
147      },
148      {
149        "cfg": {
150          "lr": 0.006,
151          "weight_decay": 0.0,
152          "kappa": 8.0
153        },
154        "mean": 0.002070821574307047,
155        "std": 0.0007668985617216761,
156        "per_seed": [
157          0.0024689047131687403,
158          0.0014718936290591955,
159          0.0017854231409728527,
160          0.0037137719336897135,
161          0.0013458451721817255,
162          0.0012669704155996442,
163          0.0025451004039496183,
164          0.0019686631858348846
165        ],
166        "n": 8
167      }
168    ],
169    "comparison_recomputed": {
170      "delta_mean": -0.000210126192541793,
171      "delta_std": 0.0003877800102460661,
172      "p_value": 0.1702,
173      "diffs": [
174        0.0002477574162185192,
175        -0.0004988377913832664,
176        0.00048294709995388985,
177        -0.0005040175747126341,
178        -0.000727722654119134,
179        -0.00026479829102754593,
180        -0.0003983653150498867,
181        -1.797243021428585e-05
182      ]
183    },
184    "mechanism_signature": {
185      "prediction": "lag delay scales as 1/kappa and positive feed-forward compensation reduces it",
186      "trained_model_measurements": [
187        {
188          "kappa": 2.0,
189          "baseline_cross_step": 1.0,
190          "idea_cross_step": 1.0,
191          "observed_mean_effective_gap": 0.0
192        },
193        {
194          "kappa": 4.0,
195          "baseline_cross_step": 1.0,
196          "idea_cross_step": 1.0,
197          "observed_mean_effective_gap": 0.0
198        },
199        {
200          "kappa": 8.0,
201          "baseline_cross_step": 1.0,
202          "idea_cross_step": 1.0,
203          "observed_mean_effective_gap": 0.0
204        }
205      ],
206      "confirmed": false,
207      "reason": "No reliable local-growth threshold crossing was observed consistently in the trained dynamics runs; therefore the NN-scale quantitative claim is not confirmed."
208    }
209  }
210}