Tiny Local Recurrence with Adaptive Computation / bench_report_corrected.json

Unverified

Raw ⬇ ZIP
  1{
  2  "bench_version": 1,
  3  "track": "dynamics",
  4  "model": "rnn_small",
  5  "metric_direction": "lower is better",
  6  "n_seeds": 8,
  7  "baseline": {
  8    "best_cfg": {
  9      "lr": 0.006
 10    },
 11    "sweep": [
 12      {
 13        "cfg": {
 14          "lr": 0.001
 15        },
 16        "mean": 6.268094512051903e-05
 17      },
 18      {
 19        "cfg": {
 20          "lr": 0.003
 21        },
 22        "mean": 2.4053396373346914e-05
 23      },
 24      {
 25        "cfg": {
 26          "lr": 0.006
 27        },
 28        "mean": 1.9922963019780582e-05
 29      }
 30    ],
 31    "full": {
 32      "mean": 1.6942617776294355e-05,
 33      "std": 7.0294610370873945e-06,
 34      "per_seed": [
 35        2.646726898092311e-05,
 36        1.3497274267137982e-05,
 37        1.7921185644809157e-05,
 38        2.180612318625208e-05,
 39        1.1675516361719929e-05,
 40        9.150396181212272e-06,
 41        2.697196396184154e-05,
 42        8.051213626458775e-06
 43      ],
 44      "n": 8
 45    }
 46  },
 47  "idea": {
 48    "mean": 6.218317793127426e-06,
 49    "std": 2.61984541800953e-06,
 50    "per_seed": [
 51      2.8394540549925296e-06,
 52      8.368528142455034e-06,
 53      4.065665507368976e-06,
 54      6.483904144261032e-06,
 55      2.6967427402269095e-06,
 56      9.669754945207387e-06,
 57      9.356464033771772e-06,
 58      6.266028776735766e-06
 59    ],
 60    "n": 8,
 61    "chosen_cfg": {
 62      "lr": 0.006,
 63      "tmax": 8
 64    },
 65    "sweep": [
 66      {
 67        "cfg": {
 68          "lr": 0.001,
 69          "tmax": 8
 70        },
 71        "mean": 3.799157411776832e-05,
 72        "per_seed": [
 73          2.9381331842159852e-05,
 74          6.0935002693440765e-05,
 75          3.8257920095929876e-05,
 76          2.33920418395428e-05
 77        ]
 78      },
 79      {
 80        "cfg": {
 81          "lr": 0.003,
 82          "tmax": 8
 83        },
 84        "mean": 1.020754018554726e-05,
 85        "per_seed": [
 86          6.3169459281198215e-06,
 87          1.2884396710433066e-05,
 88          1.2727699868264608e-05,
 89          8.901118235371541e-06
 90        ]
 91      },
 92      {
 93        "cfg": {
 94          "lr": 0.006,
 95          "tmax": 8
 96        },
 97        "mean": 5.439387962269393e-06,
 98        "per_seed": [
 99          2.8394540549925296e-06,
100          8.368528142455034e-06,
101          4.065665507368976e-06,
102          6.483904144261032e-06
103        ]
104      }
105    ]
106  },
107  "comparison": {
108    "delta_mean": -1.072429998316693e-05,
109    "idea_wins": 7,
110    "n_pairs": 8,
111    "per_seed_diffs": [
112      -2.362781492593058e-05,
113      -5.128746124682948e-06,
114      -1.385552013744018e-05,
115      -1.5322219041991048e-05,
116      -8.97877362149302e-06,
117      5.193587639951147e-07,
118      -1.7615499928069767e-05,
119      -1.7851848497230094e-06
120    ],
121    "p_value": 0.0163,
122    "mde": 6.964423506000914e-06,
123    "mde_rel_pct": 41.105947132593315,
124    "verdict": "idea better (significant)",
125    "system_worked": true
126  },
127  "mechanism_signature": {
128    "prediction": "shared adaptive recurrence performs fewer than Tmax weighted updates on trained inputs",
129    "predicted": {
130      "weighted_steps": "< 8"
131    },
132    "observed": {
133      "mean_weighted_steps": 1.24119733273983,
134      "mean_mass": 1.0,
135      "per_seed_steps": [
136        1.2474790811538696,
137        1.2404111623764038,
138        1.2472835779190063,
139        1.2294979095458984,
140        1.252071499824524,
141        1.2432061433792114,
142        1.2319114208221436,
143        1.237717866897583
144      ]
145    },
146    "confirmed": true,
147    "parameter_counts": {
148      "baseline": 135297,
149      "idea": 18434
150    }
151  },
152  "corrected_protocol": true
153}