Tiny Local Recurrence with Adaptive Computation / bench_report_corrected.json
Unverified
1{
2 "bench_version": 1,
3 "track": "dynamics",
4 "model": "rnn_small",
5 "metric_direction": "lower is better",
6 "n_seeds": 8,
7 "baseline": {
8 "best_cfg": {
9 "lr": 0.006
10 },
11 "sweep": [
12 {
13 "cfg": {
14 "lr": 0.001
15 },
16 "mean": 6.268094512051903e-05
17 },
18 {
19 "cfg": {
20 "lr": 0.003
21 },
22 "mean": 2.4053396373346914e-05
23 },
24 {
25 "cfg": {
26 "lr": 0.006
27 },
28 "mean": 1.9922963019780582e-05
29 }
30 ],
31 "full": {
32 "mean": 1.6942617776294355e-05,
33 "std": 7.0294610370873945e-06,
34 "per_seed": [
35 2.646726898092311e-05,
36 1.3497274267137982e-05,
37 1.7921185644809157e-05,
38 2.180612318625208e-05,
39 1.1675516361719929e-05,
40 9.150396181212272e-06,
41 2.697196396184154e-05,
42 8.051213626458775e-06
43 ],
44 "n": 8
45 }
46 },
47 "idea": {
48 "mean": 6.218317793127426e-06,
49 "std": 2.61984541800953e-06,
50 "per_seed": [
51 2.8394540549925296e-06,
52 8.368528142455034e-06,
53 4.065665507368976e-06,
54 6.483904144261032e-06,
55 2.6967427402269095e-06,
56 9.669754945207387e-06,
57 9.356464033771772e-06,
58 6.266028776735766e-06
59 ],
60 "n": 8,
61 "chosen_cfg": {
62 "lr": 0.006,
63 "tmax": 8
64 },
65 "sweep": [
66 {
67 "cfg": {
68 "lr": 0.001,
69 "tmax": 8
70 },
71 "mean": 3.799157411776832e-05,
72 "per_seed": [
73 2.9381331842159852e-05,
74 6.0935002693440765e-05,
75 3.8257920095929876e-05,
76 2.33920418395428e-05
77 ]
78 },
79 {
80 "cfg": {
81 "lr": 0.003,
82 "tmax": 8
83 },
84 "mean": 1.020754018554726e-05,
85 "per_seed": [
86 6.3169459281198215e-06,
87 1.2884396710433066e-05,
88 1.2727699868264608e-05,
89 8.901118235371541e-06
90 ]
91 },
92 {
93 "cfg": {
94 "lr": 0.006,
95 "tmax": 8
96 },
97 "mean": 5.439387962269393e-06,
98 "per_seed": [
99 2.8394540549925296e-06,
100 8.368528142455034e-06,
101 4.065665507368976e-06,
102 6.483904144261032e-06
103 ]
104 }
105 ]
106 },
107 "comparison": {
108 "delta_mean": -1.072429998316693e-05,
109 "idea_wins": 7,
110 "n_pairs": 8,
111 "per_seed_diffs": [
112 -2.362781492593058e-05,
113 -5.128746124682948e-06,
114 -1.385552013744018e-05,
115 -1.5322219041991048e-05,
116 -8.97877362149302e-06,
117 5.193587639951147e-07,
118 -1.7615499928069767e-05,
119 -1.7851848497230094e-06
120 ],
121 "p_value": 0.0163,
122 "mde": 6.964423506000914e-06,
123 "mde_rel_pct": 41.105947132593315,
124 "verdict": "idea better (significant)",
125 "system_worked": true
126 },
127 "mechanism_signature": {
128 "prediction": "shared adaptive recurrence performs fewer than Tmax weighted updates on trained inputs",
129 "predicted": {
130 "weighted_steps": "< 8"
131 },
132 "observed": {
133 "mean_weighted_steps": 1.24119733273983,
134 "mean_mass": 1.0,
135 "per_seed_steps": [
136 1.2474790811538696,
137 1.2404111623764038,
138 1.2472835779190063,
139 1.2294979095458984,
140 1.252071499824524,
141 1.2432061433792114,
142 1.2319114208221436,
143 1.237717866897583
144 ]
145 },
146 "confirmed": true,
147 "parameter_counts": {
148 "baseline": 135297,
149 "idea": 18434
150 }
151 },
152 "corrected_protocol": true
153}