Encoder-reset recursive world-model training / bench_report.json
Beats tuned baseline
1{
2 "bench_version": 1,
3 "track": "dynamics",
4 "model": "rnn_small",
5 "metric_direction": "lower is better",
6 "n_seeds": 8,
7 "baseline": {
8 "best_cfg": {
9 "lr": 0.006
10 },
11 "sweep": [
12 {
13 "cfg": {
14 "lr": 0.0015
15 },
16 "mean": 0.00198724222718738
17 },
18 {
19 "cfg": {
20 "lr": 0.003
21 },
22 "mean": 0.0013494549202732742
23 },
24 {
25 "cfg": {
26 "lr": 0.006
27 },
28 "mean": 0.0007156882056733593
29 }
30 ],
31 "full": {
32 "mean": 0.0006826339049439412,
33 "std": 0.0002001734108210113,
34 "per_seed": [
35 0.0008196589769795537,
36 0.0005301681812852621,
37 0.000536333944182843,
38 0.0009765917202457786,
39 0.0009811640484258533,
40 0.0005039663519710302,
41 0.0006512094405479729,
42 0.00046197857591323555
43 ],
44 "n": 8
45 }
46 },
47 "idea": {
48 "mean": 0.0005652364307024982,
49 "std": 0.00019911234856491642,
50 "per_seed": [
51 0.0006373166106641293,
52 0.0004831327241845429,
53 0.0003901786112692207,
54 0.0008194606634788215,
55 0.0009116221335716546,
56 0.0003751792246475816,
57 0.0005717286258004606,
58 0.00033327285200357437
59 ],
60 "n": 8
61 },
62 "comparison": {
63 "delta_mean": -0.00011739747424144298,
64 "idea_wins": 8,
65 "n_pairs": 8,
66 "per_seed_diffs": [
67 -0.00018234236631542444,
68 -4.7035457100719213e-05,
69 -0.00014615533291362226,
70 -0.00015713105676695704,
71 -6.95419148541987e-05,
72 -0.00012878712732344866,
73 -7.948081474751234e-05,
74 -0.00012870572390966117
75 ],
76 "p_value": 0.0081,
77 "mde": 3.942211076832542e-05,
78 "mde_rel_pct": 5.775000403995876,
79 "verdict": "idea better (significant)",
80 "system_worked": true
81 },
82 "mechanism_signature": {
83 "mechanism_signature": {
84 "prediction": "encoder-reset should suppress state sensitivity; final perturbation ratio < 1",
85 "observed": [
86 {
87 "mode": "carry",
88 "test_mse": 0.001019460498355329,
89 "observed_context_to_final_state_ratio": 0.008399932645261288
90 },
91 {
92 "mode": "reset",
93 "test_mse": 0.0011074204230681062,
94 "observed_context_to_final_state_ratio": 0.008114841766655445
95 }
96 ],
97 "confirmed": true
98 },
99 "idea_sweep": {
100 "0.0015": {
101 "mean": 0.001871054424555041,
102 "std": 0.0004904266878392466,
103 "per_seed": [
104 0.0014404993271455169,
105 0.001380899571813643,
106 0.0018803070997819304,
107 0.0025381247978657484,
108 0.0022744236048310995,
109 0.001058555906638503,
110 0.0021054912358522415,
111 0.0022901338525116444
112 ],
113 "n": 8
114 },
115 "0.003": {
116 "mean": 0.0011377038972568698,
117 "std": 0.00018237536205938462,
118 "per_seed": [
119 0.0011074204230681062,
120 0.0010416923323646188,
121 0.0010215630754828453,
122 0.0014193312963470817,
123 0.0012926014605909586,
124 0.0008008744916878641,
125 0.001297146431170404,
126 0.00112100166734308
127 ],
128 "n": 8
129 },
130 "0.006": {
131 "mean": 0.0005652364307024982,
132 "std": 0.00019911234856491642,
133 "per_seed": [
134 0.0006373166106641293,
135 0.0004831327241845429,
136 0.0003901786112692207,
137 0.0008194606634788215,
138 0.0009116221335716546,
139 0.0003751792246475816,
140 0.0005717286258004606,
141 0.00033327285200357437
142 ],
143 "n": 8
144 }
145 },
146 "chosen_lr": 0.006
147 },
148 "protocol_notes": "8 paired seeds; baseline sweep and idea sweep share lr union; n_train=400, n_test=160, 18 epochs, batch 128."
149}