Residual-Relaxed Trajectory Sampling / bench_report.json
Mechanism confirmed, baseline not beaten
1{
2 "bench_version": 1,
3 "track": "dynamics",
4 "model": "rnn_small",
5 "metric_direction": "lower is better",
6 "n_seeds": 8,
7 "baseline": {
8 "best_cfg": {
9 "lr": 0.006
10 },
11 "sweep": [
12 {
13 "cfg": {
14 "lr": 0.0015
15 },
16 "mean": 0.0011108634498668835
17 },
18 {
19 "cfg": {
20 "lr": 0.003
21 },
22 "mean": 0.0008105679735308513
23 },
24 {
25 "cfg": {
26 "lr": 0.006
27 },
28 "mean": 0.000628942609182559
29 }
30 ],
31 "full": {
32 "mean": 0.0005640739254886284,
33 "std": 0.0001367984084942288,
34 "per_seed": [
35 0.00048537924885749817,
36 0.0007160367094911635,
37 0.000499650021083653,
38 0.0008147044572979212,
39 0.0004540993832051754,
40 0.0005191828240640461,
41 0.0003816201351583004,
42 0.0006419186247512698
43 ],
44 "n": 8
45 }
46 },
47 "idea": {
48 "mean": 0.0005420081324700732,
49 "std": 0.00013960018191357758,
50 "per_seed": [
51 0.000509127858094871,
52 0.0005584119935519993,
53 0.000469617429189384,
54 0.0008545061573386192,
55 0.00044199760304763913,
56 0.0003986096999142319,
57 0.00044967373833060265,
58 0.0006541205802932382
59 ],
60 "n": 8,
61 "best_cfg": {
62 "lr": 0.006,
63 "alpha": 2.0,
64 "beta": 0.9,
65 "sigma": 0.05
66 },
67 "sweep": [
68 {
69 "cfg": {
70 "lr": 0.0015,
71 "alpha": 1.0,
72 "beta": 0.9,
73 "sigma": 0.05
74 },
75 "mean": 0.0013087970073684119
76 },
77 {
78 "cfg": {
79 "lr": 0.003,
80 "alpha": 1.5,
81 "beta": 0.9,
82 "sigma": 0.05
83 },
84 "mean": 0.0008830113292788155
85 },
86 {
87 "cfg": {
88 "lr": 0.006,
89 "alpha": 2.0,
90 "beta": 0.9,
91 "sigma": 0.05
92 },
93 "mean": 0.0005420081324700732
94 }
95 ]
96 },
97 "comparison": {
98 "delta_mean": -2.206579301855527e-05,
99 "idea_wins": 4,
100 "n_pairs": 8,
101 "per_seed_diffs": [
102 2.3748609237372875e-05,
103 -0.00015762471593916416,
104 -3.003259189426899e-05,
105 3.980170004069805e-05,
106 -1.2101780157536268e-05,
107 -0.00012057312414981425,
108 6.805360317230225e-05,
109 1.2201955541968346e-05
110 ],
111 "p_value": 0.44995,
112 "mde": 6.588809659856915e-05,
113 "mde_rel_pct": 11.680755592716622,
114 "verdict": "no significant win",
115 "system_worked": false
116 },
117 "protocol_notes": {
118 "epochs": 8,
119 "n_train": 1200,
120 "n_test": 400,
121 "batch": 128,
122 "track_choice": "dynamics matches stability/control and multi-step pendulum rollouts",
123 "idea": "residual-adaptive candidate trajectory sampling",
124 "lr_union": [
125 0.0015,
126 0.003,
127 0.006
128 ]
129 },
130 "mechanism_signature": {
131 "prediction": "larger trained-model observed residual induces larger temperature and flatter candidate weights",
132 "observed_residual_mean": 0.01952467652328778,
133 "observed_residual_p90": 0.03243881464004517,
134 "observed_ESS_low_residual": 25.594260510103627,
135 "observed_ESS_high_residual": 28.17312607209512,
136 "ESS_ratio_high_over_low": 1.1007595261825773,
137 "confirmed": true
138 }
139}