Coupled multilevel gradients for Markov-stream training / results2.json
Mechanism confirmed, baseline not beaten
1{
2 "seed": 1414,
3 "telescoping": {
4 "observed_difference": 0.0062142553295468405,
5 "two_se": 0.03221308459406803,
6 "passes_2se": true
7 },
8 "math_sweeps": {
9 "dependence": [
10 {
11 "rho": 0.0,
12 "var_delta_level3": 0.03122528716168673,
13 "predicted_dependence_multiplier": 1.0,
14 "observed_ratio_to_iid": 1.0
15 },
16 {
17 "rho": 0.5,
18 "var_delta_level3": 0.08302711514364562,
19 "predicted_dependence_multiplier": 3.0,
20 "observed_ratio_to_iid": 2.658970427196566
21 },
22 {
23 "rho": 0.8,
24 "var_delta_level3": 0.15949952627813502,
25 "predicted_dependence_multiplier": 9.000000000000002,
26 "observed_ratio_to_iid": 5.108024321833623
27 },
28 {
29 "rho": 0.95,
30 "var_delta_level3": 0.15114103846089474,
31 "predicted_dependence_multiplier": 38.999999999999964,
32 "observed_ratio_to_iid": 4.84034102483272
33 }
34 ],
35 "fixed_large_block_dependence": [
36 {
37 "rho": 0.0,
38 "block": 512,
39 "observed_mean_variance_ratio": 1.0,
40 "predicted_ratio": 1.0
41 },
42 {
43 "rho": 0.5,
44 "block": 512,
45 "observed_mean_variance_ratio": 3.071019068000659,
46 "predicted_ratio": 3.0
47 },
48 {
49 "rho": 0.8,
50 "block": 512,
51 "observed_mean_variance_ratio": 9.022337815214861,
52 "predicted_ratio": 9.000000000000002
53 },
54 {
55 "rho": 0.95,
56 "block": 512,
57 "observed_mean_variance_ratio": 37.56341037701349,
58 "predicted_ratio": 38.999999999999964
59 }
60 ],
61 "level_scaling_rho_0.8": [
62 {
63 "level": 0,
64 "block": 4,
65 "variance": 0.12424890918351746,
66 "variance_times_block": 0.4969956367340698
67 },
68 {
69 "level": 1,
70 "block": 8,
71 "variance": 0.17249707309513507,
72 "variance_times_block": 1.3799765847610805
73 },
74 {
75 "level": 2,
76 "block": 16,
77 "variance": 0.19034564926731318,
78 "variance_times_block": 3.045530388277011
79 },
80 {
81 "level": 3,
82 "block": 32,
83 "variance": 0.1661246198280065,
84 "variance_times_block": 5.315987834496208
85 },
86 {
87 "level": 4,
88 "block": 64,
89 "variance": 0.11378206708640781,
90 "variance_times_block": 7.2820522935301
91 }
92 ],
93 "clipping": {
94 "bound": 1.0,
95 "max_observed_norm": 1.0000000000000004,
96 "clipping_fraction": 1.0
97 }
98 },
99 "benchmark": {
100 "0.0": {
101 "baseline": {
102 "final_parameter_error": 4.191237824669519e-05,
103 "loss_at_100": 3.834677042435614e-06,
104 "loss_at_350": 4.191237824669519e-05,
105 "gradient_lag1_autocorr": 0.9462512768851223,
106 "clip_fraction": 0.0,
107 "samples": 11200
108 },
109 "coupled": {
110 "final_parameter_error": 0.0001322984732183939,
111 "loss_at_100": 1.1989567815528517e-05,
112 "loss_at_350": 0.0001322984732183939,
113 "gradient_lag1_autocorr": 0.12825110359421257,
114 "clip_fraction": 0.005714285714285714,
115 "samples": 11200
116 },
117 "iid": {
118 "final_parameter_error": 4.191237824669447e-05,
119 "loss_at_100": 3.834677042435614e-06,
120 "loss_at_350": 4.191237824669447e-05,
121 "gradient_lag1_autocorr": 0.9462512768851222,
122 "clip_fraction": 0.0,
123 "samples": 11200
124 }
125 },
126 "0.8": {
127 "baseline": {
128 "final_parameter_error": 4.738584863256066e-05,
129 "loss_at_100": 1.6542412274363467e-05,
130 "loss_at_350": 4.738584863256066e-05,
131 "gradient_lag1_autocorr": 0.7704085146201389,
132 "clip_fraction": 0.0,
133 "samples": 11200
134 },
135 "coupled": {
136 "final_parameter_error": 1.3070545447163725e-05,
137 "loss_at_100": 0.0015821793711109828,
138 "loss_at_350": 1.3070545447163725e-05,
139 "gradient_lag1_autocorr": 0.43398891041499477,
140 "clip_fraction": 0.008571428571428572,
141 "samples": 11200
142 },
143 "iid": {
144 "final_parameter_error": 4.191237824669447e-05,
145 "loss_at_100": 3.834677042435614e-06,
146 "loss_at_350": 4.191237824669447e-05,
147 "gradient_lag1_autocorr": 0.9462512768851222,
148 "clip_fraction": 0.0,
149 "samples": 11200
150 }
151 },
152 "0.95": {
153 "baseline": {
154 "final_parameter_error": 4.8720403042232836e-05,
155 "loss_at_100": 3.642206004700412e-05,
156 "loss_at_350": 4.8720403042232836e-05,
157 "gradient_lag1_autocorr": 0.5936574381511756,
158 "clip_fraction": 0.0,
159 "samples": 11200
160 },
161 "coupled": {
162 "final_parameter_error": 0.0004948421288137723,
163 "loss_at_100": 0.0020449402889484687,
164 "loss_at_350": 0.0004948421288137723,
165 "gradient_lag1_autocorr": 0.46157540822577764,
166 "clip_fraction": 0.008571428571428572,
167 "samples": 11200
168 },
169 "iid": {
170 "final_parameter_error": 4.191237824669447e-05,
171 "loss_at_100": 3.834677042435614e-06,
172 "loss_at_350": 4.191237824669447e-05,
173 "gradient_lag1_autocorr": 0.9462512768851222,
174 "clip_fraction": 0.0,
175 "samples": 11200
176 }
177 }
178 }
179}