Coupled multilevel gradients for Markov-stream training / results.json

Mechanism confirmed, baseline not beaten

Raw ⬇ ZIP
  1{
  2  "seed": 1414,
  3  "telescoping": {
  4    "observed_difference": 0.0062142553295468405,
  5    "two_se": 0.03221308459406803,
  6    "passes_2se": true
  7  },
  8  "math_sweeps": {
  9    "dependence": [
 10      {
 11        "rho": 0.0,
 12        "var_delta_level3": 0.03122528716168673,
 13        "predicted_dependence_multiplier": 1.0,
 14        "observed_ratio_to_iid": 1.0
 15      },
 16      {
 17        "rho": 0.5,
 18        "var_delta_level3": 0.08302711514364562,
 19        "predicted_dependence_multiplier": 3.0,
 20        "observed_ratio_to_iid": 2.658970427196566
 21      },
 22      {
 23        "rho": 0.8,
 24        "var_delta_level3": 0.15949952627813502,
 25        "predicted_dependence_multiplier": 9.000000000000002,
 26        "observed_ratio_to_iid": 5.108024321833623
 27      },
 28      {
 29        "rho": 0.95,
 30        "var_delta_level3": 0.15114103846089474,
 31        "predicted_dependence_multiplier": 38.999999999999964,
 32        "observed_ratio_to_iid": 4.84034102483272
 33      }
 34    ],
 35    "fixed_large_block_dependence": [
 36      {
 37        "rho": 0.0,
 38        "block": 512,
 39        "observed_mean_variance_ratio": 1.0,
 40        "predicted_ratio": 1.0
 41      },
 42      {
 43        "rho": 0.5,
 44        "block": 512,
 45        "observed_mean_variance_ratio": 2.872610098221646,
 46        "predicted_ratio": 3.0
 47      },
 48      {
 49        "rho": 0.8,
 50        "block": 512,
 51        "observed_mean_variance_ratio": 8.348263181891975,
 52        "predicted_ratio": 9.000000000000002
 53      },
 54      {
 55        "rho": 0.95,
 56        "block": 512,
 57        "observed_mean_variance_ratio": 38.01837914190784,
 58        "predicted_ratio": 38.999999999999964
 59      }
 60    ],
 61    "level_scaling_rho_0.8": [
 62      {
 63        "level": 0,
 64        "block": 32,
 65        "variance": 0.16309590169040314,
 66        "variance_times_block": 0.6523836067616126
 67      },
 68      {
 69        "level": 1,
 70        "block": 64,
 71        "variance": 0.11177300182092534,
 72        "variance_times_block": 0.8941840145674027
 73      },
 74      {
 75        "level": 2,
 76        "block": 128,
 77        "variance": 0.06206918488433088,
 78        "variance_times_block": 0.9931069581492941
 79      },
 80      {
 81        "level": 3,
 82        "block": 256,
 83        "variance": 0.032725565071054105,
 84        "variance_times_block": 1.0472180822737314
 85      },
 86      {
 87        "level": 4,
 88        "block": 512,
 89        "variance": 0.017281835571730735,
 90        "variance_times_block": 1.106037476590767
 91      }
 92    ],
 93    "clipping": {
 94      "bound": 1.0,
 95      "max_observed_norm": 1.0000000000000002,
 96      "clipping_fraction": 1.0
 97    }
 98  },
 99  "benchmark": {
100    "0.0": {
101      "baseline": {
102        "final_parameter_error": 4.191237824669519e-05,
103        "loss_at_100": 3.834677042435614e-06,
104        "loss_at_350": 4.191237824669519e-05,
105        "gradient_lag1_autocorr": 0.9462512768851223,
106        "clip_fraction": 0.0,
107        "samples": 11200
108      },
109      "coupled": {
110        "final_parameter_error": 0.0001322984732183939,
111        "loss_at_100": 1.1989567815528517e-05,
112        "loss_at_350": 0.0001322984732183939,
113        "gradient_lag1_autocorr": 0.12825110359421257,
114        "clip_fraction": 0.005714285714285714,
115        "samples": 11200
116      },
117      "iid": {
118        "final_parameter_error": 4.191237824669447e-05,
119        "loss_at_100": 3.834677042435614e-06,
120        "loss_at_350": 4.191237824669447e-05,
121        "gradient_lag1_autocorr": 0.9462512768851222,
122        "clip_fraction": 0.0,
123        "samples": 11200
124      }
125    },
126    "0.8": {
127      "baseline": {
128        "final_parameter_error": 4.738584863256066e-05,
129        "loss_at_100": 1.6542412274363467e-05,
130        "loss_at_350": 4.738584863256066e-05,
131        "gradient_lag1_autocorr": 0.7704085146201389,
132        "clip_fraction": 0.0,
133        "samples": 11200
134      },
135      "coupled": {
136        "final_parameter_error": 1.3070545447163725e-05,
137        "loss_at_100": 0.0015821793711109828,
138        "loss_at_350": 1.3070545447163725e-05,
139        "gradient_lag1_autocorr": 0.43398891041499477,
140        "clip_fraction": 0.008571428571428572,
141        "samples": 11200
142      },
143      "iid": {
144        "final_parameter_error": 4.191237824669447e-05,
145        "loss_at_100": 3.834677042435614e-06,
146        "loss_at_350": 4.191237824669447e-05,
147        "gradient_lag1_autocorr": 0.9462512768851222,
148        "clip_fraction": 0.0,
149        "samples": 11200
150      }
151    },
152    "0.95": {
153      "baseline": {
154        "final_parameter_error": 4.8720403042232836e-05,
155        "loss_at_100": 3.642206004700412e-05,
156        "loss_at_350": 4.8720403042232836e-05,
157        "gradient_lag1_autocorr": 0.5936574381511756,
158        "clip_fraction": 0.0,
159        "samples": 11200
160      },
161      "coupled": {
162        "final_parameter_error": 0.0004948421288137723,
163        "loss_at_100": 0.0020449402889484687,
164        "loss_at_350": 0.0004948421288137723,
165        "gradient_lag1_autocorr": 0.46157540822577764,
166        "clip_fraction": 0.008571428571428572,
167        "samples": 11200
168      },
169      "iid": {
170        "final_parameter_error": 4.191237824669447e-05,
171        "loss_at_100": 3.834677042435614e-06,
172        "loss_at_350": 4.191237824669447e-05,
173        "gradient_lag1_autocorr": 0.9462512768851222,
174        "clip_fraction": 0.0,
175        "samples": 11200
176      }
177    }
178  }
179}