{ "math_check": { "weights": [ 0.1506291547769241, 0.2744642148059653, 0.5001064058323684, 0.0748002245847421 ], "rates": [ 0.048687351573742065, 0.31336168751822285, 0.7982388693815918, 1.620517409918451 ], "checks": { "0": { "min_signed_exact": 0.09040247034962548, "max_abs_identity_error": 0.0 }, "1": { "min_signed_exact": 0.006118228130790459, "max_abs_identity_error": 0.0 }, "2": { "min_signed_exact": 0.0008484244473373037, "max_abs_identity_error": 0.0 }, "3": { "min_signed_exact": 0.0002238643079255148, "max_abs_identity_error": 0.0 }, "4": { "min_signed_exact": 7.611858109805141e-05, "max_abs_identity_error": 0.0 }, "finite_difference_first": { "max_dK": -0.0002452044972530987 }, "K_min": 0.09040247034962548 } }, "toy_attention": { "train_context": 32, "test_context": 64, "train_cross_entropy_mixture": 3.301440289954469, "train_cross_entropy_arbitrary": 2.454133274258428, "train_KL_mixture": 6.585829063255329e-07, "test_KL_arbitrary_table": 0.012451793425620486, "learned_weights": [ 0.2783703540171039, 0.29271218705933405, 0.3237646493854326, 0.10515280953812949 ], "learned_rates": [ 0.01783418011609201, 0.17182854144462814, 0.17991811733428217, 0.20221956117274106 ], "target_train_mass_lags_0_7": 0.4844556612421408, "target_test_mass_lags_32_plus": 0.2566478401066379 } }