{ "device": "cuda", "math_check": { "0": { "relative_final_error": 0.0003125032537843933, "chat_mean": 0.25000000000000006, "chat_std": 4.5781421790842244e-14, "loglog_slope": -1.81818195198746, "expected_slope": null }, "1": { "relative_final_error": 0.00014932080178364782, "chat_mean": 0.2499999999999997, "chat_std": 8.521315210084683e-14, "loglog_slope": -0.7810854854985628, "expected_slope": -1.0 }, "2": { "relative_final_error": 0.00010875134593844327, "chat_mean": 0.2500000000000016, "chat_std": 1.404667921731197e-13, "loglog_slope": -0.4670760867621055, "expected_slope": -0.5 } }, "training": { "baseline": { "final_monitor_loss": 0.21615982055664062, "test_loss": 0.20724385976791382, "rejects": 0, "acceptance_rate": 1.0, "final_eta": 0.12, "loss_first": 2.3186123371124268, "loss_min": 0.21615982055664062 }, "m0": { "final_monitor_loss": 0.4214116930961609, "test_loss": 0.40785276889801025, "rejects": 96, "acceptance_rate": 0.808, "final_eta": 0.0001, "loss_first": 2.3186123371124268, "loss_min": 0.4214116930961609 }, "m1": { "final_monitor_loss": 0.29188665747642517, "test_loss": 0.2780213952064514, "rejects": 189, "acceptance_rate": 0.622, "final_eta": 0.0001, "loss_first": 2.3186123371124268, "loss_min": 0.29188665747642517 }, "m2": { "final_monitor_loss": 0.2771204113960266, "test_loss": 0.26549774408340454, "rejects": 224, "acceptance_rate": 0.552, "final_eta": 0.0001, "loss_first": 2.3186123371124268, "loss_min": 0.2771204113960266 } } }