{ "device": "cuda", "math_check": { "distance_table": [ [ 0.0, 1.0, 2.0, 3.0, 4.0, 5.0, 6.0, 7.0, 8.0 ], [ 8.0, 7.0, 6.0, 5.0, 4.0, 3.0, 2.0, 1.0, 0.0 ] ], "shortest_path_assertions": [ true, true ], "greedy_progress_violations": 0, "ideal_progress_hinge_sum": 0.0, "math_pass": true }, "baseline_runs": [ { "train_reward_last40": 0.675, "eval_success": 0.5, "eval_steps_success_only": 4.0, "critic_loss_last40": 0.07858757711946965, "distance_abs_error_last40": null }, { "train_reward_last40": 0.75, "eval_success": 0.5, "eval_steps_success_only": 4.0, "critic_loss_last40": 0.06681055419612676, "distance_abs_error_last40": null } ], "idea_runs": [ { "train_reward_last40": 0.775, "eval_success": 0.5, "eval_steps_success_only": 4.0, "critic_loss_last40": 0.07392901862040162, "distance_abs_error_last40": 2.983294904232025 }, { "train_reward_last40": 0.725, "eval_success": 0.5, "eval_steps_success_only": 4.0, "critic_loss_last40": 0.0675667256815359, "distance_abs_error_last40": 2.5086710512638093 } ], "baseline": { "train_reward_last40": 0.7125, "eval_success": 0.5, "eval_steps_success_only": 4.0, "critic_loss_last40": 0.07269906565779821 }, "idea": { "train_reward_last40": 0.75, "eval_success": 0.5, "eval_steps_success_only": 4.0, "critic_loss_last40": 0.07074787215096875, "distance_abs_error_last40": 2.745982977747917 } }