{ "bench_version": 1, "track": "tabular", "model": "mlp_tiny", "metric_direction": "lower is better", "n_seeds": 8, "baseline": { "best_cfg": { "lr": 0.01 }, "sweep": [ { "cfg": { "lr": 0.001 }, "mean": 130.23694229125977 }, { "cfg": { "lr": 0.003 }, "mean": 17.47633147239685 }, { "cfg": { "lr": 0.01 }, "mean": 11.130715131759644 } ], "full": { "mean": 11.6078120470047, "std": 1.1735198758690657, "per_seed": [ 10.810468673706055, 12.079232215881348, 10.855374336242676, 10.777785301208496, 9.649698257446289, 12.84527587890625, 12.719051361083984, 13.1256103515625 ], "n": 8 } }, "idea": { "mean": 8.623416543006897, "std": 1.4506015215736154, "per_seed": [ 7.800422191619873, 11.718671798706055, 10.022994041442871, 6.932704925537109, 7.960085868835449, 8.643534660339355, 8.414508819580078, 7.494410037994385 ], "n": 8, "details": [ { "metric": 7.800422191619873, "seconds": 7.774140733999957, "accepted_steps": 12, "median_alpha": 0.3333333333333333, "mean_rank": 389.5833333333333, "max_jacobian_condition": 3202.399169921875, "signature": { "predicted_full_to_truncated_amplification": 1000000064.0, "observed_full_step_norm": 0.04894990101456642, "observed_truncated_step_norm": 0.04894990101456642, "observed_amplification": 1.0, "confirmed": false } }, { "metric": 11.718671798706055, "seconds": 9.029400838999209, "accepted_steps": 12, "median_alpha": 0.3333333333333333, "mean_rank": 390.6666666666667, "max_jacobian_condition": 4148.69775390625 }, { "metric": 10.022994041442871, "seconds": 9.43387127599999, "accepted_steps": 12, "median_alpha": 0.3333333333333333, "mean_rank": 400.0, "max_jacobian_condition": 846.0858154296875 }, { "metric": 6.932704925537109, "seconds": 9.006122887998572, "accepted_steps": 12, "median_alpha": 0.3333333333333333, "mean_rank": 400.0, "max_jacobian_condition": 852.4298095703125 }, { "metric": 7.960085868835449, "seconds": 9.027963689999524, "accepted_steps": 12, "median_alpha": 0.3333333333333333, "mean_rank": 370.5, "max_jacobian_condition": 2142.92919921875 }, { "metric": 8.643534660339355, "seconds": 8.847281662001478, "accepted_steps": 12, "median_alpha": 0.3333333333333333, "mean_rank": 399.5833333333333, "max_jacobian_condition": 1440.25390625 }, { "metric": 8.414508819580078, "seconds": 8.764552226000887, "accepted_steps": 12, "median_alpha": 0.3333333333333333, "mean_rank": 109.83333333333333, "max_jacobian_condition": 17170.849609375 }, { "metric": 7.494410037994385, "seconds": 8.539251098000022, "accepted_steps": 12, "median_alpha": 0.3333333333333333, "mean_rank": 400.0, "max_jacobian_condition": 614.7550048828125 } ] }, "comparison": { "delta_mean": -2.9843955039978027, "idea_wins": 8, "n_pairs": 8, "per_seed_diffs": [ -3.0100464820861816, -0.36056041717529297, -0.8323802947998047, -3.8450803756713867, -1.6896123886108398, -4.2017412185668945, -4.304542541503906, -5.631200313568115 ], "p_value": 0.0081, "mde": 1.5535327571979936, "mde_rel_pct": 13.383510612569488, "verdict": "idea better (significant)", "system_worked": true }, "method_notes": { "track_justification": "Optimizer idea matched to tabular regression.", "idea_sweep": [ { "cfg": { "lr": 0.001 }, "mean": 9.118698239326477 }, { "cfg": { "lr": 0.003 }, "mean": 10.81938362121582 }, { "cfg": { "lr": 0.01 }, "mean": 10.81938362121582 } ], "idea_best_cfg": { "lr": 0.001 }, "sanity": { "singular_values": [ 1.0, 9.999999717180685e-10 ], "full_step_norm": 100000008.0, "truncated_step_norm": 0.10000000149011612, "amplification_ratio": 1000000064.0, "kept_rank": 1 }, "epochs": 12, "batch": 128, "tau": 1e-06, "rho": 0.001 }, "mechanism_signature": { "predicted_full_to_truncated_amplification": 1000000064.0, "observed_full_step_norm": 0.04894990101456642, "observed_truncated_step_norm": 0.04894990101456642, "observed_amplification": 1.0, "confirmed": false } }