{ "bench_version": 1, "track": "poisson_boundary", "model": "mlp_tiny", "metric_direction": "lower is better", "n_seeds": 8, "baseline": { "best_cfg": { "lr": 0.01 }, "sweep": [ { "cfg": { "lr": 0.001 }, "mean": 0.06875268183648586 }, { "cfg": { "lr": 0.003 }, "mean": 0.05776503775268793 }, { "cfg": { "lr": 0.01 }, "mean": 0.04322445672005415 } ], "full": { "mean": 0.043870826717466116, "std": 0.002839556331423274, "per_seed": [ 0.04028090834617615, 0.044616829603910446, 0.04462457448244095, 0.043375514447689056, 0.038494233042001724, 0.04666280001401901, 0.046755287796258926, 0.046156466007232666 ], "n": 8 } }, "idea": { "mean": 0.06319879228249192, "std": 0.011146065364718148, "per_seed": [ 0.04028090834617615, 0.07205105572938919, 0.07206139713525772, 0.055017322301864624, 0.05459468439221382, 0.07074009627103806, 0.07260646671056747, 0.06823840737342834 ], "n": 8 }, "comparison": { "delta_mean": 0.019327965565025806, "idea_wins": 0, "n_pairs": 8, "per_seed_diffs": [ 0.0, 0.027434226125478745, 0.027436822652816772, 0.011641807854175568, 0.016100451350212097, 0.024077296257019043, 0.025851178914308548, 0.02208194136619568 ], "p_value": 0.01485, "mde": 0.008040142777977925, "mde_rel_pct": 18.326854950232647, "verdict": "idea worse (significant)", "system_worked": false }, "mechanism_signature": { "mechanism_signature": { "selected_index": 5, "scores": [ 3.491577856996373, 3.515875502902411, 3.537788184248112, 3.5629319410966094, 3.474729111946311, 3.402205193851991 ], "nested_probe": { "2": 3.402205193851991, "3": 3.536084817812452, "4": 3.5380539738679375 }, "predicted_monotone": true, "confirmed": true }, "custom_track": { "name": "poisson_boundary", "file": "poisson_track.py", "domain": "pde" } }, "idea_config_sweep": [ { "cfg": { "lr": 0.01, "level": 2 }, "mean": 0.06319879228249192, "per_seed": [ 0.04028090834617615, 0.07205105572938919, 0.07206139713525772, 0.055017322301864624, 0.05459468439221382, 0.07074009627103806, 0.07260646671056747, 0.06823840737342834 ] }, { "cfg": { "lr": 0.01, "level": 3 }, "mean": 0.06653260113671422, "per_seed": [ 0.06695137917995453, 0.07205105572938919, 0.07206139713525772, 0.055017322301864624, 0.05459468439221382, 0.07074009627103806, 0.07260646671056747, 0.06823840737342834 ] }, { "cfg": { "lr": 0.01, "level": 4 }, "mean": 0.06653260113671422, "per_seed": [ 0.06695137917995453, 0.07205105572938919, 0.07206139713525772, 0.055017322301864624, 0.05459468439221382, 0.07074009627103806, 0.07260646671056747, 0.06823840737342834 ] } ], "runtime_seconds": 117.34046530723572, "protocol_note": "Custom PDE track required; baseline and idea share mlp_tiny and Adam, differing only in archived checkpoint selector." }