{ "bench_version": 1, "track": "bench_custom_masked_candidate_low_rank", "model": "mlp_tiny", "metric_direction": "lower is better", "n_seeds": 8, "baseline": { "best_cfg": { "lr": 0.001 }, "sweep": [ { "cfg": { "lr": 0.001 }, "mean": 0.4420415982604027 }, { "cfg": { "lr": 0.003 }, "mean": 0.44252580031752586 }, { "cfg": { "lr": 0.006 }, "mean": 0.4765854626893997 } ], "full": { "mean": 0.5450004562735558, "std": 0.2628610195034815, "per_seed": [ 0.7630048990249634, 0.5563264489173889, 0.2823181748390198, 0.16651687026023865, 1.0170692205429077, 0.555262565612793, 0.32614681124687195, 0.6933586597442627 ], "n": 8 } }, "idea": { "mean": 0.048654421931132674, "std": 0.02168288877569749, "per_seed": [ 0.06334998458623886, 0.05048277601599693, 0.03009387105703354, 0.021304024383425713, 0.09369651228189468, 0.040802765637636185, 0.031937580555677414, 0.057567860931158066 ], "n": 8 }, "comparison": { "delta_mean": -0.4963460343424231, "idea_wins": 8, "n_pairs": 8, "per_seed_diffs": [ -0.6996549144387245, -0.505843672901392, -0.25222430378198624, -0.14521284587681293, -0.923372708261013, -0.5144597999751568, -0.29420923069119453, -0.6357907988131046 ], "p_value": 0.0081, "mde": 0.21604011474214413, "mde_rel_pct": 39.64035483920873, "verdict": "idea better (significant)", "system_worked": true }, "custom_track": { "name": "masked_candidate_low_rank", "file": "custom_candidate_track.py", "domain": "retrieval" }, "idea_sweep": [ { "cfg": { "lr": 0.001 }, "result": { "mean": 0.20586615707725286, "std": 0.14904708404374148, "per_seed": [ 0.2456769198179245, 0.2300177961587906, 0.06836631894111633, 0.07623686641454697, 0.5616698265075684, 0.1149023026227951, 0.13585276901721954, 0.21420645713806152 ], "n": 8 } }, { "cfg": { "lr": 0.003 }, "result": { "mean": 0.05824449914507568, "std": 0.02563097931151917, "per_seed": [ 0.07524535804986954, 0.06290170550346375, 0.03489440307021141, 0.025365130975842476, 0.11273353546857834, 0.04778952896595001, 0.04362767934799194, 0.06339865177869797 ], "n": 8 } }, { "cfg": { "lr": 0.006 }, "result": { "mean": 0.048654421931132674, "std": 0.02168288877569749, "per_seed": [ 0.06334998458623886, 0.05048277601599693, 0.03009387105703354, 0.021304024383425713, 0.09369651228189468, 0.040802765637636185, 0.031937580555677414, 0.057567860931158066 ], "n": 8 } } ], "mechanism_signature": { "predicted_flop_ratio": 0.06976744186046512, "observed_first_layer_param_ratio": 0.06976744186046512, "observed_test_prediction_std": 2.4757130444049835, "target_std": 2.446375161409378, "reconstruction_relative_error": 0.1594924950357648, "confirmed": true }, "track_rationale": "Custom track is structurally required: masked ambient candidate vectors generated from a shared low-rank action-feature subspace." }