{ "bench_version": 1, "track": "multitoken_diffusion", "model": "custom_local_vs_rg_pyramid", "metric_direction": "lower is better", "n_seeds": 8, "baseline": { "best_cfg": { "lr": 0.006, "epochs": 12, "hidden": 32 }, "sweep": [ { "cfg": { "lr": 0.001, "epochs": 12, "hidden": 32 }, "mean": 0.5760585516691208 }, { "cfg": { "lr": 0.003, "epochs": 12, "hidden": 32 }, "mean": 0.5570157170295715 }, { "cfg": { "lr": 0.006, "epochs": 12, "hidden": 32 }, "mean": 0.552870586514473 } ], "full": { "mean": 0.5488443523645401, "std": 0.02526189879738744, "per_seed": [ 0.544949471950531, 0.5276203751564026, 0.5781564116477966, 0.5607560873031616, 0.5518556833267212, 0.5262078642845154, 0.5900437831878662, 0.5111651420593262 ], "n": 8 } }, "idea": { "mean": 0.5474011525511742, "std": 0.025686412604992322, "per_seed": [ 0.547066330909729, 0.5185491442680359, 0.5782044529914856, 0.5547541379928589, 0.5519959330558777, 0.5247784852981567, 0.5898048281669617, 0.5140559077262878 ], "n": 8 }, "comparison": { "delta_mean": -0.0014431998133659363, "idea_wins": 4, "n_pairs": 8, "per_seed_diffs": [ 0.002116858959197998, -0.0090712308883667, 4.8041343688964844e-05, -0.006001949310302734, 0.00014024972915649414, -0.0014293789863586426, -0.00023895502090454102, 0.00289076566696167 ], "p_value": 0.40545, "mde": 0.0034127227373531473, "mde_rel_pct": 0.6218015586113622, "verdict": "no measurable effect", "system_worked": false }, "mechanism_signature": { "prediction": "coarse pooled conditioning transmits distant-token influence beyond a radius-1 local field", "predicted_vs_observed": { "predicted": "idea distant sensitivity > baseline", "observed_idea_mean_distant_sensitivity": 0.0, "observed_baseline_mean_distant_sensitivity": 0.0 }, "trained_model_observations": [ { "params": 4673, "mean_output_sensitivity": 0.017446190118789673, "distant_sensitivity_0_to_7": 0.0, "near_sensitivity_0_to_1": 0.04621781036257744, "train_metric": 0.5470663905143738 }, { "params": 4673, "mean_output_sensitivity": 0.014791442081332207, "distant_sensitivity_0_to_7": 0.0, "near_sensitivity_0_to_1": 0.02925388514995575, "train_metric": 0.5185490846633911 }, { "params": 4673, "mean_output_sensitivity": 0.02319423481822014, "distant_sensitivity_0_to_7": 0.0, "near_sensitivity_0_to_1": 0.038679420948028564, "train_metric": 0.5782045125961304 }, { "params": 4673, "mean_output_sensitivity": 0.020275751128792763, "distant_sensitivity_0_to_7": 0.0, "near_sensitivity_0_to_1": 0.04100608453154564, "train_metric": 0.5547541975975037 }, { "params": 4673, "mean_output_sensitivity": 0.015608072280883789, "distant_sensitivity_0_to_7": 0.0, "near_sensitivity_0_to_1": 0.023431016132235527, "train_metric": 0.5519958734512329 }, { "params": 4673, "mean_output_sensitivity": 0.01546372752636671, "distant_sensitivity_0_to_7": 0.0, "near_sensitivity_0_to_1": 0.03454026207327843, "train_metric": 0.5247784852981567 }, { "params": 4673, "mean_output_sensitivity": 0.020734351128339767, "distant_sensitivity_0_to_7": 0.0, "near_sensitivity_0_to_1": 0.04659464955329895, "train_metric": 0.5898047685623169 }, { "params": 4673, "mean_output_sensitivity": 0.017892511561512947, "distant_sensitivity_0_to_7": 0.0, "near_sensitivity_0_to_1": 0.038680300116539, "train_metric": 0.5140558481216431 } ], "confirmed": false }, "idea_sweep": [ { "cfg": { "lr": 0.001, "epochs": 12, "hidden": 32 }, "result": { "mean": 0.5708411112427711, "std": 0.01710534526819156, "per_seed": [ 0.5729581713676453, 0.55045485496521, 0.594555139541626, 0.5791563987731934, 0.5713737607002258, 0.5566545128822327, 0.5941076874732971, 0.547468364238739 ], "n": 8 } }, { "cfg": { "lr": 0.003, "epochs": 12, "hidden": 32 }, "result": { "mean": 0.5542507246136665, "std": 0.020406232018671196, "per_seed": [ 0.5557947158813477, 0.5313525199890137, 0.5770509243011475, 0.5587972402572632, 0.5542395710945129, 0.5387598276138306, 0.590461015701294, 0.5275499820709229 ], "n": 8 } }, { "cfg": { "lr": 0.006, "epochs": 12, "hidden": 32 }, "result": { "mean": 0.5474011525511742, "std": 0.025686412604992322, "per_seed": [ 0.547066330909729, 0.5185491442680359, 0.5782044529914856, 0.5547541379928589, 0.5519959330558777, 0.5247784852981567, 0.5898048281669617, 0.5140559077262878 ], "n": 8 } } ], "custom_track": { "name": "multitoken_diffusion", "file": "/home/maxwelhelp/all/math2nn/bench/custom_tracks/multitoken_diffusion.py", "domain": "diffusion-sampling" }, "architecture": { "baseline": "local radius-1 convolutional velocity field", "idea": "dyadic pooled coarse field plus local fine residual conditioning", "baseline_params": 3361, "idea_params": 4673 } }