{ "bench_version": 1, "track": "conditional_multitoken_diffusion", "model": "transformer_tiny", "metric_direction": "lower is better", "n_seeds": 8, "baseline": { "best_cfg": { "lr": 0.001 }, "sweep": [ { "cfg": { "lr": 0.001 }, "mean": 0.09234148263931274 }, { "cfg": { "lr": 0.003 }, "mean": 0.10227461904287338 }, { "cfg": { "lr": 0.01 }, "mean": 0.13437412679195404 } ], "full": { "mean": 0.09546016063541174, "std": 0.0068981652474538425, "per_seed": [ 0.08567251265048981, 0.08461520820856094, 0.09914777427911758, 0.09993043541908264, 0.10520027577877045, 0.09470903873443604, 0.09319207072257996, 0.1012139692902565 ], "n": 8 } }, "idea": { "mean": 0.09004521276801825, "std": 0.0046136095927630846, "per_seed": [ 0.08257821947336197, 0.08880516141653061, 0.09218183159828186, 0.09180948883295059, 0.0943688154220581, 0.08264964818954468, 0.09331666678190231, 0.09465187042951584 ], "n": 8, "cfg": { "lr": 0.001, "components": 3 } }, "comparison": { "delta_mean": -0.005414947867393494, "idea_wins": 6, "n_pairs": 8, "per_seed_diffs": [ -0.003094293177127838, 0.0041899532079696655, -0.006965942680835724, -0.00812094658613205, -0.010831460356712341, -0.012059390544891357, 0.00012459605932235718, -0.006562098860740662 ], "p_value": 0.0468, "mde": 0.004610854431296922, "mde_rel_pct": 4.830134791944282, "verdict": "idea better (significant)", "system_worked": true }, "mechanism_signature": { "mean_component_spread": 1.1394079849123955, "residual_excess_kurtosis": 1.5870434984444928, "prediction": "multimodal conditional transport has separated learned components", "confirmed": true }, "idea_sweep": [ { "mean": 0.09004521276801825, "std": 0.0046136095927630846, "per_seed": [ 0.08257821947336197, 0.08880516141653061, 0.09218183159828186, 0.09180948883295059, 0.0943688154220581, 0.08264964818954468, 0.09331666678190231, 0.09465187042951584 ], "n": 8, "cfg": { "lr": 0.001, "components": 3 } }, { "mean": 0.11219676397740841, "std": 0.012698939549116916, "per_seed": [ 0.10995763540267944, 0.10517711192369461, 0.10637346655130386, 0.10468488186597824, 0.1260760873556137, 0.09370528906583786, 0.11482667922973633, 0.13677296042442322 ], "n": 8, "cfg": { "lr": 0.003, "components": 3 } }, { "mean": 0.2344836015254259, "std": 0.07579298087152198, "per_seed": [ 0.21607452630996704, 0.25600194931030273, 0.2064877152442932, 0.16402755677700043, 0.15939156711101532, 0.41217851638793945, 0.263763964176178, 0.19794301688671112 ], "n": 8, "cfg": { "lr": 0.01, "components": 3 } } ], "math_check": { "normal_inverse_cdf_pit_sup_deviation": 0.006606725739433772, "expected_below": 0.02 }, "custom_track": { "name": "conditional_multitoken_diffusion", "file": "/home/maxwelhelp/all/math2nn/bench/custom_tracks/conditional_multitoken_diffusion.py", "domain": "diffusion-sampling" }, "protocol_notes": "Matched eight-token diffusion task; independently trained shared transformer backbone; identical test MSE readout; baseline and idea share lr union." }