{ "bench_version": 1, "track": "token_expert_sequence", "model": "mlp_tiny", "metric_direction": "lower is better", "n_seeds": 8, "baseline": { "best_cfg": { "lr": 0.01, "epochs": 25 }, "sweep": [ { "cfg": { "lr": 0.001, "epochs": 25 }, "mean": 0.0012499999720603228 }, { "cfg": { "lr": 0.003, "epochs": 25 }, "mean": 0.0012499999720603228 }, { "cfg": { "lr": 0.01, "epochs": 25 }, "mean": 0.0006249999860301614 } ], "full": { "mean": 0.0015624999650754035, "std": 0.0017399263244939971, "per_seed": [ 0.0, 0.0024999999441206455, 0.0, 0.0, 0.0024999999441206455, 0.0024999999441206455, 0.0, 0.004999999888241291 ], "n": 8 } }, "idea": { "mean": 0.4946874864399433, "std": 0.02705426452774727, "per_seed": [ 0.5399999618530273, 0.5024999976158142, 0.48499998450279236, 0.5049999952316284, 0.4449999928474426, 0.5199999809265137, 0.47999998927116394, 0.47999998927116394 ], "n": 8 }, "comparison": { "delta_mean": 0.4931249864748679, "idea_wins": 0, "n_pairs": 8, "per_seed_diffs": [ 0.5399999618530273, 0.49999999767169356, 0.48499998450279236, 0.5049999952316284, 0.442499992903322, 0.517499980982393, 0.47999998927116394, 0.47499998938292265 ], "p_value": 0.0081, "mde": 0.024702187634040935, "mde_rel_pct": 1580.9400439153835, "verdict": "idea worse (significant)", "system_worked": false }, "mechanism_signature": { "predicted_effect": "occupation mismatch decreases as reset_rate increases", "mismatch_at_r": NaN, "mismatch_at_r_0.5": NaN, "observed_cycle_proxy": NaN, "confirmed": false }, "idea_sweep": [ { "cfg": { "lr": 0.01, "epochs": 25, "r": 0.5 }, "result": { "mean": 0.4946874864399433, "std": 0.02705426452774727, "per_seed": [ 0.5399999618530273, 0.5024999976158142, 0.48499998450279236, 0.5049999952316284, 0.4449999928474426, 0.5199999809265137, 0.47999998927116394, 0.47999998927116394 ], "n": 8 } }, { "cfg": { "lr": 0.01, "epochs": 25, "r": 2.0 }, "result": { "mean": 0.4946874864399433, "std": 0.02705426452774727, "per_seed": [ 0.5399999618530273, 0.5024999976158142, 0.48499998450279236, 0.5049999952316284, 0.4449999928474426, 0.5199999809265137, 0.47999998927116394, 0.47999998927116394 ], "n": 8 } }, { "cfg": { "lr": 0.01, "epochs": 25, "r": 8.0 }, "result": { "mean": 0.4946874864399433, "std": 0.02705426452774727, "per_seed": [ 0.5399999618530273, 0.5024999976158142, 0.48499998450279236, 0.5049999952316284, 0.4449999928474426, 0.5199999809265137, 0.47999998927116394, 0.47999998927116394 ], "n": 8 } } ], "custom_track": { "name": "token_expert_sequence", "file": "/home/maxwelhelp/all/math2nn/bench/custom_tracks/token_expert_sequence.py", "domain": "moe-routing" } }