Age-conditioned semi-Markov router / report_bench_2026-09-04T181232.md
Failed on benchmark
Стенд-проверка (stage-2) · промт оператора:
(универсальный)
Ответ агента:
{ "worked": false, "confidence": 9, "verdict": "Implemented an end-to-end age-conditioned semi-Markov recurrent expert router on the structurally matched sequence forecasting track, with identical trained architecture and data for baseline and idea systems. The tuned baseline achieved test MSE 1.04138 versus 1.05074 for the idea; paired delta was +0.00935 with permutation p=0.3073, so there is no significant improvement. The trained-model signature also failed confirmation: mean predicted hazard was 0.5709, mean age 0.9239, and the measured trace-change proxy was 0.00972.", "metrics": { "baseline": "sequence/transformer_tiny label: tuned lr=0.01, temperature=0.8; full 8-seed mean test MSE 1.0413843393, std 0.0757906863; per-seed [1.0304178, 0.8935724, 1.0985037, 1.0838863, 0.9647194, 1.0631779, 1.1534550, 1.0433422]", "idea": "best hazard-conditioned setting lr=0.01, temperature=0.8, hazard_bias=0.0; full 8-seed mean test MSE 1.0507365465, std 0.0798404275; per-seed [1.0360348, 0.9041899, 1.1562473, 1.0952754, 0.9761891, 1.0409249, 1.1531434, 1.0438876]", "delta_mean": 0.0093522072, "p_value": 0.3073, "idea_wins": 2, "n_pairs": 8 }, "how_to_run": "/home/maxwelhelp/main/bin/python3 stage2_age_router_bench.py", "files": [ "stage2_age_router_bench.py", "bench_report.json", "bench_run.log" ], "limitations": "The experiment used a reduced local budget of 400 training samples, 200 test samples, 3 epochs, two experts, and hidden width 16 after the initial larger run exceeded 40 minutes. It did not test WikiText-2, a discrete stochastic router, actual FLOP/router-call savings, expert-load entropy, or longer training. The mechanism signature's observed trace-change proxy is not a direct empirical switch count, and its confirmed field is false.", "bench_report": { "bench_version": 1, "track": "sequence", "model": "transformer_tiny", "metric_direction": "lower is better", "n_seeds": 8, "baseline": { "best_cfg": { "lr": 0.01, "temperature": 0.8, "hazard_bias": 0.0 }, "sweep": [ { "cfg": { "lr": 0.001, "temperature": 0.8, "hazard_bias": 0.0 }, "mean": 1.0667133182 }, { "cfg": { "lr": 0.001, "temperature": 1.2, "hazard_bias": 0.0 }, "mean": 1.0630156696 }, { "cfg": { "lr": 0.003, "temperature": 0.8, "hazard_bias": 0.0 }, "mean": 1.0755150914 }, { "cfg": { "lr": 0.003, "temperature": 1.2, "hazard_bias": 0.0 }, "mean": 1.0769807696 }, { "cfg": { "lr": 0.01, "temperature": 0.8, "hazard_bias": 0.0 }, "mean": 1.0265950412 }, { "cfg": { "lr": 0.01, "temperature": 1.2, "hazard_bias": 0.0 }, "mean": 1.0694856495 } ], "full": { "mean": 1.0413843393, "std": 0.0757906863, "per_seed": [ 1.0304178, 0.8935724, 1.0985037, 1.0838863, 0.9647194, 1.0631779, 1.153455, 1.0433422 ], "n": 8 } }, "idea": { "mean": 1.0507365465, "std": 0.0798404275, "per_seed": [ 1.0360348, 0.9041899, 1.1562473, 1.0952754, 0.9761891, 1.0409249, 1.1531434, 1.0438876 ], "n": 8, "chosen_cfg": { "lr": 0.01, "temperature": 0.8, "hazard_bias": 0.0 }, "sweep": [ { "cfg": { "lr": 0.01, "temperature": 0.8, "hazard_bias": -1.0 }, "result": { "mean": 1.0596621186, "per_seed": [ 1.0716879, 0.9170375, 1.1360781, 1.1125484, 0.9964454, 1.0290952, 1.1560775, 1.058327 ] } }, { "cfg": { "lr": 0.01, "temperature": 0.8, "hazard_bias": 0.0 }, "result": { "mean": 1.0507365465, "per_seed": [ 1.0360348, 0.9041899, 1.1562473, 1.0952754, 0.9761891, 1.0409249, 1.1531434, 1.0438876 ] } }, { "cfg": { "lr": 0.01, "temperature": 0.8, "hazard_bias": 1.0 }, "result": { "mean": 1.062816374, "per_seed": [ 1.0399799, 0.9146119, 1.1155239, 1.1016066, 1.023986, 1.0964357, 1.1542213, 1.0561657 ] } } ] }, "comparison": { "delta_mean": 0.0093522072, "idea_wins": 2, "n_pairs": 8, "per_seed_diffs": [ 0.005617, 0.0106175, 0.0577435, 0.0113891, 0.0114697, -0.022253, -0.0003116, 0.0005454 ], "p_value": 0.3073, "mde": 0.0187922082, "mde_rel_pct": 1.8045411, "verdict": "no measurable effect", "system_worked": false }, "mechanism_signature": { "predicted_mean_hazard": 0.5708998311, "observed_trace_change": 0.0097163464, "predicted_vs_observed_ratio": 58.75663646, "age_mean": 0.9239334501, "confirmed": false } }, "system_verdict": "failed", "practical_verdict": "no_effect", "mechanism_ok": 0, "system_judged": true }