Conditioned PSD sensing bottleneck / report_bench_2026-08-31T222212.md
Failed on benchmark
Стенд-проверка (stage-2) · промт оператора:
(универсальный)
Ответ агента:
{ "worked": false, "confidence": 10, "verdict": "Implemented a matched sequence-track benchmark using a shared transformer-style encoder, comparing a dense bottleneck against the PSD sensing bottleneck with the quantile condition loss. The idea had substantially worse test MSE (0.9611 vs 0.2421; paired delta +0.7190; permutation p=0.0081), so it is a significant loss under the required criterion. The trained-model signature confirmed narrower q spread/better beta (1.54 vs 12.46) but did not confirm increased lower distortion, and this mechanism improvement did not translate into task performance.", "metrics": { "baseline": "Sequence transformer, dense bottleneck, best lr=0.006: mean test MSE 0.24213635176420212, std 0.041836180617489935; sweep means lr=0.001/0.003/0.006: 0.2674381099641323/0.2363879233598709/0.21260840073227882.", "idea": "Sequence PSD sensing bottleneck, lambda=0.03, best lr=0.006: mean test MSE 0.9611421003937721, std 0.2093114434157431; paired delta +0.71900574862957, 0/8 wins, permutation p=0.0081. Seed-0 signature: beta 1.5383 vs baseline 12.4596, L_q05 0.4970 vs 1.2279." }, "how_to_run": "/home/maxwelhelp/main/bin/python3 stage2_psd_bench.py", "files": [ "stage2_psd_bench.py", "bench_report.json" ], "bench_report": { "bench_version": 1, "track": "sequence", "model": "transformer_tiny", "metric_direction": "lower is better", "n_seeds": 8, "baseline": { "best_cfg": { "lr": 0.006 }, "sweep": [ { "cfg": { "lr": 0.001 }, "mean": 0.2674381099641323 }, { "cfg": { "lr": 0.003 }, "mean": 0.2363879233598709 }, { "cfg": { "lr": 0.006 }, "mean": 0.21260840073227882 } ], "full": { "mean": 0.24213635176420212, "std": 0.041836180617489935, "per_seed": [ 0.2506037950515747, 0.19614821672439575, 0.1921737939119339, 0.21150779724121094, 0.22115366160869598, 0.2778076231479645, 0.26815494894981384, 0.31954097747802734 ], "n": 8 } }, "idea": { "mean": 0.9611421003937721, "std": 0.2093114434157431, "per_seed": [ 1.337759017944336, 0.6684795022010803, 0.7549518346786499, 1.1353486776351929, 0.9210895895957947, 0.7781423926353455, 1.0609768629074097, 1.0323889255523682 ], "n": 8 }, "comparison": { "delta_mean": 0.71900574862957, "idea_wins": 0, "n_pairs": 8, "per_seed_diffs": [ 1.0871552228927612, 0.47233128547668457, 0.562778040766716, 0.9238408803939817, 0.6999359279870987, 0.500334769487381, 0.7928219139575958, 0.7128479480743408 ], "p_value": 0.0081, "mde": 0.17777273392901788, "mde_rel_pct": 73.41844073959494, "verdict": "idea worse (significant)", "system_worked": false }, "mechanism_signature": { "track_match": "multi-token sequence correlations", "signature": { "prediction": "conditioning should narrow q spread (lower beta) and raise lower distortion", "baseline_seed0": { "L_q05": 1.2279397010803224, "U_q95": 15.299684000015256, "beta": 12.45963786866312, "mean_q": 6.053372383117676 }, "idea_seed0": { "L_q05": 0.49697071909904483, "U_q95": 0.7644718140363693, "beta": 1.5382632912906329, "mean_q": 0.6344384551048279 }, "predicted_beta_direction": true, "predicted_L_direction": false, "confirmed": false }, "hyperparameters": { "epochs": 12, "m": 16, "d": 32, "lambda": 0.03, "idea_lr": 0.006 } } }, "limitations": "Only the built-in sequence track was tested; vision/CIFAR transfer, larger sensing widths, longer training, lambda sweeps, robustness metrics, and exact global PSD Lipschitz constants were not evaluated. The mechanism signature used one trained seed because the required primary comparison already used the full 8 paired seeds.", "system_verdict": "failed", "practical_verdict": "harms", "mechanism_ok": 0, "system_judged": true }