Sharp JL Hidden-State Bottleneck / report_bench_2026-09-01T135120.md

Failed on benchmark

Raw ⬇ ZIP

Стенд-проверка (stage-2) · промт оператора:

(универсальный)

Ответ агента:

{ "worked": false, "confidence": 9, "verdict": "The Sharp JL Hidden-State Bottleneck was implemented as a frozen Gaussian projection inside the matched sequence-level transformer and evaluated with the full 8-seed paired protocol. It slightly reduced mean test MSE, but the paired permutation test was not significant and the trained-model mechanism signature was not quantitatively confirmed. Therefore the benchmark does not establish a real win.", "metrics": { "baseline": "transformer_tiny sequence track; tuned lr=0.001, epochs=12; mean test MSE 0.45439932495355606 across 8 seeds.", "idea": "Frozen Gaussian JL bottleneck; epsilon=0.30, C=1, projected width r=18 versus d=64; best lr=0.003, epochs=12; mean test MSE 0.4479260928928852 across 8 seeds.", "paired_delta": "-0.006473232060670853; permutation p=0.66785; 5/8 idea wins." }, "bench_report": { "bench_version": 1, "track": "sequence", "model": "transformer_tiny", "metric_direction": "lower is better", "n_seeds": 8, "baseline": { "best_cfg": { "lr": 0.001, "epochs": 12 }, "sweep": [ { "cfg": { "lr": 0.001, "epochs": 12 }, "mean": 0.45439932495355606, "std": 0.04081052029431072, "per_seed": [ 0.4278562068939209, 0.3956301808357239, 0.46248915791511536, 0.49452289938926697, 0.44014036655426025, 0.4744090139865875, 0.5266208648681641, 0.41352590918540955 ], "n": 8 }, { "cfg": { "lr": 0.003, "epochs": 12 }, "mean": 0.5644181594252586, "std": 0.14529394471112436, "per_seed": [ 0.34822821617126465, 0.40346693992614746, 0.5700339674949646, 0.6492372751235962, 0.5649089813232422, 0.8078203201293945, 0.7059332728385925, 0.46571630239486694 ], "n": 8 }, { "cfg": { "lr": 0.01, "epochs": 12 }, "mean": 1.4830118492245674, "std": 0.6545389639796526, "per_seed": [ 1.843930959701538, 0.8628994822502136, 2.8634300231933594, 1.0775489807128906, 0.9952502250671387, 2.02944016456604, 1.1516919136047363, 1.0399030447006226 ], "n": 8 } ], "harness_tuning": { "best_cfg": { "lr": 0.001, "epochs": 12 }, "sweep": [ { "cfg": { "lr": 0.001, "epochs": 12 }, "mean": 0.4451246112585068 }, { "cfg": { "lr": 0.003, "epochs": 12 }, "mean": 0.4927415996789932 }, { "cfg": { "lr": 0.01, "epochs": 12 }, "mean": 1.6619523614645004 } ], "full": { "mean": 0.45439932495355606, "std": 0.04081052029431072, "per_seed": [ 0.4278562068939209, 0.3956301808357239, 0.46248915791511536, 0.49452289938926697, 0.44014036655426025, 0.4744090139865875, 0.5266208648681641, 0.41352590918540955 ], "n": 8 } }, "full": { "mean": 0.45439932495355606, "std": 0.04081052029431072, "per_seed": [ 0.4278562068939209, 0.3956301808357239, 0.46248915791511536, 0.49452289938926697, 0.44014036655426025, 0.4744090139865875, 0.5266208648681641, 0.41352590918540955 ], "n": 8 } }, "idea": { "per_seed": [ 0.42581823468208313, 0.38251447677612305, 0.3930129110813141, 0.535940408706665, 0.4686683118343353, 0.5054774880409241, 0.45862287282943726, 0.4133540391921997 ], "mean": 0.4479260928928852, "std": 0.0507216238042377, "n": 8 }, "comparison": { "delta_mean": -0.006473232060670853, "idea_wins": 5, "n_pairs": 8, "per_seed_diffs": [ -0.0020379722118377686, -0.01311570405960083, -0.06947624683380127, 0.04141750931739807, 0.028527945280075073, 0.031068474054336548, -0.0679979920387268, -0.00017186999320983887 ], "p_value": 0.66785, "mde": 0.03573610686518605, "mde_rel_pct": 7.864471820867829, "verdict": "no significant win", "system_worked": false }, "mechanism_signature": { "idea_sweep": [ { "cfg": { "lr": 0.001, "epochs": 12 }, "mean": 0.5554435513913631, "std": 0.030751056568709256, "per_seed": [ 0.5679726004600525, 0.48871538043022156, 0.5542747378349304, 0.5856391191482544, 0.56807941198349, 0.5934925079345703, 0.550084114074707, 0.535290539264679 ], "n": 8 }, { "cfg": { "lr": 0.003, "epochs": 12 }, "mean": 0.4479260928928852, "std": 0.0507216238042377, "per_seed": [ 0.42581823468208313, 0.38251447677612305, 0.3930129110813141, 0.535940408706665, 0.4686683118343353, 0.5054774880409241, 0.45862287282943726, 0.4133540391921997 ], "n": 8 }, { "cfg": { "lr": 0.01, "epochs": 12 }, "mean": 0.5642099156975746, "std": 0.06657952336519016, "per_seed": [ 0.571461021900177, 0.4690275490283966, 0.6746896505355835, 0.6299232840538025, 0.5943968296051025, 0.5776129961013794, 0.5029228329658508, 0.49364516139030457 ], "n": 8 } ], "mechanism_signature": { "prediction": "Gaussian JL fixed-pair distance ratio has mean near one and SD near 1/sqrt(2r)", "epsilon": 0.3, "constant": 1.0, "original_width": 64, "projected_width": 18, "raw_width_rule": 17.61272466516729, "trained_test_metric": 0.42581823468208313, "observed_ratio_mean": 1.1171250343322754, "observed_ratio_sd": 5.5652035371167585e-06, "predicted_ratio_mean": 1.0, "predicted_ratio_sd": 0.16666666666666666, "ratio_sd_observed_over_predicted": 3.339122122270055e-05, "p95_absolute_distortion": 0.11712539196014404, "confirmed": false }, "matched_structure": "sequence-level jointly processed windows/tokens" }, "custom_track": null }, "how_to_run": "/home/maxwelhelp/main/bin/python3 stage2_jl_bench.py", "files": [ "stage2_jl_bench.py", "bench_report.json", "stage2_run.log" ], "limitations": "Only the built-in sequence track was tested. The full protocol used 400 training and 200 test examples, epsilon=0.30 and C=1, and did not separately measure wall-clock throughput or activation memory. The observed signature used trained scalar-input token embeddings, which were nearly collinear and therefore did not provide a strong isotropic JL test.", "system_verdict": "failed", "practical_verdict": "no_effect", "mechanism_ok": 0, "system_judged": true }