Confidence-Tested LoRA Pruning / report_bench_2026-08-31T125725.md

Failed on benchmark

Raw ⬇ ZIP

Стенд-проверка (stage-2) · промт оператора:

(универсальный)

Ответ агента:

{ "worked": false, "confidence": 10, "verdict": "Implemented Confidence-Tested LoRA Pruning on the registered tabular track with matched factorized MLP systems, shared learning-rate sweep, and 8 paired seeds. The idea had slightly lower MSE, 16.3194694519 versus 16.3272285461, but delta_mean was -0.0077590942 with permutation p=1.0, so make_report returned no measurable effect. The model-scale mechanism signature was not confirmed because predicted retained gradient contribution and observed held-out response differed substantially.", "metrics": { "baseline": "Best lr=0.006; 8-seed MSE mean 16.3272285461, std 0.9077895065", "idea": "Best lr=0.006, delta_fraction=0.5; 8-seed MSE mean 16.3194694519, std 0.9038104755", "comparison": "delta_mean=-0.0077590942, p_value=1.0, 1/8 paired wins", "mechanism_signature": "predicted=42.2141962051, observed=0.8568963706, confirmed=false" }, "bench_report": { "bench_version": 1, "track": "tabular", "model": "mlp_tiny_factorized_first_layer", "metric_direction": "lower is better", "n_seeds": 8, "baseline": { "best_cfg": { "lr": 0.006, "delta_fraction": 0.0 }, "sweep": [ { "cfg": { "lr": 0.001, "delta_fraction": 0.0 }, "mean": 205.01904678344727 }, { "cfg": { "lr": 0.003, "delta_fraction": 0.0 }, "mean": 18.50063133239746 }, { "cfg": { "lr": 0.006, "delta_fraction": 0.0 }, "mean": 16.618733406066895 } ], "full": { "mean": 16.327228546142578, "std": 0.907789506476808, "per_seed": [ 17.471485137939453, 15.701416015625, 16.48313331604004, 16.818899154663086, 16.06818199157715, 17.633129119873047, 15.67065715789795, 14.770926475524902 ], "n": 8 } }, "idea": { "mean": 16.319469451904297, "std": 0.9038104755432905, "per_seed": [ 17.471485137939453, 15.701416015625, 16.48313331604004, 16.756826400756836, 16.06818199157715, 17.633129119873047, 15.67065715789795, 14.770926475524902 ], "n": 8 }, "comparison": { "delta_mean": -0.00775909423828125, "idea_wins": 1, "n_pairs": 8, "per_seed_diffs": [ 0.0, 0.0, 0.0, -0.06207275390625, 0.0, 0.0, 0.0, 0.0 ], "p_value": 1.0, "mde": 0.018350257873535156, "mde_rel_pct": 0.11239052495452775, "verdict": "no measurable effect", "system_worked": false }, "mechanism_signature": { "predicted_quantity": "sum of retained rank-one gradient contributions at pruning", "observed_quantity": "sum of retained rank-one absolute responses on held-out inputs", "predicted_example": 42.21419620513916, "observed_example": 0.8568963706493378, "confirmed": false }, "idea_sweep": [ { "cfg": { "lr": 0.001, "delta_fraction": 0.15 }, "mean": 204.1529769897461 }, { "cfg": { "lr": 0.001, "delta_fraction": 0.25 }, "mean": 204.1529769897461 }, { "cfg": { "lr": 0.001, "delta_fraction": 0.5 }, "mean": 204.1120777130127 }, { "cfg": { "lr": 0.003, "delta_fraction": 0.15 }, "mean": 19.105027437210083 }, { "cfg": { "lr": 0.003, "delta_fraction": 0.25 }, "mean": 19.105027437210083 }, { "cfg": { "lr": 0.003, "delta_fraction": 0.5 }, "mean": 19.07418918609619 }, { "cfg": { "lr": 0.006, "delta_fraction": 0.15 }, "mean": 16.34427547454834 }, { "cfg": { "lr": 0.006, "delta_fraction": 0.25 }, "mean": 16.34427547454834 }, { "cfg": { "lr": 0.006, "delta_fraction": 0.5 }, "mean": 16.319469451904297 } ] }, "how_to_run": "/home/maxwelhelp/main/bin/python3 official_bench.py", "files": [ "official_bench.py", "bench_report.json", "official_bench_stdout.txt" ], "limitations": "Only the structurally appropriate registered tabular track was tested. The implementation uses a small factorized MLP rather than a transformer LoRA model; no vision, sequence, or dynamics tracks were run. The signature comparison is a practical proxy and was explicitly not confirmed.", "system_verdict": "failed", "practical_verdict": "no_effect", "mechanism_ok": 0, "system_judged": true }