Epoch-Frozen Masked Low-Rank Candidate Encoder / report_bench_2026-09-04T204320.md

✓✓ Beats tuned baseline

Raw ⬇ ZIP

Стенд-проверка (stage-2) · промт оператора:

(универсальный)

Ответ агента:

{ "worked": true, "confidence": 8, "verdict": "Implemented the epoch-frozen masked low-rank candidate encoder and evaluated it end-to-end against zero-imputed ambient features on a structurally matched custom retrieval regression track. Across 8 paired seeds, the idea achieved MSE 0.048654 versus baseline 0.545000, with all 8 paired wins and permutation p=0.0081. The measured first-layer parameter ratio was 0.06977, matching the predicted complexity ratio, so the mechanism signature was confirmed.", "metrics": { "baseline": "Zero-imputed ambient MLP, best swept lr=0.001: test MSE mean 0.5450004563, std 0.2628610195.", "idea": "Epoch-frozen inverse-probability covariance PCA with rank 8 and ridge masked encoding, best swept lr=0.006: test MSE mean 0.0486544219, std 0.0216828888; observed first-layer parameter ratio 0.0697674." }, "how_to_run": "/home/maxwelhelp/main/bin/python3 bench_runner.py", "files": [ "custom_candidate_track.py", "bench_runner.py", "bench_report.json" ], "limitations": "The experiment used a custom synthetic retrieval regression track with d=128, latent rank 8, fixed p=0.5, 400 training examples, 400 test examples, and 25 epochs. It did not test MovieLens, NDCG, varying missingness or rank, deployed wall-clock latency, cache memory, or the built-in tracks. Complexity is reported as a parameter/FLOP proxy rather than hardware timing.", "bench_report": { "bench_version": 1, "track": "bench_custom_masked_candidate_low_rank", "model": "mlp_tiny", "metric_direction": "lower is better", "n_seeds": 8, "baseline": { "best_cfg": { "lr": 0.001 }, "sweep": [ { "cfg": { "lr": 0.001 }, "mean": 0.4420415982604027 }, { "cfg": { "lr": 0.003 }, "mean": 0.44252580031752586 }, { "cfg": { "lr": 0.006 }, "mean": 0.4765854626893997 } ], "full": { "mean": 0.5450004562735558, "std": 0.2628610195034815, "per_seed": [ 0.7630048990249634, 0.5563264489173889, 0.2823181748390198, 0.16651687026023865, 1.0170692205429077, 0.555262565612793, 0.32614681124687195, 0.6933586597442627 ], "n": 8 } }, "idea": { "mean": 0.048654421931132674, "std": 0.02168288877569749, "per_seed": [ 0.06334998458623886, 0.05048277601599693, 0.03009387105703354, 0.021304024383425713, 0.09369651228189468, 0.040802765637636185, 0.031937580555677414, 0.057567860931158066 ], "n": 8 }, "comparison": { "delta_mean": -0.4963460343424231, "idea_wins": 8, "n_pairs": 8, "per_seed_diffs": [ -0.6996549144387245, -0.505843672901392, -0.25222430378198624, -0.14521284587681293, -0.923372708261013, -0.5144597999751568, -0.29420923069119453, -0.6357907988131046 ], "p_value": 0.0081, "mde": 0.21604011474214413, "mde_rel_pct": 39.64035483920873, "verdict": "idea better (significant)", "system_worked": true }, "custom_track": { "name": "masked_candidate_low_rank", "file": "custom_candidate_track.py", "domain": "retrieval" }, "idea_sweep": [ { "cfg": { "lr": 0.001 }, "result": { "mean": 0.20586615707725286, "std": 0.14904708404374148, "per_seed": [ 0.2456769198179245, 0.2300177961587906, 0.06836631894111633, 0.07623686641454697, 0.5616698265075684, 0.1149023026227951, 0.13585276901721954, 0.21420645713806152 ], "n": 8 } }, { "cfg": { "lr": 0.003 }, "result": { "mean": 0.05824449914507568, "std": 0.02563097931151917, "per_seed": [ 0.07524535804986954, 0.06290170550346375, 0.03489440307021141, 0.025365130975842476, 0.11273353546857834, 0.04778952896595001, 0.04362767934799194, 0.06339865177869797 ], "n": 8 } }, { "cfg": { "lr": 0.006 }, "result": { "mean": 0.048654421931132674, "std": 0.02168288877569749, "per_seed": [ 0.06334998458623886, 0.05048277601599693, 0.03009387105703354, 0.021304024383425713, 0.09369651228189468, 0.040802765637636185, 0.031937580555677414, 0.057567860931158066 ], "n": 8 } } ], "mechanism_signature": { "predicted_flop_ratio": 0.06976744186046512, "observed_first_layer_param_ratio": 0.06976744186046512, "observed_test_prediction_std": 2.4757130444049835, "target_std": 2.446375161409378, "reconstruction_relative_error": 0.1594924950357648, "confirmed": true }, "track_rationale": "Custom track is structurally required because the built-in tracks do not contain masked high-dimensional candidate vectors generated from a low-rank action-feature subspace." }, "system_verdict": "worked", "practical_verdict": "helps", "mechanism_ok": 1, "system_judged": true }