Singular-Mode Phase-Transition Regularization Curriculum / report_bench_2026-09-02T225039.md
Mechanism confirmed, baseline not beaten
Стенд-проверка (stage-2) · промт оператора:
(универсальный)
Ответ агента:
{ "worked": false, "confidence": 9, "verdict": "The matched tabular Friedman regression benchmark was completed with an Adam weight-decay baseline sweep and a geometric beta curriculum using the same mlp_med architecture and equal training budget. The curriculum had a tiny lower mean MSE, but the paired permutation test was overwhelmingly non-significant (p=0.96975), so the idea did not win. The scalar-output track also makes the spectral signature trivially one-dimensional and cannot substantiate multi-mode rank growth.", "metrics": { "baseline": "lr=0.006, beta=0.002; full 8-seed mean MSE 6.4921753.", "idea": "lr=0.006, beta_start=0.005, beta_end=0.00005; full 8-seed mean MSE 6.4845741.", "delta_mean": -0.0076012015, "p_value": 0.96975 }, "bench_report": { "bench_version": 1, "track": "tabular", "model": "mlp_med", "metric_direction": "lower is better", "n_seeds": 8, "baseline": { "best_cfg": { "lr": 0.006, "beta": 0.002 }, "sweep": [ { "cfg": { "lr": 0.0015, "beta": 0.0 }, "mean": 7.332403898239136 }, { "cfg": { "lr": 0.0015, "beta": 0.002 }, "mean": 6.974947094917297 }, { "cfg": { "lr": 0.0015, "beta": 0.005 }, "mean": 6.950373411178589 }, { "cfg": { "lr": 0.0015, "beta": 0.01 }, "mean": 6.856605052947998 }, { "cfg": { "lr": 0.0015, "beta": 0.02 }, "mean": 6.820917129516602 }, { "cfg": { "lr": 0.003, "beta": 0.0 }, "mean": 6.740176439285278 }, { "cfg": { "lr": 0.003, "beta": 0.002 }, "mean": 6.5683335065841675 }, { "cfg": { "lr": 0.003, "beta": 0.005 }, "mean": 6.506619572639465 }, { "cfg": { "lr": 0.003, "beta": 0.01 }, "mean": 6.451507329940796 }, { "cfg": { "lr": 0.003, "beta": 0.02 }, "mean": 6.507548213005066 }, { "cfg": { "lr": 0.006, "beta": 0.0 }, "mean": 6.459080219268799 }, { "cfg": { "lr": 0.006, "beta": 0.002 }, "mean": 6.255969762802124 }, { "cfg": { "lr": 0.006, "beta": 0.005 }, "mean": 6.3951462507247925 }, { "cfg": { "lr": 0.006, "beta": 0.01 }, "mean": 6.444561243057251 }, { "cfg": { "lr": 0.006, "beta": 0.02 }, "mean": 6.318377375602722 } ], "full": { "mean": 6.492175281047821, "std": 0.4696585684033177, "per_seed": [ 5.431238651275635, 6.641201019287109, 6.379562854766846, 6.571876525878906, 6.9486002922058105, 6.291627407073975, 6.600069522857666, 7.073225975036621 ], "n": 8 } }, "idea": { "mean": 6.48457407951355, "std": 0.4566508873984473, "per_seed": [ 5.4823994636535645, 6.262659549713135, 6.524853229522705, 6.588247776031494, 6.916043758392334, 6.340798377990723, 6.678991317749023, 7.08259916305542 ], "n": 8, "best_cfg": { "lr": 0.006, "beta_start": 0.005, "beta_end": 5e-05 } }, "comparison": { "delta_mean": -0.00760120153427124, "idea_wins": 2, "n_pairs": 8, "per_seed_diffs": [ 0.05116081237792969, -0.3785414695739746, 0.14529037475585938, 0.01637125015258789, -0.03255653381347656, 0.04917097091674805, 0.07892179489135742, 0.009373188018798828 ], "p_value": 0.96975, "mde": 0.1328181829200986, "mde_rel_pct": 2.045819423696491, "verdict": "no measurable effect", "system_worked": false }, "math_check": { "predicted_exponent": 1.3333333333333333, "observed_exponent": 1.3333333333333335, "median_relative_boundary_error": 0.30000000000000004, "pass": false }, "idea_sweep": { "configs": [ { "lr": 0.0015, "beta_start": 0.02, "beta_end": 0.0002 }, { "lr": 0.003, "beta_start": 0.01, "beta_end": 0.0001 }, { "lr": 0.006, "beta_start": 0.005, "beta_end": 5e-05 } ], "selected": { "lr": 0.006, "beta_start": 0.005, "beta_end": 5e-05 } }, "budget": { "epochs": 12, "batch": 128, "train_samples": 1200 }, "mechanism_signature": { "kind": "trained_end_to_end_spectrum_vs_crosscov", "measurements": [ { "epoch": 1, "beta": 0.005, "teacher_crosscov_singular_values": [ 1.3328860998153687 ], "end_to_end_singular_values": [ 8.559873580932617 ], "predicted_active_count": 1, "observed_active_count": 1 }, { "epoch": 7, "beta": 0.0004055654153948436, "teacher_crosscov_singular_values": [ 1.3328860998153687 ], "end_to_end_singular_values": [ 18.78715705871582 ], "predicted_active_count": 1, "observed_active_count": 1 }, { "epoch": 12, "beta": 5e-05, "teacher_crosscov_singular_values": [ 1.3328860998153687 ], "end_to_end_singular_values": [ 21.196590423583984 ], "predicted_active_count": 1, "observed_active_count": 1 } ], "confirmed": true, "note": "Agreement is trivial for scalar output and is not evidence of multi-mode phase-transition behaviour." } }, "how_to_run": "/home/maxwelhelp/main/bin/python3 stage2_bench.py", "files": [ "stage2_bench.py", "bench_report.json" ], "limitations": "Only the built-in tabular track was tested. Its scalar regression output cannot test meaningful multi-mode singular rank growth. No vision, sequence, dynamics, or custom multi-output track was run; no wall-clock or FLOP-normalized comparison was measured. The coarse mathematical boundary scan had 30% median relative discretization error, so its exponent matched but its boundary check did not pass.", "system_verdict": "partial", "practical_verdict": "no_effect", "mechanism_ok": 1, "system_judged": true }