# Стенд-проверка (stage-2) · промт оператора: (универсальный) Ответ агента: { "worked": false, "confidence": 10, "verdict": "The registered PDE benchmark completed successfully on `poisson_boundary` with 8 paired seeds. The exact ReLU-power potential mechanism was confirmed by trained-model behavior (observed curl RMS 1.15e-7 versus predicted 0), but the idea was significantly worse on the independent task metric: MSE delta +0.02630 and permutation p=0.0081.", "metrics": { "baseline": "Best lr=0.03; test MSE mean 0.0109364952", "idea": "Best lr=0.03; test MSE mean 0.0372408738; paired delta +0.0263043786; permutation p=0.0081" }, "bench_report": { "bench_version": 1, "track": "poisson_boundary", "model": "scalar_potential_backbone", "metric_direction": "lower is better", "n_seeds": 8, "baseline": { "best_cfg": { "lr": 0.03 }, "sweep": [ { "cfg": { "lr": 0.003 }, "mean": 0.12233347818255424 }, { "cfg": { "lr": 0.01 }, "mean": 0.05105730285868049 }, { "cfg": { "lr": 0.03 }, "mean": 0.009451728663407266 } ], "full": { "mean": 0.01093649520771578, "std": 0.003025037049171694, "per_seed": [ 0.00799343828111887, 0.006817351561039686, 0.010449049063026905, 0.012547075748443604, 0.008240480907261372, 0.011241904459893703, 0.01626167818903923, 0.013940983451902866 ], "n": 8 } }, "idea": { "mean": 0.03724087378941476, "std": 0.012178382868521676, "per_seed": [ 0.030537452548742294, 0.06148594617843628, 0.022630251944065094, 0.05179433524608612, 0.032382115721702576, 0.02730206958949566, 0.03700961917638779, 0.0347851999104023 ], "n": 8 }, "comparison": { "delta_mean": 0.026304378581698984, "idea_wins": 0, "n_pairs": 8, "per_seed_diffs": [ 0.022544014267623425, 0.05466859461739659, 0.012181202881038189, 0.03924725949764252, 0.024141634814441204, 0.016060165129601955, 0.020747940987348557, 0.02084421645849943 ], "p_value": 0.0081, "mde": 0.01163752387239483, "mde_rel_pct": 106.40999379933409, "verdict": "idea worse (significant)", "system_worked": false }, "mechanism_signature": { "stage1_prediction": "d squared equals zero for the learned potential gradient", "baseline_gradient_curl_rms": 1.36577753551137e-07, "predicted_gradient_curl_rms": 0.0, "observed_gradient_curl_rms": 1.154990201257533e-07, "n_probe": 128, "confirmed": true, "idea_sweep": [ { "cfg": { "lr": 0.003 }, "result": { "mean": 0.11393675301223993, "std": 0.01067011604185375, "per_seed": [ 0.11674976348876953, 0.11242678761482239, 0.09828850626945496, 0.12337931990623474, 0.13426120579242706, 0.11549603939056396, 0.10730288922786713, 0.1035895124077797 ], "n": 8 } }, { "cfg": { "lr": 0.01 }, "result": { "mean": 0.08499461971223354, "std": 0.00870385202148945, "per_seed": [ 0.07853147387504578, 0.0928913876414299, 0.07291875034570694, 0.09869463741779327, 0.09521957486867905, 0.08183202892541885, 0.08108515292406082, 0.07878395169973373 ], "n": 8 } }, { "cfg": { "lr": 0.03 }, "result": { "mean": 0.03724087378941476, "std": 0.012178382868521676, "per_seed": [ 0.030537452548742294, 0.06148594617843628, 0.022630251944065094, 0.05179433524608612, 0.032382115721702576, 0.02730206958949566, 0.009091251529753208, 0.0013353731483221054 ], "n": 8 } } ], "math_check": { "nilpotence_max_abs": 0.0, "derivative_identity_max_abs": 0.0 } }, "custom_track": { "name": "poisson_boundary", "domain": "pde", "file": "bench/custom_tracks/poisson_boundary.py" } }, "how_to_run": "/home/maxwelhelp/main/bin/python3 run_bench_registered.py", "files": [ "run_bench_registered.py", "bench_report_registered.json", "custom_exact_gradient_track.py" ], "limitations": "The registered task is supervised Poisson boundary-value regression rather than explicit PDE collocation with separate interior and boundary residual losses. Higher-form divergence-free experiments, conditioning/eigenmode counts, broader feature-count sweeps, and larger datasets were not tested.", "system_verdict": "partial", "practical_verdict": "harms", "mechanism_ok": 1, "system_judged": true }