Adjoint-Weak Fractional Residuals / report_bench_2026-09-01T132726.md
Mechanism confirmed, baseline not beaten
Стенд-проверка (stage-2) · промт оператора:
(универсальный)
Ответ агента:
{ "worked": false, "confidence": 9, "verdict": "Implemented adjoint-weak fractional residual training on the registered dynamics track with the shared rnn_small architecture and identical 8-seed, 16-epoch budgets. The tuned baseline achieved mean test MSE 0.0006985420 at lr=0.01, while the idea achieved 0.0007022070 at lr=0.01, for paired delta_mean +3.66498e-06 and permutation p=0.52365. The trained-model mechanism signature was confirmed directionally (weak correlation 0.9372 versus strong correlation 0.7030), but the idea did not produce a significant task-metric win.", "metrics": { "baseline": "Registered dynamics/rnn_small; lr sweep {0.001, 0.003, 0.01}; best lr=0.01; 8-seed mean test MSE=0.0006985420404816978, std=0.00016862358035770679.", "idea": "Adjoint-weak residual with alpha=0.8; same registered dynamics/rnn_small model, paired seeds, epochs, and shared lr sweep; best lr=0.01; 8-seed mean test MSE=0.0007022070203674957, std=0.00016781088891265367.", "paired_delta_mean": 3.6649798857979476e-06, "permutation_p_value": 0.52365 }, "bench_report": { "bench_version": 1, "track": "dynamics", "model": "rnn_small", "metric_direction": "lower is better", "n_seeds": 8, "baseline": { "best_hyperparams": { "lr": 0.01, "epochs": 16 }, "sweep": [ { "lr": 0.001, "seed": 0, "mse": 0.0016373801045119762 }, { "lr": 0.001, "seed": 1, "mse": 0.0020086602307856083 }, { "lr": 0.001, "seed": 2, "mse": 0.001998279709368944 }, { "lr": 0.001, "seed": 3, "mse": 0.0037652531173080206 }, { "lr": 0.001, "seed": 4, "mse": 0.002077344572171569 }, { "lr": 0.001, "seed": 5, "mse": 0.002141711302101612 }, { "lr": 0.001, "seed": 6, "mse": 0.0035790614783763885 }, { "lr": 0.001, "seed": 7, "mse": 0.00521521782502532 }, { "lr": 0.003, "seed": 0, "mse": 0.0012488373322412372 }, { "lr": 0.003, "seed": 1, "mse": 0.0012570498511195183 }, { "lr": 0.003, "seed": 2, "mse": 0.0009830091148614883 }, { "lr": 0.003, "seed": 3, "mse": 0.0018271016888320446 }, { "lr": 0.003, "seed": 4, "mse": 0.0011851947056129575 }, { "lr": 0.003, "seed": 5, "mse": 0.0011170521611347795 }, { "lr": 0.003, "seed": 6, "mse": 0.0019040972692891955 }, { "lr": 0.003, "seed": 7, "mse": 0.0017286647344008088 }, { "lr": 0.01, "seed": 0, "mse": 0.0005306488601490855 }, { "lr": 0.01, "seed": 1, "mse": 0.0006936120917089283 }, { "lr": 0.01, "seed": 2, "mse": 0.0006226884433999658 }, { "lr": 0.01, "seed": 3, "mse": 0.0011054250644519925 }, { "lr": 0.01, "seed": 4, "mse": 0.0005887902225367725 }, { "lr": 0.01, "seed": 5, "mse": 0.0005850467132404447 }, { "lr": 0.01, "seed": 6, "mse": 0.000752387335523963 }, { "lr": 0.01, "seed": 7, "mse": 0.0007097375928424299 } ], "full": { "per_seed": [ 0.0005306488601490855, 0.0006936120917089283, 0.0006226884433999658, 0.0011054250644519925, 0.0005887902225367725, 0.0005850467132404447, 0.000752387335523963, 0.0007097375928424299 ], "mean": 0.0006985420404816978, "std": 0.00016862358035770679 } }, "idea": { "best_hyperparams": { "lr": 0.01, "alpha": 0.8, "epochs": 16 }, "sweep_lrs": [ 0.001, 0.003, 0.01 ], "per_seed": [ 0.0005385181866586208, 0.0007211403572000563, 0.000598620914388448, 0.001104937051422894, 0.000581878877710551, 0.0006115676951594651, 0.0007518851780332625, 0.000709107902366668 ], "mean": 0.0007022070203674957, "std": 0.00016781088891265367 }, "comparison": { "delta_mean": 3.6649798857979476e-06, "idea_wins": 5, "n_pairs": 8, "per_seed_diffs": [ 7.869326509535313e-06, 2.7528265491127968e-05, -2.4067529011517763e-05, -4.880130290985107e-07, -6.911344826221466e-06, 2.652098191902041e-05, -5.021574907004833e-07, -6.29690475618904e-07 ], "p_value": 0.52365, "mde": 1.4286583621037655e-05, "mde_rel_pct": 2.0452002592794516, "verdict": "no measurable effect", "system_worked": false }, "mechanism_signature": { "trained_model_behavior": { "mean_weak_prediction_correlation": 0.9371926834185919, "mean_strong_prediction_correlation": 0.7029504552483559 }, "prediction": "weak residual should couple to trajectory while reducing derivative noise amplification", "confirmed": true } }, "how_to_run": "/home/maxwelhelp/main/bin/python3 stage2_bench.py", "files": [ "stage2_bench.py", "bench_report.json" ], "limitations": "Only the registered built-in actuated-pendulum dynamics track was tested. No fractional-PDE custom track, explicit noisy-observation sweep, larger model/data regime, rollout metric beyond harness MSE, FLOP/speed comparison, or alpha sweep beyond the fixed alpha=0.8 idea setting was evaluated.", "system_verdict": "partial", "practical_verdict": "no_effect", "mechanism_ok": 1, "system_judged": true }