r-Deformed Power Divergence Loss / report_bench_2026-09-04T001403.md

Mechanism confirmed, baseline not beaten

Raw ⬇ ZIP

Стенд-проверка (stage-2) · промт оператора:

(универсальный)

Ответ агента:

{ "worked": false, "confidence": 9, "verdict": "The r-deformed alpha-divergence loss was implemented and tested end-to-end against cross-entropy with matched cnn_small models, paired seeds, and a shared learning-rate grid. The idea had higher mean test error (0.785625 versus 0.7653125), paired delta +0.0203125, and permutation p=0.17155, so it did not produce a significant win. Its trained-model gradient-norm variance was lower (0.4867 versus 3.6030), confirming the auxiliary mechanism signal without improving the primary metric.", "metrics": { "baseline": "mean test error 0.7653125; best lr=0.0015; 8 paired seeds", "idea": "mean test error 0.7856250; alpha=0.5, r=0, best lr=0.003; paired delta +0.0203125; p=0.17155" }, "how_to_run": "/home/maxwelhelp/main/bin/python3 bench_run.py", "files": [ "bench_run.py", "bench_report.json" ], "limitations": "Only the 400-example CIFAR-10 subset, 8 epochs, alpha=0.5, and r=0 were tested. Longer training, broader alpha/r sweeps, label smoothing, calibration, and full CIFAR-10/ResNet-18 were not tested.", "bench_report": { "bench_version": 1, "track": "vision", "model": "cnn_small", "metric_direction": "lower is better", "n_seeds": 8, "baseline": { "best_cfg": { "lr": 0.0015 }, "sweep": [ { "cfg": { "lr": 0.0015 }, "mean": 0.75125 }, { "cfg": { "lr": 0.003 }, "mean": 0.75375 }, { "cfg": { "lr": 0.006 }, "mean": 0.878125 } ], "full": { "mean": 0.7653125, "std": 0.0351434, "per_seed": [ 0.735, 0.7825, 0.78, 0.7075, 0.8325, 0.77, 0.7425, 0.7725 ], "n": 8 } }, "idea": { "best_cfg": { "lr": 0.003 }, "sweep": [ { "cfg": { "lr": 0.0015 }, "mean": 0.778125 }, { "cfg": { "lr": 0.003 }, "mean": 0.77375 }, { "cfg": { "lr": 0.006 }, "mean": 0.79375 } ], "mean": 0.785625, "std": 0.0299935, "per_seed": [ 0.77, 0.8375, 0.7375, 0.75, 0.7975, 0.7975, 0.805, 0.79 ], "n": 8 }, "comparison": { "delta_mean": 0.0203125, "idea_wins": 2, "n_pairs": 8, "per_seed_diffs": [ 0.035, 0.055, -0.0425, 0.0425, -0.035, 0.0275, 0.0625, 0.0175 ], "p_value": 0.17155, "verdict": "no significant win", "system_worked": false }, "mechanism_signature": { "baseline_target_event_prob": 0.1488836, "idea_target_event_prob": 0.1699263, "observed_baseline_grad_var": 3.6030464, "observed_idea_grad_var": 0.4867484, "confirmed": true } }, "system_verdict": "partial", "practical_verdict": "inconclusive", "mechanism_ok": 1, "system_judged": true }