Komuro Time-Warp Expansivity Regularizer / report_bench_2026-08-31T201603.md

Mechanism confirmed, baseline not beaten

Raw ⬇ ZIP

Стенд-проверка (stage-2) · промт оператора:

(универсальный)

Ответ агента:

{ "worked": false, "confidence": 9, "verdict": "Built the Komuro time-warp expansivity regularizer as a training-loss modification for the structurally matched dynamics track using the shared rnn_small GRU. The mechanism signature was confirmed quantitatively: warped hidden-trajectory discrepancy fell 4.56% (1.6830 to 1.6063), but test MSE worsened from 2.2823e-5 to 2.4673e-5; the paired permutation p-value was 0.07535, so there was no significant win.", "metrics": { "baseline": "Best lr=0.006; full 8-seed test MSE mean 2.282289460708853e-05, std 2.305330446600017e-06", "idea": "Best lr=0.006, lambda=0.03, margin=0.25; full 8-seed test MSE mean 2.467335889377864e-05, std 3.053583916547981e-06", "paired_delta": "1.8504642866901122e-06 (idea worse; 2/8 per-seed wins)", "permutation_p_value": 0.07535, "mechanism_signature": "ordinary hidden D=1.6830359101295471, warped hidden D=1.6062670052051544, relative reduction=0.04561334934231065, confirmed=true" }, "how_to_run": "/home/maxwelhelp/main/bin/python3 bench_komuro.py", "files": [ "bench_komuro.py", "bench_report.json" ], "limitations": "The built-in dynamics track provides flattened pendulum windows rather than explicit irregularly sampled or clock-speed-perturbed trajectory pairs, so the regularizer uses shuffled windows and restricted affine monotone slopes (0.75, 1.0, 1.3333333) as a proxy. No nonlinear warp family, neural ODE integration, long-horizon rollout metric, runtime/FLOP comparison, or larger-scale model was tested.", "bench_report": { "bench_version": 1, "track": "dynamics", "model": "rnn_small", "metric_direction": "lower is better", "n_seeds": 8, "baseline": { "best_cfg": { "lr": 0.006, "weight_decay": 0.0 }, "sweep": [ { "cfg": { "lr": 0.001, "weight_decay": 0.0 }, "mean": 0.0005152521189302206 }, { "cfg": { "lr": 0.003, "weight_decay": 0.0 }, "mean": 4.9621185098658316e-05 }, { "cfg": { "lr": 0.006, "weight_decay": 0.0 }, "mean": 2.345215943932999e-05 } ], "full": { "mean": 2.282289460708853e-05, "std": 2.305330446600017e-06, "per_seed": [ 2.4922346710809506e-05, 2.6788266040966846e-05, 1.934224746946711e-05, 2.2755777536076494e-05, 2.3468126528314315e-05, 2.385292282269802e-05, 2.0721481632790528e-05, 2.0731988115585412e-05 ], "n": 8 } }, "idea": { "mean": 2.467335889377864e-05, "std": 3.053583916547981e-06, "per_seed": [ 2.329759081476368e-05, 2.7778152798418887e-05, 2.3396471078740433e-05, 2.4407705495832488e-05, 2.3295742721529678e-05, 3.1306088203564286e-05, 2.252922422485426e-05, 2.1375895812525414e-05 ], "n": 8 }, "comparison": { "delta_mean": 1.8504642866901122e-06, "idea_wins": 2, "n_pairs": 8, "per_seed_diffs": [ -1.6247558960458264e-06, 9.89886757452041e-07, 4.054223609273322e-06, 1.6519279597559944e-06, -1.7238380678463727e-07, 7.453165380866267e-06, 1.8077425920637324e-06, 6.439076969400048e-07 ], "p_value": 0.07535, "mde": 2.336394182513135e-06, "mde_rel_pct": 10.237063364379196, "verdict": "no significant win", "system_worked": false }, "mechanism_signature": { "prediction": "time warping reduces hidden trajectory discrepancy for clock-shifted paired windows", "observed_ordinary_D": 1.6830359101295471, "observed_warped_D": 1.6062670052051544, "relative_reduction": 0.04561334934231065, "confirmed": true }, "idea_sweep": [ { "cfg": { "lr": 0.001, "lambda": 0.03, "margin": 0.25 }, "mean": 0.0005055807923781686 }, { "cfg": { "lr": 0.003, "lambda": 0.03, "margin": 0.25 }, "mean": 4.8590658479952253e-05 }, { "cfg": { "lr": 0.006, "lambda": 0.03, "margin": 0.25 }, "mean": 2.467335889377864e-05 } ] }, "system_verdict": "partial", "practical_verdict": "inconclusive", "mechanism_ok": 1, "system_judged": true }