Error-budgeted local log-signature tokens / report_bench_2026-08-31T175136.md

Failed on benchmark

Raw ⬇ ZIP

Стенд-проверка (stage-2) · промт оператора:

(универсальный)

Ответ агента:

{ "worked": false, "confidence": 10, "verdict": "Built an end-to-end local log-signature token interface for the sequence transformer benchmark, using variation-quantile segmentation, degree-2 increments/area features, and a shared token transformer. The Taylor-tail monotonicity and equal-variation subdivision predictions passed numerically, but the idea lost significantly on test MSE: 0.8882 versus 0.7327 for baseline, paired delta +0.1555 with permutation p=0.0081. The trained-model mechanism probe had only moderate seed-level correlation (0.324) and was correctly marked unconfirmed; therefore there is no demonstrated ML benefit.", "metrics": { "baseline": "Tuned fixed raw patch tokens, best cfg lr=0.003 m=8; full 8-seed test MSE mean 0.7327230275, std 0.0837788024, per-seed [0.6893054, 0.6570264, 0.6207273, 0.8268932, 0.7129261, 0.7505295, 0.8937446, 0.7106316]", "idea": "Adaptive variation-quantile local log-signature tokens, selected cfg lr=0.001 m=4; full 8-seed test MSE mean 0.8882134855, std 0.0530509465, per-seed [0.9650674, 0.8446773, 0.9014533, 0.8312017, 0.9647781, 0.8639495, 0.9117945, 0.8227863]", "paired_delta": "idea - baseline = +0.1554904580 MSE; idea wins 0/8; permutation p=0.0081; verdict: idea worse (significant)", "math_sanity": "Tail decreases with degree: true; equal-variation error decreases with m: true; degree-2 free-Lie dimensions for d=2: [2,1,2,3,6]", "mechanism_signature": "Predicted local Taylor-tail proxy mean 572838.6955; observed trained-system test MSE mean 0.9076; seed-level correlation 0.3244; confirmed=false" }, "bench_report": { "bench_version": 1, "track": "sequence", "model": "transformer_tiny", "metric_direction": "lower is better", "n_seeds": 8, "baseline": { "best_cfg": { "lr": 0.003, "m": 8 }, "sweep": [ { "cfg": { "lr": 0.001, "m": 4 }, "mean": 0.8542857021 }, { "cfg": { "lr": 0.003, "m": 8 }, "mean": 0.6984880716 }, { "cfg": { "lr": 0.006, "m": 8 }, "mean": 0.8044749051 } ], "full": { "mean": 0.7327230275, "std": 0.0837788024, "per_seed": [ 0.6893054247, 0.6570264101, 0.6207273006, 0.8268931508, 0.7129261494, 0.7505295277, 0.8937446475, 0.710631609 ], "n": 8 }, "idea_union_grid": [ { "lr": 0.001, "m": 4 }, { "lr": 0.003, "m": 8 }, { "lr": 0.006, "m": 8 } ] }, "idea": { "mean": 0.8882134855, "std": 0.0530509465, "per_seed": [ 0.9650673866, 0.8446772695, 0.9014532566, 0.8312016726, 0.9647780657, 0.8639494777, 0.9117944837, 0.8227862716 ], "n": 8 }, "comparison": { "delta_mean": 0.155490458, "idea_wins": 0, "n_pairs": 8, "per_seed_diffs": [ 0.2757619619, 0.1876508594, 0.280725956, 0.0043085217, 0.2518519163, 0.11341995, 0.0180498362, 0.1121546626 ], "p_value": 0.0081, "mde": 0.0926061171, "mde_rel_pct": 12.63862518, "verdict": "idea worse (significant)", "system_worked": false }, "mechanism_signature": { "math_sanity": { "tail_decreases_with_degree": true, "equal_variation_error_decreases_with_m": true }, "idea_trials": [ { "cfg": { "lr": 0.001, "m": 4 }, "mean": 0.8855998963 }, { "cfg": { "lr": 0.003, "m": 8 }, "mean": 0.8925289065 }, { "cfg": { "lr": 0.006, "m": 8 }, "mean": 0.9592751116 } ], "selected_cfg": { "lr": 0.001, "m": 4 }, "prediction": "larger local Taylor tail should proxy larger CDE approximation error", "predicted_tail_mean": 572838.6955113218, "observed_test_mse_mean": 0.9075925201, "seed_level_correlation": 0.3244142469, "confirmed": false } }, "system_verdict": "failed", "practical_verdict": "harms", "mechanism_ok": 0, "system_judged": true }