Markov-coded synchronization-robust latent streams / report_bench_2026-09-04T111011.md

Mechanism confirmed, baseline not beaten

Raw ⬇ ZIP

Стенд-проверка (stage-2) · промт оператора:

(универсальный)

Ответ агента:

{ "worked": false, "confidence": 9, "verdict": "Implemented a structurally matched sequence-level benchmark using the fixed transformer_tiny architecture, identical forecast data, insertion corruption, training budget, and paired seeds for iid and Markov redundancy streams. The mechanism signature was quantitatively confirmed: configured q=0.25 produced observed transition rate 0.2421. However, Markov achieved test MSE 1.2093 versus iid baseline 1.2005, paired delta +0.00878, with permutation p=0.40245; this is no measurable effect and not a significant improvement.", "metrics": { "baseline": "sequence transformer, iid stream, best lr=0.001; full 8-seed test MSE 1.200540 ± 0.095050", "idea": "sequence transformer, Markov q=0.25, best lr=0.001; full 8-seed test MSE 1.209323 ± 0.108909", "paired_delta": "idea - baseline = +0.008783 MSE; 3/8 idea wins; permutation p=0.40245", "mechanism_signature": "predicted q=0.25, observed transition rate=0.242097, observed persistence=0.757903, confirmed=true", "capacity": "R_ins(delta=0.25)=0.347590" }, "bench_report": { "bench_version": 1, "track": "sequence", "model": "transformer_tiny", "metric_direction": "lower is better", "n_seeds": 8, "baseline": { "best_cfg": { "lr": 0.001, "q": 0.5 }, "sweep": [ { "cfg": { "lr": 0.001, "q": 0.5 }, "mean": 1.1863778233528137 }, { "cfg": { "lr": 0.003, "q": 0.5 }, "mean": 1.2159082889556885 }, { "cfg": { "lr": 0.006, "q": 0.5 }, "mean": 1.5289808511734009 } ], "full": { "mean": 1.2005403339862823, "std": 0.09504977244656419, "per_seed": [ 1.278849482536316, 1.0727081298828125, 1.2111872434616089, 1.1827664375305176, 1.2951351404190063, 1.2909891605377197, 1.2458912134170532, 1.0267958641052246 ], "n": 8 } }, "idea": { "mean": 1.2093233168125153, "std": 0.10890883181654566, "per_seed": [ 1.2485390901565552, 1.0826671123504639, 1.2171751260757446, 1.1622062921524048, 1.3439818620681763, 1.32215416431427, 1.2847063541412354, 1.013156533241272 ], "n": 8, "best_cfg": { "lr": 0.001, "q": 0.25 } }, "comparison": { "delta_mean": 0.00878298282623291, "idea_wins": 3, "n_pairs": 8, "per_seed_diffs": [ -0.030310392379760742, 0.009958982467651367, 0.005987882614135742, -0.020560145378112793, 0.04884672164916992, 0.031165003776550293, 0.03881514072418213, -0.013639330863952637 ], "p_value": 0.40245, "mde": 0.024294250891657106, "mde_rel_pct": 2.023609720049164, "verdict": "no measurable effect", "system_worked": false }, "mechanism_signature": { "predicted_q": 0.25, "observed_transition_rate": 0.2420967741935484, "observed_persistence": 0.7579032258064516, "test_mse_for_signature": 1.2485390901565552, "confirmed": true } }, "how_to_run": "/home/maxwelhelp/main/bin/python3 bench_experiment.py", "files": [ "bench_experiment.py", "bench_report.json" ], "limitations": "Only the built-in sequence forecast track was tested; no learned q, Markov prior loss, transformer decoder, explicit semantic latent autoencoder, or multiple insertion fractions were evaluated. The redundancy stream was supplied as an auxiliary channel and corruption was truncated back to the fixed transformer window, so this is a transfer test rather than a complete tokenizer implementation.", "system_verdict": "partial", "practical_verdict": "no_effect", "mechanism_ok": 1, "system_judged": true }