Non-Abelian Event-Order Memory / report_bench_2026-09-01T185628.md

Failed on benchmark

Raw ⬇ ZIP

Стенд-проверка (stage-2) · промт оператора:

(универсальный)

Ответ агента:

{ "worked": false, "confidence": 9, "verdict": "The matched transformer_tiny plus learned Rodrigues-spin system was evaluated on the registered sequence track using the bench training path and eight paired seeds. The mechanism signature was confirmed from trained-model behavior, but the idea had higher test MSE than the tuned baseline and no significant win.", "metrics": { "baseline": "Full 8-seed test MSE 0.2289467007 ± 0.0246823174; best learning rate 0.001.", "idea": "Full 8-seed test MSE 0.2316164933 ± 0.02173852497; best learning rate 0.001; paired delta +0.0026697926; 3/8 wins; permutation p=0.6818." }, "bench_report": { "bench_version": 1, "track": "sequence", "model": "transformer_tiny", "metric_direction": "lower is better", "n_seeds": 8, "baseline": { "best_cfg": { "lr": 0.001 }, "sweep": [ { "cfg": { "lr": 0.001 }, "mean": 0.22030843049287796 }, { "cfg": { "lr": 0.003 }, "mean": 0.2290698178112507 }, { "cfg": { "lr": 0.01 }, "mean": 1.0897138714790344 } ], "full": { "mean": 0.22894670069217682, "std": 0.02468231743126849, "per_seed": [ 0.2348448932170868, 0.18358114361763, 0.2119988203048706, 0.25080886483192444, 0.21615827083587646, 0.258085697889328, 0.258510559797287, 0.21758535504341125 ], "n": 8 } }, "idea": { "mean": 0.23161649331450462, "std": 0.0217385249680007, "per_seed": [ 0.23855143785476685, 0.20657582581043243, 0.2038293331861496, 0.27797847986221313, 0.22990234196186066, 0.2412124127149582, 0.23263387382030487, 0.22224824130535126 ], "n": 8 }, "comparison": { "delta_mean": 0.0026697926223278046, "idea_wins": 3, "n_pairs": 8, "per_seed_diffs": [ 0.0037065446376800537, 0.02299468219280243, -0.008169487118721008, 0.027169615030288696, 0.013744071125984192, -0.016873285174369812, -0.025876685976982117, 0.0046628862619400024 ], "p_value": 0.6818, "mde": 0.015660083437405745, "mde_rel_pct": 6.8400563930646125, "verdict": "no significant win", "system_worked": false }, "mechanism_signature": { "idea_sweep": [ { "cfg": { "lr": 0.001 }, "mean": 0.2317337691783905 }, { "cfg": { "lr": 0.003 }, "mean": 0.26143352687358856 }, { "cfg": { "lr": 0.01 }, "mean": 1.1830730140209198 } ], "selected_idea_cfg": { "lr": 0.001 }, "behavior": { "prediction": "ordered noncommuting updates preserve sphere norm and create order sensitivity", "predicted_norm_error": 0.0, "observed_max_norm_error": 1.3113021850585938e-06, "predicted_order_delta_nonzero": true, "observed_mean_reversal_spin_delta": 1.0346672534942627, "observed_axis_cross_norm": 0.9981767535209656, "confirmed": true, "note": "All values are measured from the trained benchmark spin model." } } }, "how_to_run": "/home/maxwelhelp/main/bin/python3 bench_stage2.py", "files": [ "bench_stage2.py", "bench_report.json" ], "limitations": "Only the built-in sequence forecast track was tested; no custom event-order track, dynamics track, Chern-number diagnostic, runtime/FLOP comparison, or larger-scale training was run.", "system_verdict": "failed", "practical_verdict": "no_effect", "mechanism_ok": 0, "system_judged": true }