Event-driven shared-neuron graph / report_bench_2026-08-31T112020.md

Mechanism confirmed, baseline not beaten

Raw ⬇ ZIP

Стенд-проверка (stage-2) · промт оператора:

(универсальный)

Ответ агента:

{ "worked": false, "confidence": 10, "verdict": "Implemented a differentiable delayed event-driven graph with shared accumulators and trained it end-to-end on the structurally matched multi-token sequence forecast track. The mechanism signature was confirmed quantitatively: 32 observed shared-node visits per sample versus 32 predicted. However, the idea had substantially worse test MSE than the swept transformer baseline (1.0941 vs 0.4544; paired delta +0.6397; permutation p=0.0081), so it is not a benchmark win.", "metrics": { "baseline": "sequence / transformer_tiny; swept lr={0.001,0.003,0.01}; best lr=0.001; full 8-seed mean test MSE=0.454399, std=0.040811; per-seed=[0.427856,0.395630,0.462489,0.494523,0.440140,0.474409,0.526621,0.413526]", "idea": "event-driven shared-neuron graph; swept the identical lr grid; best lr=0.001; full 8-seed mean test MSE=1.094060, std=0.084454; per-seed=[1.086983,0.921397,1.216696,1.144034,1.078718,1.046002,1.177429,1.081220]", "paired_comparison": "delta_mean=+0.639661 (idea-baseline, lower is better), idea_wins=0/8, permutation_p_value=0.0081, verdict=idea worse (significant)", "mechanism_signature": "trained-model measurement: mean_events_per_sample=1536, mean_shared_node_visits=32, predicted_shared_visits=32, observed_to_predicted_ratio=1.0, confirmed=true" }, "bench_report": { "bench_version": 1, "track": "sequence", "model": "transformer_tiny", "metric_direction": "lower is better", "n_seeds": 8, "baseline": { "best_cfg": { "lr": 0.001 }, "sweep": [ { "cfg": { "lr": 0.001 }, "mean": 0.4451246112585068 }, { "cfg": { "lr": 0.003 }, "mean": 0.4927415996789932 }, { "cfg": { "lr": 0.01 }, "mean": 1.6619523614645004 } ], "full": { "mean": 0.45439932495355606, "std": 0.04081052029431072, "per_seed": [ 0.4278562068939209, 0.3956301808357239, 0.46248915791511536, 0.49452289938926697, 0.44014036655426025, 0.4744090139865875, 0.5266208648681641, 0.41352590918540955 ], "n": 8 } }, "idea": { "mean": 1.0940600484609604, "std": 0.0844539494160516, "per_seed": [ 1.086983323097229, 0.9213972091674805, 1.21669602394104, 1.1440339088439941, 1.0787184238433838, 1.0460021495819092, 1.177429437637329, 1.0812199115753174 ], "n": 8 }, "comparison": { "delta_mean": 0.6396607235074043, "idea_wins": 0, "n_pairs": 8, "per_seed_diffs": [ 0.6591271162033081, 0.5257670283317566, 0.7542068660259247, 0.6495110094547272, 0.6385780572891235, 0.5715931355953217, 0.650808572769165, "0.6676940023899078" ], "p_value": 0.0081, "mde": 0.056634104586998066, "mde_rel_pct": 12.463509841874568, "verdict": "idea worse (significant)", "system_worked": false }, "mechanism_signature": { "track_match": "multi-token sequence forecast", "mean_events_per_sample": 1536.0, "mean_shared_node_visits": 32.0, "predicted_shared_visits": 32.0, "observed_to_predicted_ratio": 1.0, "source_message_abs_mean": 0.6570842266082764, "prediction": "each sequence token visits every shared hidden node once", "confirmed": true }, "idea_sweep": [ { "cfg": { "lr": 0.001 }, "mean": 1.0940600484609604 }, { "cfg": { "lr": 0.003 }, "mean": 1.0993548929691315 }, { "cfg": { "lr": 0.01 }, "mean": 1.121301993727684 } ], "protocol_notes": { "epochs": 12, "n_train": 400, "n_test": 200, "baseline_grid": [ { "lr": 0.001 }, { "lr": 0.003 }, { "lr": 0.01 } ], "idea_grid": [ { "lr": 0.001 }, { "lr": 0.003 }, { "lr": 0.01 } ], "architecture": "transformer baseline versus trainable delayed shared-accumulator graph" } }, "how_to_run": "/home/maxwelhelp/main/bin/python3 stage2_event_graph.py", "files": [ "stage2_event_graph.py", "bench_report.json" ], "limitations": "Only the structurally matched sequence track was tested; no vision, tabular, or dynamics tracks were run. The graph used a fixed dense routing pattern and fixed delay rather than learned topology, sparse kernels, cycles, or an optimized event queue. The benchmark used 400 training and 200 test samples and 12 epochs rather than the track README defaults, to fit the stage budget. No wall-clock or activation-memory advantage was established; the implementation is a dense differentiable emulation of events.", "system_verdict": "partial", "practical_verdict": "harms", "mechanism_ok": 1, "system_judged": true }