Spectral pinning of neural modules / bench_report.json

✓✓ Beats tuned baseline

Raw ⬇ ZIP
  1{
  2  "bench_version": 1,
  3  "track": "dynamics",
  4  "model": "rnn_small",
  5  "metric_direction": "lower is better",
  6  "n_seeds": 8,
  7  "baseline": {
  8    "best_cfg": {
  9      "lr": 0.01,
 10      "consensus": 0.0
 11    },
 12    "sweep": [
 13      {
 14        "cfg": {
 15          "lr": 0.001,
 16          "consensus": 0.0
 17        },
 18        "mean": 0.19337305054068565
 19      },
 20      {
 21        "cfg": {
 22          "lr": 0.001,
 23          "consensus": 0.01
 24        },
 25        "mean": 0.19314046204090118
 26      },
 27      {
 28        "cfg": {
 29          "lr": 0.001,
 30          "consensus": 0.05
 31        },
 32        "mean": 0.1922968477010727
 33      },
 34      {
 35        "cfg": {
 36          "lr": 0.003,
 37          "consensus": 0.0
 38        },
 39        "mean": 0.014081272296607494
 40      },
 41      {
 42        "cfg": {
 43          "lr": 0.003,
 44          "consensus": 0.01
 45        },
 46        "mean": 0.013959631556645036
 47      },
 48      {
 49        "cfg": {
 50          "lr": 0.003,
 51          "consensus": 0.05
 52        },
 53        "mean": 0.013560101622715592
 54      },
 55      {
 56        "cfg": {
 57          "lr": 0.01,
 58          "consensus": 0.0
 59        },
 60        "mean": 0.004480039002373815
 61      },
 62      {
 63        "cfg": {
 64          "lr": 0.01,
 65          "consensus": 0.01
 66        },
 67        "mean": 0.004745688289403915
 68      },
 69      {
 70        "cfg": {
 71          "lr": 0.01,
 72          "consensus": 0.05
 73        },
 74        "mean": 0.0076980371959507465
 75      }
 76    ],
 77    "full": {
 78      "mean": 0.0037503628409467638,
 79      "std": 0.0010392951000048232,
 80      "per_seed": [
 81        0.003767967689782381,
 82        0.004212214145809412,
 83        0.0051866089925169945,
 84        0.004753365181386471,
 85        0.00401176605373621,
 86        0.002003958448767662,
 87        0.002254849299788475,
 88        0.0038121729157865047
 89      ],
 90      "n": 8
 91    }
 92  },
 93  "idea": {
 94    "mean": 0.0033386775467079133,
 95    "std": 0.000882734589731385,
 96    "per_seed": [
 97      0.0032974749337881804,
 98      0.004293782636523247,
 99      0.00453130342066288,
100      0.003945973236113787,
101      0.003240686608478427,
102      0.001959612825885415,
103      0.0020674322731792927,
104      0.003373154439032078
105    ],
106    "n": 8
107  },
108  "comparison": {
109    "delta_mean": -0.0004116852942388505,
110    "idea_wins": 7,
111    "n_pairs": 8,
112    "per_seed_diffs": [
113      -0.0004704927559942007,
114      8.156849071383476e-05,
115      -0.0006553055718541145,
116      -0.0008073919452726841,
117      -0.0007710794452577829,
118      -4.434562288224697e-05,
119      -0.00018741702660918236,
120      -0.00043901847675442696
121    ],
122    "p_value": 0.0245,
123    "mde": 0.00027872874101319965,
124    "mde_rel_pct": 7.432047320062389,
125    "verdict": "idea better (significant)",
126    "system_worked": true
127  },
128  "mechanism_signature": {
129    "pins": [
130      2,
131      0
132    ],
133    "lambda_min_grounded": 0.21781201402076653,
134    "test_representation_disagreement": 0.01838405802845955,
135    "task_prediction_disagreement": 0.0007268482004292309,
136    "baseline_random_gap": 0.2000357110567112,
137    "observed_vs_predicted": "task-independent disagreement is measured on trained representations; no exact decay slope is identifiable from final snapshots",
138    "confirmed": false
139  },
140  "idea_sweep": [
141    {
142      "cfg": {
143        "lr": 0.01,
144        "consensus": 0.0
145      },
146      "result": {
147        "mean": 0.0033386775467079133,
148        "std": 0.000882734589731385,
149        "per_seed": [
150          0.0032974749337881804,
151          0.004293782636523247,
152          0.00453130342066288,
153          0.003945973236113787,
154          0.003240686608478427,
155          0.001959612825885415,
156          0.0020674322731792927,
157          0.003373154439032078
158        ],
159        "n": 8
160      }
161    },
162    {
163      "cfg": {
164        "lr": 0.01,
165        "consensus": 0.01
166      },
167      "result": {
168        "mean": 0.003485470893792808,
169        "std": 0.0008992386183535255,
170        "per_seed": [
171          0.0035131555050611496,
172          0.0043441238813102245,
173          0.004703593906015158,
174          0.004132850561290979,
175          0.003451108932495117,
176          0.00200086017139256,
177          0.002212213585153222,
178          0.003525860607624054
179        ],
180        "n": 8
181      }
182    },
183    {
184      "cfg": {
185        "lr": 0.01,
186        "consensus": 0.0
187      },
188      "result": {
189        "mean": 0.0033386775467079133,
190        "std": 0.000882734589731385,
191        "per_seed": [
192          0.0032974749337881804,
193          0.004293782636523247,
194          0.00453130342066288,
195          0.003945973236113787,
196          0.003240686608478427,
197          0.001959612825885415,
198          0.0020674322731792927,
199          0.003373154439032078
200        ],
201        "n": 8
202      }
203    }
204  ],
205  "baseline_sweep_union": [
206    {
207      "lr": 0.001,
208      "consensus": 0.0
209    },
210    {
211      "lr": 0.001,
212      "consensus": 0.01
213    },
214    {
215      "lr": 0.001,
216      "consensus": 0.05
217    },
218    {
219      "lr": 0.003,
220      "consensus": 0.0
221    },
222    {
223      "lr": 0.003,
224      "consensus": 0.01
225    },
226    {
227      "lr": 0.003,
228      "consensus": 0.05
229    },
230    {
231      "lr": 0.01,
232      "consensus": 0.0
233    },
234    {
235      "lr": 0.01,
236      "consensus": 0.01
237    },
238    {
239      "lr": 0.01,
240      "consensus": 0.05
241    }
242  ]
243}