Delay-Robust Slow Consensus Optimizer / bench_report.json

Failed on benchmark

Raw ⬇ ZIP
  1{
  2  "bench_version": 1,
  3  "track": "tabular",
  4  "model": "mlp_tiny",
  5  "metric_direction": "lower is better",
  6  "n_seeds": 8,
  7  "baseline": {
  8    "best_cfg": {
  9      "lr": 0.01,
 10      "k": 0.0,
 11      "delay": 0
 12    },
 13    "sweep": [
 14      {
 15        "cfg": {
 16          "lr": 0.001,
 17          "k": 0.0,
 18          "delay": 0
 19        },
 20        "mean": 26.43767786026001
 21      },
 22      {
 23        "cfg": {
 24          "lr": 0.003,
 25          "k": 0.0,
 26          "delay": 0
 27        },
 28        "mean": 13.834030151367188
 29      },
 30      {
 31        "cfg": {
 32          "lr": 0.01,
 33          "k": 0.0,
 34          "delay": 0
 35        },
 36        "mean": 8.090400218963623
 37      }
 38    ],
 39    "full": {
 40      "mean": 8.471371114253998,
 41      "std": 0.789625392148929,
 42      "per_seed": [
 43        7.42649507522583,
 44        8.836640357971191,
 45        7.776073932647705,
 46        8.322391510009766,
 47        7.539560794830322,
 48        8.821172714233398,
 49        9.681197166442871,
 50        9.367437362670898
 51      ],
 52      "n": 8
 53    }
 54  },
 55  "idea": {
 56    "mean": 15.51313579082489,
 57    "std": 0.7923130595085129,
 58    "per_seed": [
 59      14.976237297058105,
 60      14.776838302612305,
 61      16.32500648498535,
 62      14.312763214111328,
 63      15.06303882598877,
 64      16.302553176879883,
 65      15.731860160827637,
 66      16.616788864135742
 67    ],
 68    "n": 8
 69  },
 70  "comparison": {
 71    "delta_mean": 7.041764676570892,
 72    "idea_wins": 0,
 73    "n_pairs": 8,
 74    "per_seed_diffs": [
 75      7.549742221832275,
 76      5.940197944641113,
 77      8.548932552337646,
 78      5.9903717041015625,
 79      7.523478031158447,
 80      7.481380462646484,
 81      6.050662994384766,
 82      7.249351501464844
 83    ],
 84    "p_value": 0.0081,
 85    "mde": 0.793192058324816,
 86    "mde_rel_pct": 9.363207533077905,
 87    "verdict": "idea worse (significant)",
 88    "system_worked": false
 89  },
 90  "mechanism_signature": {
 91    "track_structure": "optimizer on heterogeneous disjoint-worker tabular training",
 92    "config": {
 93      "lr": 0.003,
 94      "k": 0.02,
 95      "delay": 0
 96    },
 97    "predicted_slowdown": 1.0,
 98    "observed_collective_step_ratio": 0.3575581591576338,
 99    "relative_error": 0.6424418408423662,
100    "final_disagreement": 9.698813028080622e-05,
101    "confirmed": false
102  },
103  "idea_sweep": [
104    {
105      "cfg": {
106        "lr": 0.003,
107        "k": 0.02,
108        "delay": 0
109      },
110      "result": {
111        "mean": 15.51313579082489,
112        "std": 0.7923130595085129,
113        "per_seed": [
114          14.976237297058105,
115          14.776838302612305,
116          16.32500648498535,
117          14.312763214111328,
118          15.06303882598877,
119          16.302553176879883,
120          15.731860160827637,
121          16.616788864135742
122        ],
123        "n": 8
124      }
125    },
126    {
127      "cfg": {
128        "lr": 0.003,
129        "k": 0.02,
130        "delay": 2
131      },
132      "result": {
133        "mean": 15.614838361740112,
134        "std": 0.8421123200541285,
135        "per_seed": [
136          15.206962585449219,
137          14.785978317260742,
138          16.650211334228516,
139          14.41156005859375,
140          14.992582321166992,
141          16.48356819152832,
142          15.700258255004883,
143          16.687585830688477
144        ],
145        "n": 8
146      }
147    },
148    {
149      "cfg": {
150        "lr": 0.003,
151        "k": 0.02,
152        "delay": 5
153      },
154      "result": {
155        "mean": 15.973463654518127,
156        "std": 0.9573226631534311,
157        "per_seed": [
158          16.243694305419922,
159          14.805825233459473,
160          16.784862518310547,
161          14.326708793640137,
162          15.480900764465332,
163          16.745159149169922,
164          16.138805389404297,
165          17.26175308227539
166        ],
167        "n": 8
168      }
169    }
170  ],
171  "protocol_notes": {
172    "architecture_match": true,
173    "baseline": "independent local Adam replicas, ensemble prediction",
174    "n_train": 800,
175    "epochs": 18,
176    "workers": 4,
177    "lr_union": [
178      0.001,
179      0.003,
180      0.01
181    ]
182  }
183}