Decision-Oriented Optimum Preservation / bench_report.json

Failed on benchmark

Raw ⬇ ZIP
  1{
  2  "bench_version": 1,
  3  "track": "dynamics",
  4  "model": "rnn_small",
  5  "metric_direction": "lower is better",
  6  "n_seeds": 8,
  7  "baseline": {
  8    "best_cfg": {
  9      "lr": 0.006,
 10      "epochs": 12
 11    },
 12    "sweep": [
 13      {
 14        "cfg": {
 15          "lr": 0.001,
 16          "epochs": 12
 17        },
 18        "mean": 0.004298779065720737
 19      },
 20      {
 21        "cfg": {
 22          "lr": 0.003,
 23          "epochs": 12
 24        },
 25        "mean": 0.0034615940821822733
 26      },
 27      {
 28        "cfg": {
 29          "lr": 0.006,
 30          "epochs": 12
 31        },
 32        "mean": 0.0018282315868418664
 33      }
 34    ],
 35    "full": {
 36      "mean": 0.002105819425196387,
 37      "std": 0.000389436566226016,
 38      "per_seed": [
 39        0.002004395006224513,
 40        0.001437882543541491,
 41        0.0015748648438602686,
 42        0.002295783953741193,
 43        0.0024020641576498747,
 44        0.0024898042902350426,
 45        0.0020851334556937218,
 46        0.0025566271506249905
 47      ],
 48      "n": 8
 49    }
 50  },
 51  "idea": {
 52    "mean": 0.7633235901594162,
 53    "std": 0.05257852286312429,
 54    "per_seed": [
 55      0.746772825717926,
 56      0.7365002632141113,
 57      0.8016765713691711,
 58      0.886947512626648,
 59      0.735880434513092,
 60      0.7473666071891785,
 61      0.7420515418052673,
 62      0.7093929648399353
 63    ],
 64    "n": 8
 65  },
 66  "comparison": {
 67    "delta_mean": 0.7612177707342198,
 68    "idea_wins": 0,
 69    "n_pairs": 8,
 70    "per_seed_diffs": [
 71      0.7447684307117015,
 72      0.7350623806705698,
 73      0.8001017065253109,
 74      0.8846517286729068,
 75      0.7334783703554422,
 76      0.7448768028989434,
 77      0.7399664083495736,
 78      0.7068363376893103
 79    ],
 80    "p_value": 0.0081,
 81    "mde": 0.04703323792024009,
 82    "mde_rel_pct": 2233.4886532758533,
 83    "verdict": "idea worse (significant)",
 84    "system_worked": false
 85  },
 86  "mechanism_signature": {
 87    "prediction": "decision-aware training reduces surrogate optimum displacement relative to MSE-only while preserving trajectory fit",
 88    "measured_on_trained_models": true,
 89    "decision_probe": {
 90      "contexts": 32,
 91      "multistart": 5,
 92      "bounds": [
 93        -1.5,
 94        1.5
 95      ]
 96    },
 97    "confirmed": false,
 98    "note": "Standard task MSE is primary; probe is diagnostic only."
 99  },
100  "idea_sweep": [
101    {
102      "cfg": {
103        "lr": 0.001,
104        "epochs": 12
105      },
106      "result": {
107        "mean": 0.7633235901594162,
108        "std": 0.05257852286312429,
109        "per_seed": [
110          0.746772825717926,
111          0.7365002632141113,
112          0.8016765713691711,
113          0.886947512626648,
114          0.735880434513092,
115          0.7473666071891785,
116          0.7420515418052673,
117          0.7093929648399353
118        ],
119        "n": 8
120      }
121    },
122    {
123      "cfg": {
124        "lr": 0.003,
125        "epochs": 12
126      },
127      "result": {
128        "mean": 0.7637511864304543,
129        "std": 0.05106457675677259,
130        "per_seed": [
131          0.748903214931488,
132          0.7398125529289246,
133          0.802194356918335,
134          0.8831914663314819,
135          0.7348660230636597,
136          0.7470683455467224,
137          0.7429152727127075,
138          0.7110582590103149
139        ],
140        "n": 8
141      }
142    },
143    {
144      "cfg": {
145        "lr": 0.006,
146        "epochs": 12
147      },
148      "result": {
149        "mean": 0.7635712027549744,
150        "std": 0.050801253101102256,
151        "per_seed": [
152          0.7507007122039795,
153          0.7397510409355164,
154          0.8021869659423828,
155          0.8825896382331848,
156          0.7341564297676086,
157          0.7471616268157959,
158          0.7382707595825195,
159          0.7137524485588074
160        ],
161        "n": 8
162      }
163    }
164  ],
165  "selected_idea_cfg": {
166    "lr": 0.001,
167    "epochs": 12
168  }
169}