Pole-safe rational neural layer / results.json
Beats tuned baseline
1{
2 "seed": 297,
3 "device": "cuda",
4 "math_check": {
5 "unsafe_growth_slope": -1.9995359534972887,
6 "safe_variation_slope": 0.00046404650271114774,
7 "safe_limit_error_at_1e-5": 1.2237717207067422e-05,
8 "unsafe_norm_ratio": 99331043.78967242,
9 "safe_norm_ratio": 0.9933104378967241
10 },
11 "experiment": {
12 "unsafe": {
13 "val_mse": 799632392192.0,
14 "max_output_norm": 18367922.0,
15 "near_pole_output_norm": 53044752.0,
16 "max_grad_norm": 0.0,
17 "nan_steps": 0,
18 "parameters": 1344
19 },
20 "clip": {
21 "val_mse": 133724012544.0,
22 "max_output_norm": 20492250.0,
23 "near_pole_output_norm": 22388642.0,
24 "max_grad_norm": 255317835776.0,
25 "nan_steps": 0,
26 "parameters": 1344
27 },
28 "safe": {
29 "val_mse": 0.022726697847247124,
30 "max_output_norm": 1.490691065788269,
31 "near_pole_output_norm": 1.3273040056228638,
32 "max_grad_norm": 0.0,
33 "nan_steps": 0,
34 "parameters": 1344
35 }
36 }
37}