early checkpoint, un-tested
[ 1m43s +103.18s] fit: n_layers=40 d_model=8192, fitting 39 source layers (target=L39) on 100 prompts
[ 5m54s +251.47s] prompt 1/100 seq_len=128 n_valid=111 251s max||J||/sqrt(d)=2.989 max_d_mean=nan
[ 10m35s +281.27s] prompt 2/100 seq_len=128 n_valid=111 253s max||J||/sqrt(d)=3.569 max_d_mean=7.39e-01
[ 15m16s +280.96s] prompt 3/100 seq_len=128 n_valid=111 253s max||J||/sqrt(d)=4.079 max_d_mean=6.02e-01
[ 20m01s +284.65s] prompt 4/100 seq_len=128 n_valid=111 254s max||J||/sqrt(d)=2.211 max_d_mean=3.49e-01
[ 24m46s +284.68s] prompt 5/100 seq_len=128 n_valid=111 254s max||J||/sqrt(d)=5.980 max_d_mean=6.77e-01
[ 29m31s +285.45s] prompt 6/100 seq_len=128 n_valid=111 254s max||J||/sqrt(d)=8.173 max_d_mean=6.80e-01
[ 39m09s +578.23s] prompt 7/100 seq_len=128 n_valid=111 254s max||J||/sqrt(d)=3.048 max_d_mean=2.34e-01
[ 43m55s +285.48s] prompt 8/100 seq_len=128 n_valid=111 254s max||J||/sqrt(d)=3.325 max_d_mean=2.79e-01
[ 48m40s +285.60s] prompt 9/100 seq_len=128 n_valid=111 254s max||J||/sqrt(d)=7.431 max_d_mean=5.07e-01
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support
Model tree for gghfexp/c4ai-command-r-jlens
Base model
CohereLabs/c4ai-command-r-v01