Train

Tokenizer

cd scripts
python -m venv venv
source venv/bin/activate
pip install -U -r requirements.in

python -B train_tokenizer.py

cd scripts
python -m venv venv-lit
source venv-lit/bin/activate
pip install -U -r requirements-lit.in

python -B prepare_pretrain_dataset.py

cd scripts
python -m venv venv-lit
source venv-lit/bin/activate
pip install -U -r requirements-lit.in

litgpt pretrain --config ./model.yaml

litgpt evaluate --tasks 'hellaswag,gsm8k,truthfulqa_mc2,mmlu,winogrande,arc_challenge' --batch_size 8 out/pretrain/final/