Ogamon commited on Jul 16

Commit

cf0a3a7

•

1 Parent(s): 12fe027

Initial commit

Browse files

This view is limited to 50 files because it contains too many changes. See raw diff

Files changed (50) hide show

README.md +60 -0
all_results.json +9 -0
checkpoint-190/config.json +29 -0
checkpoint-190/generation_config.json +12 -0
checkpoint-190/global_step190/bf16_zero_pp_rank_0_mp_rank_00_optim_states.pt +3 -0
checkpoint-190/global_step190/bf16_zero_pp_rank_1_mp_rank_00_optim_states.pt +3 -0
checkpoint-190/global_step190/bf16_zero_pp_rank_2_mp_rank_00_optim_states.pt +3 -0
checkpoint-190/global_step190/bf16_zero_pp_rank_3_mp_rank_00_optim_states.pt +3 -0
checkpoint-190/global_step190/bf16_zero_pp_rank_4_mp_rank_00_optim_states.pt +3 -0
checkpoint-190/global_step190/bf16_zero_pp_rank_5_mp_rank_00_optim_states.pt +3 -0
checkpoint-190/global_step190/bf16_zero_pp_rank_6_mp_rank_00_optim_states.pt +3 -0
checkpoint-190/global_step190/bf16_zero_pp_rank_7_mp_rank_00_optim_states.pt +3 -0
checkpoint-190/global_step190/mp_rank_00_model_states.pt +3 -0
checkpoint-190/latest +1 -0
checkpoint-190/model-00001-of-00004.safetensors +3 -0
checkpoint-190/model-00002-of-00004.safetensors +3 -0
checkpoint-190/model-00003-of-00004.safetensors +3 -0
checkpoint-190/model-00004-of-00004.safetensors +3 -0
checkpoint-190/model.safetensors.index.json +298 -0
checkpoint-190/rng_state_0.pth +3 -0
checkpoint-190/rng_state_1.pth +3 -0
checkpoint-190/rng_state_2.pth +3 -0
checkpoint-190/rng_state_3.pth +3 -0
checkpoint-190/rng_state_4.pth +3 -0
checkpoint-190/rng_state_5.pth +3 -0
checkpoint-190/rng_state_6.pth +3 -0
checkpoint-190/rng_state_7.pth +3 -0
checkpoint-190/scheduler.pt +3 -0
checkpoint-190/special_tokens_map.json +17 -0
checkpoint-190/tokenizer.json +0 -0
checkpoint-190/tokenizer_config.json +2065 -0
checkpoint-190/trainer_state.json +1553 -0
checkpoint-190/training_args.bin +3 -0
checkpoint-190/zero_to_fp32.py +604 -0
config.json +29 -0
generation_config.json +12 -0
llamaboard_config.yaml +65 -0
model-00001-of-00004.safetensors +3 -0
model-00002-of-00004.safetensors +3 -0
model-00003-of-00004.safetensors +3 -0
model-00004-of-00004.safetensors +3 -0
model.safetensors.index.json +298 -0
running_log.txt +667 -0
special_tokens_map.json +17 -0
tokenizer.json +0 -0
tokenizer_config.json +2065 -0
train_results.json +9 -0
trainer_log.jsonl +191 -0
trainer_state.json +1563 -0
training_args.bin +3 -0

README.md ADDED Viewed

	@@ -0,0 +1,60 @@

+---
+license: other
+base_model: meta-llama/Meta-Llama-3-8B-Instruct
+tags:
+- llama-factory
+- full
+- generated_from_trainer
+model-index:
+- name: train_2024-07-16-15-59-42_llama3_2
+  results: []
+---
+<!-- This model card has been generated automatically according to the information the Trainer had access to. You
+should probably proofread and complete it, then remove this comment. -->
+# train_2024-07-16-15-59-42_llama3_2
+This model is a fine-tuned version of [meta-llama/Meta-Llama-3-8B-Instruct](https://huggingface.co/meta-llama/Meta-Llama-3-8B-Instruct) on the truth_train_0716_2 dataset.
+## Model description
+More information needed
+## Intended uses & limitations
+More information needed
+## Training and evaluation data
+More information needed
+## Training procedure
+### Training hyperparameters
+The following hyperparameters were used during training:
+- learning_rate: 5e-06
+- train_batch_size: 2
+- eval_batch_size: 8
+- seed: 42
+- distributed_type: multi-GPU
+- num_devices: 8
+- gradient_accumulation_steps: 8
+- total_train_batch_size: 128
+- total_eval_batch_size: 64
+- optimizer: Adam with betas=(0.9,0.999) and epsilon=1e-08
+- lr_scheduler_type: cosine
+- lr_scheduler_warmup_steps: 10
+- num_epochs: 5.0
+### Training results
+### Framework versions
+- Transformers 4.42.3
+- Pytorch 2.3.0a0+ebedce2
+- Datasets 2.20.0
+- Tokenizers 0.19.1

all_results.json ADDED Viewed

	@@ -0,0 +1,9 @@

+{
+    "epoch": 4.903225806451613,
+    "num_input_tokens_seen": 1207760,
+    "total_flos": 5.438488809413018e+16,
+    "train_loss": 0.49016160156086125,
+    "train_runtime": 2575.226,
+    "train_samples_per_second": 9.626,
+    "train_steps_per_second": 0.074
+}

checkpoint-190/config.json ADDED Viewed

	@@ -0,0 +1,29 @@

+{
+  "_name_or_path": "meta-llama/Meta-Llama-3-8B-Instruct",
+  "architectures": [
+    "LlamaForCausalLM"
+  ],
+  "attention_bias": false,
+  "attention_dropout": 0.0,
+  "bos_token_id": 128000,
+  "eos_token_id": 128009,
+  "hidden_act": "silu",
+  "hidden_size": 4096,
+  "initializer_range": 0.02,
+  "intermediate_size": 14336,
+  "max_position_embeddings": 8192,
+  "mlp_bias": false,
+  "model_type": "llama",
+  "num_attention_heads": 32,
+  "num_hidden_layers": 32,
+  "num_key_value_heads": 8,
+  "pretraining_tp": 1,
+  "rms_norm_eps": 1e-05,
+  "rope_scaling": null,
+  "rope_theta": 500000.0,
+  "tie_word_embeddings": false,
+  "torch_dtype": "bfloat16",
+  "transformers_version": "4.42.3",
+  "use_cache": false,
+  "vocab_size": 128256
+}

checkpoint-190/generation_config.json ADDED Viewed

	@@ -0,0 +1,12 @@

+{
+  "bos_token_id": 128000,
+  "do_sample": true,
+  "eos_token_id": [
+    128001,
+    128009
+  ],
+  "max_length": 4096,
+  "temperature": 0.6,
+  "top_p": 0.9,
+  "transformers_version": "4.42.3"
+}

checkpoint-190/global_step190/bf16_zero_pp_rank_0_mp_rank_00_optim_states.pt ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:e3f37aa22fcaeddc6a703cad57df2c00ab5e1e684b496f9496b2387011b9bff1
+size 12045399116

checkpoint-190/global_step190/bf16_zero_pp_rank_1_mp_rank_00_optim_states.pt ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:c5e5480dec52d2d708a30dc18e1a4586c7493ac7c7e3b13c7ca248515434a2dc
+size 12045399948

checkpoint-190/global_step190/bf16_zero_pp_rank_2_mp_rank_00_optim_states.pt ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:4dc038175bd92ec9e9b54037ea70f7a0c9f8ca75c87b3e13c899b23e28db9678
+size 12045400204

checkpoint-190/global_step190/bf16_zero_pp_rank_3_mp_rank_00_optim_states.pt ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:5a4f971533b6cc2f134d12a9df9208067bbecc5272b97369e49773618fb74119
+size 12045399948

checkpoint-190/global_step190/bf16_zero_pp_rank_4_mp_rank_00_optim_states.pt ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:6d694eefdb371fc553b918286fef36005623d6bb9c64f97fd774f26ffd38f6a3
+size 12045400204

checkpoint-190/global_step190/bf16_zero_pp_rank_5_mp_rank_00_optim_states.pt ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:e1044a9c7d0157d20413496425fcd42fe0f6f0b9326e3674c20022ffd18d9bb3
+size 12045400268

checkpoint-190/global_step190/bf16_zero_pp_rank_6_mp_rank_00_optim_states.pt ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:b79d7cb03173e3c972640ca9e2a7773acbe4a310ecc08180f7a66d1c5ef2422d
+size 12045399948

checkpoint-190/global_step190/bf16_zero_pp_rank_7_mp_rank_00_optim_states.pt ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:430323c7023db3c9e338eabbeb524c43e15b510820e0285c17496157510dc978
+size 12045398796

checkpoint-190/global_step190/mp_rank_00_model_states.pt ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:d594a7bdd6d2bba755a6c2a74aee4adbf719f32adbceae42005d80386f6874c4
+size 16060610616

checkpoint-190/latest ADDED Viewed

	@@ -0,0 +1 @@


1	+ global_step190

checkpoint-190/model-00001-of-00004.safetensors ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:5abbc702551994c8c8d2d5d1c3ba91b10fdf6b45da98baec62c196fbb91d1461
+size 4976698672

checkpoint-190/model-00002-of-00004.safetensors ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:93c01ac54008452872e54ffe1ae49d26a09d0085972ccf967d4e7c150e6694c6
+size 4999802720

checkpoint-190/model-00003-of-00004.safetensors ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:987f1c6ab10c142d1ed8fd02354572080e00d2926c78109143d589e694ae4012
+size 4915916176

checkpoint-190/model-00004-of-00004.safetensors ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:b5034a644f7b62dcbb02e08ea800d4efaa440f2e1790446387be5e9edcfd8aa4
+size 1168138808

checkpoint-190/model.safetensors.index.json ADDED Viewed

	@@ -0,0 +1,298 @@

+{
+  "metadata": {
+    "total_size": 16060522496
+  },
+  "weight_map": {
+    "lm_head.weight": "model-00004-of-00004.safetensors",
+    "model.embed_tokens.weight": "model-00001-of-00004.safetensors",
+    "model.layers.0.input_layernorm.weight": "model-00001-of-00004.safetensors",
+    "model.layers.0.mlp.down_proj.weight": "model-00001-of-00004.safetensors",
+    "model.layers.0.mlp.gate_proj.weight": "model-00001-of-00004.safetensors",
+    "model.layers.0.mlp.up_proj.weight": "model-00001-of-00004.safetensors",
+    "model.layers.0.post_attention_layernorm.weight": "model-00001-of-00004.safetensors",
+    "model.layers.0.self_attn.k_proj.weight": "model-00001-of-00004.safetensors",
+    "model.layers.0.self_attn.o_proj.weight": "model-00001-of-00004.safetensors",
+    "model.layers.0.self_attn.q_proj.weight": "model-00001-of-00004.safetensors",
+    "model.layers.0.self_attn.v_proj.weight": "model-00001-of-00004.safetensors",
+    "model.layers.1.input_layernorm.weight": "model-00001-of-00004.safetensors",
+    "model.layers.1.mlp.down_proj.weight": "model-00001-of-00004.safetensors",
+    "model.layers.1.mlp.gate_proj.weight": "model-00001-of-00004.safetensors",
+    "model.layers.1.mlp.up_proj.weight": "model-00001-of-00004.safetensors",
+    "model.layers.1.post_attention_layernorm.weight": "model-00001-of-00004.safetensors",
+    "model.layers.1.self_attn.k_proj.weight": "model-00001-of-00004.safetensors",
+    "model.layers.1.self_attn.o_proj.weight": "model-00001-of-00004.safetensors",
+    "model.layers.1.self_attn.q_proj.weight": "model-00001-of-00004.safetensors",
+    "model.layers.1.self_attn.v_proj.weight": "model-00001-of-00004.safetensors",
+    "model.layers.10.input_layernorm.weight": "model-00002-of-00004.safetensors",
+    "model.layers.10.mlp.down_proj.weight": "model-00002-of-00004.safetensors",
+    "model.layers.10.mlp.gate_proj.weight": "model-00002-of-00004.safetensors",
+    "model.layers.10.mlp.up_proj.weight": "model-00002-of-00004.safetensors",
+    "model.layers.10.post_attention_layernorm.weight": "model-00002-of-00004.safetensors",
+    "model.layers.10.self_attn.k_proj.weight": "model-00002-of-00004.safetensors",
+    "model.layers.10.self_attn.o_proj.weight": "model-00002-of-00004.safetensors",
+    "model.layers.10.self_attn.q_proj.weight": "model-00002-of-00004.safetensors",
+    "model.layers.10.self_attn.v_proj.weight": "model-00002-of-00004.safetensors",
+    "model.layers.11.input_layernorm.weight": "model-00002-of-00004.safetensors",
+    "model.layers.11.mlp.down_proj.weight": "model-00002-of-00004.safetensors",
+    "model.layers.11.mlp.gate_proj.weight": "model-00002-of-00004.safetensors",
+    "model.layers.11.mlp.up_proj.weight": "model-00002-of-00004.safetensors",
+    "model.layers.11.post_attention_layernorm.weight": "model-00002-of-00004.safetensors",
+    "model.layers.11.self_attn.k_proj.weight": "model-00002-of-00004.safetensors",
+    "model.layers.11.self_attn.o_proj.weight": "model-00002-of-00004.safetensors",
+    "model.layers.11.self_attn.q_proj.weight": "model-00002-of-00004.safetensors",
+    "model.layers.11.self_attn.v_proj.weight": "model-00002-of-00004.safetensors",
+    "model.layers.12.input_layernorm.weight": "model-00002-of-00004.safetensors",
+    "model.layers.12.mlp.down_proj.weight": "model-00002-of-00004.safetensors",
+    "model.layers.12.mlp.gate_proj.weight": "model-00002-of-00004.safetensors",
+    "model.layers.12.mlp.up_proj.weight": "model-00002-of-00004.safetensors",
+    "model.layers.12.post_attention_layernorm.weight": "model-00002-of-00004.safetensors",
+    "model.layers.12.self_attn.k_proj.weight": "model-00002-of-00004.safetensors",
+    "model.layers.12.self_attn.o_proj.weight": "model-00002-of-00004.safetensors",
+    "model.layers.12.self_attn.q_proj.weight": "model-00002-of-00004.safetensors",
+    "model.layers.12.self_attn.v_proj.weight": "model-00002-of-00004.safetensors",
+    "model.layers.13.input_layernorm.weight": "model-00002-of-00004.safetensors",
+    "model.layers.13.mlp.down_proj.weight": "model-00002-of-00004.safetensors",
+    "model.layers.13.mlp.gate_proj.weight": "model-00002-of-00004.safetensors",
+    "model.layers.13.mlp.up_proj.weight": "model-00002-of-00004.safetensors",
+    "model.layers.13.post_attention_layernorm.weight": "model-00002-of-00004.safetensors",
+    "model.layers.13.self_attn.k_proj.weight": "model-00002-of-00004.safetensors",
+    "model.layers.13.self_attn.o_proj.weight": "model-00002-of-00004.safetensors",
+    "model.layers.13.self_attn.q_proj.weight": "model-00002-of-00004.safetensors",
+    "model.layers.13.self_attn.v_proj.weight": "model-00002-of-00004.safetensors",
+    "model.layers.14.input_layernorm.weight": "model-00002-of-00004.safetensors",
+    "model.layers.14.mlp.down_proj.weight": "model-00002-of-00004.safetensors",
+    "model.layers.14.mlp.gate_proj.weight": "model-00002-of-00004.safetensors",
+    "model.layers.14.mlp.up_proj.weight": "model-00002-of-00004.safetensors",
+    "model.layers.14.post_attention_layernorm.weight": "model-00002-of-00004.safetensors",
+    "model.layers.14.self_attn.k_proj.weight": "model-00002-of-00004.safetensors",
+    "model.layers.14.self_attn.o_proj.weight": "model-00002-of-00004.safetensors",
+    "model.layers.14.self_attn.q_proj.weight": "model-00002-of-00004.safetensors",
+    "model.layers.14.self_attn.v_proj.weight": "model-00002-of-00004.safetensors",
+    "model.layers.15.input_layernorm.weight": "model-00002-of-00004.safetensors",
+    "model.layers.15.mlp.down_proj.weight": "model-00002-of-00004.safetensors",
+    "model.layers.15.mlp.gate_proj.weight": "model-00002-of-00004.safetensors",
+    "model.layers.15.mlp.up_proj.weight": "model-00002-of-00004.safetensors",
+    "model.layers.15.post_attention_layernorm.weight": "model-00002-of-00004.safetensors",
+    "model.layers.15.self_attn.k_proj.weight": "model-00002-of-00004.safetensors",
+    "model.layers.15.self_attn.o_proj.weight": "model-00002-of-00004.safetensors",
+    "model.layers.15.self_attn.q_proj.weight": "model-00002-of-00004.safetensors",
+    "model.layers.15.self_attn.v_proj.weight": "model-00002-of-00004.safetensors",
+    "model.layers.16.input_layernorm.weight": "model-00002-of-00004.safetensors",
+    "model.layers.16.mlp.down_proj.weight": "model-00002-of-00004.safetensors",
+    "model.layers.16.mlp.gate_proj.weight": "model-00002-of-00004.safetensors",
+    "model.layers.16.mlp.up_proj.weight": "model-00002-of-00004.safetensors",
+    "model.layers.16.post_attention_layernorm.weight": "model-00002-of-00004.safetensors",
+    "model.layers.16.self_attn.k_proj.weight": "model-00002-of-00004.safetensors",
+    "model.layers.16.self_attn.o_proj.weight": "model-00002-of-00004.safetensors",
+    "model.layers.16.self_attn.q_proj.weight": "model-00002-of-00004.safetensors",
+    "model.layers.16.self_attn.v_proj.weight": "model-00002-of-00004.safetensors",
+    "model.layers.17.input_layernorm.weight": "model-00002-of-00004.safetensors",
+    "model.layers.17.mlp.down_proj.weight": "model-00002-of-00004.safetensors",
+    "model.layers.17.mlp.gate_proj.weight": "model-00002-of-00004.safetensors",
+    "model.layers.17.mlp.up_proj.weight": "model-00002-of-00004.safetensors",
+    "model.layers.17.post_attention_layernorm.weight": "model-00002-of-00004.safetensors",
+    "model.layers.17.self_attn.k_proj.weight": "model-00002-of-00004.safetensors",
+    "model.layers.17.self_attn.o_proj.weight": "model-00002-of-00004.safetensors",
+    "model.layers.17.self_attn.q_proj.weight": "model-00002-of-00004.safetensors",
+    "model.layers.17.self_attn.v_proj.weight": "model-00002-of-00004.safetensors",
+    "model.layers.18.input_layernorm.weight": "model-00002-of-00004.safetensors",
+    "model.layers.18.mlp.down_proj.weight": "model-00002-of-00004.safetensors",
+    "model.layers.18.mlp.gate_proj.weight": "model-00002-of-00004.safetensors",
+    "model.layers.18.mlp.up_proj.weight": "model-00002-of-00004.safetensors",
+    "model.layers.18.post_attention_layernorm.weight": "model-00002-of-00004.safetensors",
+    "model.layers.18.self_attn.k_proj.weight": "model-00002-of-00004.safetensors",
+    "model.layers.18.self_attn.o_proj.weight": "model-00002-of-00004.safetensors",
+    "model.layers.18.self_attn.q_proj.weight": "model-00002-of-00004.safetensors",
+    "model.layers.18.self_attn.v_proj.weight": "model-00002-of-00004.safetensors",
+    "model.layers.19.input_layernorm.weight": "model-00002-of-00004.safetensors",
+    "model.layers.19.mlp.down_proj.weight": "model-00002-of-00004.safetensors",
+    "model.layers.19.mlp.gate_proj.weight": "model-00002-of-00004.safetensors",
+    "model.layers.19.mlp.up_proj.weight": "model-00002-of-00004.safetensors",
+    "model.layers.19.post_attention_layernorm.weight": "model-00002-of-00004.safetensors",
+    "model.layers.19.self_attn.k_proj.weight": "model-00002-of-00004.safetensors",
+    "model.layers.19.self_attn.o_proj.weight": "model-00002-of-00004.safetensors",
+    "model.layers.19.self_attn.q_proj.weight": "model-00002-of-00004.safetensors",
+    "model.layers.19.self_attn.v_proj.weight": "model-00002-of-00004.safetensors",
+    "model.layers.2.input_layernorm.weight": "model-00001-of-00004.safetensors",
+    "model.layers.2.mlp.down_proj.weight": "model-00001-of-00004.safetensors",
+    "model.layers.2.mlp.gate_proj.weight": "model-00001-of-00004.safetensors",
+    "model.layers.2.mlp.up_proj.weight": "model-00001-of-00004.safetensors",
+    "model.layers.2.post_attention_layernorm.weight": "model-00001-of-00004.safetensors",
+    "model.layers.2.self_attn.k_proj.weight": "model-00001-of-00004.safetensors",
+    "model.layers.2.self_attn.o_proj.weight": "model-00001-of-00004.safetensors",
+    "model.layers.2.self_attn.q_proj.weight": "model-00001-of-00004.safetensors",
+    "model.layers.2.self_attn.v_proj.weight": "model-00001-of-00004.safetensors",
+    "model.layers.20.input_layernorm.weight": "model-00003-of-00004.safetensors",
+    "model.layers.20.mlp.down_proj.weight": "model-00003-of-00004.safetensors",
+    "model.layers.20.mlp.gate_proj.weight": "model-00002-of-00004.safetensors",
+    "model.layers.20.mlp.up_proj.weight": "model-00003-of-00004.safetensors",
+    "model.layers.20.post_attention_layernorm.weight": "model-00003-of-00004.safetensors",
+    "model.layers.20.self_attn.k_proj.weight": "model-00002-of-00004.safetensors",
+    "model.layers.20.self_attn.o_proj.weight": "model-00002-of-00004.safetensors",
+    "model.layers.20.self_attn.q_proj.weight": "model-00002-of-00004.safetensors",
+    "model.layers.20.self_attn.v_proj.weight": "model-00002-of-00004.safetensors",
+    "model.layers.21.input_layernorm.weight": "model-00003-of-00004.safetensors",
+    "model.layers.21.mlp.down_proj.weight": "model-00003-of-00004.safetensors",
+    "model.layers.21.mlp.gate_proj.weight": "model-00003-of-00004.safetensors",
+    "model.layers.21.mlp.up_proj.weight": "model-00003-of-00004.safetensors",
+    "model.layers.21.post_attention_layernorm.weight": "model-00003-of-00004.safetensors",
+    "model.layers.21.self_attn.k_proj.weight": "model-00003-of-00004.safetensors",
+    "model.layers.21.self_attn.o_proj.weight": "model-00003-of-00004.safetensors",
+    "model.layers.21.self_attn.q_proj.weight": "model-00003-of-00004.safetensors",
+    "model.layers.21.self_attn.v_proj.weight": "model-00003-of-00004.safetensors",
+    "model.layers.22.input_layernorm.weight": "model-00003-of-00004.safetensors",
+    "model.layers.22.mlp.down_proj.weight": "model-00003-of-00004.safetensors",
+    "model.layers.22.mlp.gate_proj.weight": "model-00003-of-00004.safetensors",
+    "model.layers.22.mlp.up_proj.weight": "model-00003-of-00004.safetensors",
+    "model.layers.22.post_attention_layernorm.weight": "model-00003-of-00004.safetensors",
+    "model.layers.22.self_attn.k_proj.weight": "model-00003-of-00004.safetensors",
+    "model.layers.22.self_attn.o_proj.weight": "model-00003-of-00004.safetensors",
+    "model.layers.22.self_attn.q_proj.weight": "model-00003-of-00004.safetensors",
+    "model.layers.22.self_attn.v_proj.weight": "model-00003-of-00004.safetensors",
+    "model.layers.23.input_layernorm.weight": "model-00003-of-00004.safetensors",
+    "model.layers.23.mlp.down_proj.weight": "model-00003-of-00004.safetensors",
+    "model.layers.23.mlp.gate_proj.weight": "model-00003-of-00004.safetensors",
+    "model.layers.23.mlp.up_proj.weight": "model-00003-of-00004.safetensors",
+    "model.layers.23.post_attention_layernorm.weight": "model-00003-of-00004.safetensors",
+    "model.layers.23.self_attn.k_proj.weight": "model-00003-of-00004.safetensors",
+    "model.layers.23.self_attn.o_proj.weight": "model-00003-of-00004.safetensors",
+    "model.layers.23.self_attn.q_proj.weight": "model-00003-of-00004.safetensors",
+    "model.layers.23.self_attn.v_proj.weight": "model-00003-of-00004.safetensors",
+    "model.layers.24.input_layernorm.weight": "model-00003-of-00004.safetensors",
+    "model.layers.24.mlp.down_proj.weight": "model-00003-of-00004.safetensors",
+    "model.layers.24.mlp.gate_proj.weight": "model-00003-of-00004.safetensors",
+    "model.layers.24.mlp.up_proj.weight": "model-00003-of-00004.safetensors",
+    "model.layers.24.post_attention_layernorm.weight": "model-00003-of-00004.safetensors",
+    "model.layers.24.self_attn.k_proj.weight": "model-00003-of-00004.safetensors",
+    "model.layers.24.self_attn.o_proj.weight": "model-00003-of-00004.safetensors",
+    "model.layers.24.self_attn.q_proj.weight": "model-00003-of-00004.safetensors",
+    "model.layers.24.self_attn.v_proj.weight": "model-00003-of-00004.safetensors",
+    "model.layers.25.input_layernorm.weight": "model-00003-of-00004.safetensors",
+    "model.layers.25.mlp.down_proj.weight": "model-00003-of-00004.safetensors",
+    "model.layers.25.mlp.gate_proj.weight": "model-00003-of-00004.safetensors",
+    "model.layers.25.mlp.up_proj.weight": "model-00003-of-00004.safetensors",
+    "model.layers.25.post_attention_layernorm.weight": "model-00003-of-00004.safetensors",
+    "model.layers.25.self_attn.k_proj.weight": "model-00003-of-00004.safetensors",
+    "model.layers.25.self_attn.o_proj.weight": "model-00003-of-00004.safetensors",
+    "model.layers.25.self_attn.q_proj.weight": "model-00003-of-00004.safetensors",
+    "model.layers.25.self_attn.v_proj.weight": "model-00003-of-00004.safetensors",
+    "model.layers.26.input_layernorm.weight": "model-00003-of-00004.safetensors",
+    "model.layers.26.mlp.down_proj.weight": "model-00003-of-00004.safetensors",
+    "model.layers.26.mlp.gate_proj.weight": "model-00003-of-00004.safetensors",
+    "model.layers.26.mlp.up_proj.weight": "model-00003-of-00004.safetensors",
+    "model.layers.26.post_attention_layernorm.weight": "model-00003-of-00004.safetensors",
+    "model.layers.26.self_attn.k_proj.weight": "model-00003-of-00004.safetensors",
+    "model.layers.26.self_attn.o_proj.weight": "model-00003-of-00004.safetensors",
+    "model.layers.26.self_attn.q_proj.weight": "model-00003-of-00004.safetensors",
+    "model.layers.26.self_attn.v_proj.weight": "model-00003-of-00004.safetensors",
+    "model.layers.27.input_layernorm.weight": "model-00003-of-00004.safetensors",
+    "model.layers.27.mlp.down_proj.weight": "model-00003-of-00004.safetensors",
+    "model.layers.27.mlp.gate_proj.weight": "model-00003-of-00004.safetensors",
+    "model.layers.27.mlp.up_proj.weight": "model-00003-of-00004.safetensors",
+    "model.layers.27.post_attention_layernorm.weight": "model-00003-of-00004.safetensors",
+    "model.layers.27.self_attn.k_proj.weight": "model-00003-of-00004.safetensors",
+    "model.layers.27.self_attn.o_proj.weight": "model-00003-of-00004.safetensors",
+    "model.layers.27.self_attn.q_proj.weight": "model-00003-of-00004.safetensors",
+    "model.layers.27.self_attn.v_proj.weight": "model-00003-of-00004.safetensors",
+    "model.layers.28.input_layernorm.weight": "model-00003-of-00004.safetensors",
+    "model.layers.28.mlp.down_proj.weight": "model-00003-of-00004.safetensors",
+    "model.layers.28.mlp.gate_proj.weight": "model-00003-of-00004.safetensors",
+    "model.layers.28.mlp.up_proj.weight": "model-00003-of-00004.safetensors",
+    "model.layers.28.post_attention_layernorm.weight": "model-00003-of-00004.safetensors",
+    "model.layers.28.self_attn.k_proj.weight": "model-00003-of-00004.safetensors",
+    "model.layers.28.self_attn.o_proj.weight": "model-00003-of-00004.safetensors",
+    "model.layers.28.self_attn.q_proj.weight": "model-00003-of-00004.safetensors",
+    "model.layers.28.self_attn.v_proj.weight": "model-00003-of-00004.safetensors",
+    "model.layers.29.input_layernorm.weight": "model-00003-of-00004.safetensors",
+    "model.layers.29.mlp.down_proj.weight": "model-00003-of-00004.safetensors",
+    "model.layers.29.mlp.gate_proj.weight": "model-00003-of-00004.safetensors",
+    "model.layers.29.mlp.up_proj.weight": "model-00003-of-00004.safetensors",
+    "model.layers.29.post_attention_layernorm.weight": "model-00003-of-00004.safetensors",
+    "model.layers.29.self_attn.k_proj.weight": "model-00003-of-00004.safetensors",
+    "model.layers.29.self_attn.o_proj.weight": "model-00003-of-00004.safetensors",
+    "model.layers.29.self_attn.q_proj.weight": "model-00003-of-00004.safetensors",
+    "model.layers.29.self_attn.v_proj.weight": "model-00003-of-00004.safetensors",
+    "model.layers.3.input_layernorm.weight": "model-00001-of-00004.safetensors",
+    "model.layers.3.mlp.down_proj.weight": "model-00001-of-00004.safetensors",
+    "model.layers.3.mlp.gate_proj.weight": "model-00001-of-00004.safetensors",
+    "model.layers.3.mlp.up_proj.weight": "model-00001-of-00004.safetensors",
+    "model.layers.3.post_attention_layernorm.weight": "model-00001-of-00004.safetensors",
+    "model.layers.3.self_attn.k_proj.weight": "model-00001-of-00004.safetensors",
+    "model.layers.3.self_attn.o_proj.weight": "model-00001-of-00004.safetensors",
+    "model.layers.3.self_attn.q_proj.weight": "model-00001-of-00004.safetensors",
+    "model.layers.3.self_attn.v_proj.weight": "model-00001-of-00004.safetensors",
+    "model.layers.30.input_layernorm.weight": "model-00003-of-00004.safetensors",
+    "model.layers.30.mlp.down_proj.weight": "model-00003-of-00004.safetensors",
+    "model.layers.30.mlp.gate_proj.weight": "model-00003-of-00004.safetensors",
+    "model.layers.30.mlp.up_proj.weight": "model-00003-of-00004.safetensors",
+    "model.layers.30.post_attention_layernorm.weight": "model-00003-of-00004.safetensors",
+    "model.layers.30.self_attn.k_proj.weight": "model-00003-of-00004.safetensors",
+    "model.layers.30.self_attn.o_proj.weight": "model-00003-of-00004.safetensors",
+    "model.layers.30.self_attn.q_proj.weight": "model-00003-of-00004.safetensors",
+    "model.layers.30.self_attn.v_proj.weight": "model-00003-of-00004.safetensors",
+    "model.layers.31.input_layernorm.weight": "model-00004-of-00004.safetensors",
+    "model.layers.31.mlp.down_proj.weight": "model-00004-of-00004.safetensors",
+    "model.layers.31.mlp.gate_proj.weight": "model-00003-of-00004.safetensors",
+    "model.layers.31.mlp.up_proj.weight": "model-00003-of-00004.safetensors",
+    "model.layers.31.post_attention_layernorm.weight": "model-00004-of-00004.safetensors",
+    "model.layers.31.self_attn.k_proj.weight": "model-00003-of-00004.safetensors",
+    "model.layers.31.self_attn.o_proj.weight": "model-00003-of-00004.safetensors",
+    "model.layers.31.self_attn.q_proj.weight": "model-00003-of-00004.safetensors",
+    "model.layers.31.self_attn.v_proj.weight": "model-00003-of-00004.safetensors",
+    "model.layers.4.input_layernorm.weight": "model-00001-of-00004.safetensors",
+    "model.layers.4.mlp.down_proj.weight": "model-00001-of-00004.safetensors",
+    "model.layers.4.mlp.gate_proj.weight": "model-00001-of-00004.safetensors",
+    "model.layers.4.mlp.up_proj.weight": "model-00001-of-00004.safetensors",
+    "model.layers.4.post_attention_layernorm.weight": "model-00001-of-00004.safetensors",
+    "model.layers.4.self_attn.k_proj.weight": "model-00001-of-00004.safetensors",
+    "model.layers.4.self_attn.o_proj.weight": "model-00001-of-00004.safetensors",
+    "model.layers.4.self_attn.q_proj.weight": "model-00001-of-00004.safetensors",
+    "model.layers.4.self_attn.v_proj.weight": "model-00001-of-00004.safetensors",
+    "model.layers.5.input_layernorm.weight": "model-00001-of-00004.safetensors",
+    "model.layers.5.mlp.down_proj.weight": "model-00001-of-00004.safetensors",
+    "model.layers.5.mlp.gate_proj.weight": "model-00001-of-00004.safetensors",
+    "model.layers.5.mlp.up_proj.weight": "model-00001-of-00004.safetensors",
+    "model.layers.5.post_attention_layernorm.weight": "model-00001-of-00004.safetensors",
+    "model.layers.5.self_attn.k_proj.weight": "model-00001-of-00004.safetensors",
+    "model.layers.5.self_attn.o_proj.weight": "model-00001-of-00004.safetensors",
+    "model.layers.5.self_attn.q_proj.weight": "model-00001-of-00004.safetensors",
+    "model.layers.5.self_attn.v_proj.weight": "model-00001-of-00004.safetensors",
+    "model.layers.6.input_layernorm.weight": "model-00001-of-00004.safetensors",
+    "model.layers.6.mlp.down_proj.weight": "model-00001-of-00004.safetensors",
+    "model.layers.6.mlp.gate_proj.weight": "model-00001-of-00004.safetensors",
+    "model.layers.6.mlp.up_proj.weight": "model-00001-of-00004.safetensors",
+    "model.layers.6.post_attention_layernorm.weight": "model-00001-of-00004.safetensors",
+    "model.layers.6.self_attn.k_proj.weight": "model-00001-of-00004.safetensors",
+    "model.layers.6.self_attn.o_proj.weight": "model-00001-of-00004.safetensors",
+    "model.layers.6.self_attn.q_proj.weight": "model-00001-of-00004.safetensors",
+    "model.layers.6.self_attn.v_proj.weight": "model-00001-of-00004.safetensors",
+    "model.layers.7.input_layernorm.weight": "model-00001-of-00004.safetensors",
+    "model.layers.7.mlp.down_proj.weight": "model-00001-of-00004.safetensors",
+    "model.layers.7.mlp.gate_proj.weight": "model-00001-of-00004.safetensors",
+    "model.layers.7.mlp.up_proj.weight": "model-00001-of-00004.safetensors",
+    "model.layers.7.post_attention_layernorm.weight": "model-00001-of-00004.safetensors",
+    "model.layers.7.self_attn.k_proj.weight": "model-00001-of-00004.safetensors",
+    "model.layers.7.self_attn.o_proj.weight": "model-00001-of-00004.safetensors",
+    "model.layers.7.self_attn.q_proj.weight": "model-00001-of-00004.safetensors",
+    "model.layers.7.self_attn.v_proj.weight": "model-00001-of-00004.safetensors",
+    "model.layers.8.input_layernorm.weight": "model-00001-of-00004.safetensors",
+    "model.layers.8.mlp.down_proj.weight": "model-00001-of-00004.safetensors",
+    "model.layers.8.mlp.gate_proj.weight": "model-00001-of-00004.safetensors",
+    "model.layers.8.mlp.up_proj.weight": "model-00001-of-00004.safetensors",
+    "model.layers.8.post_attention_layernorm.weight": "model-00001-of-00004.safetensors",
+    "model.layers.8.self_attn.k_proj.weight": "model-00001-of-00004.safetensors",
+    "model.layers.8.self_attn.o_proj.weight": "model-00001-of-00004.safetensors",
+    "model.layers.8.self_attn.q_proj.weight": "model-00001-of-00004.safetensors",
+    "model.layers.8.self_attn.v_proj.weight": "model-00001-of-00004.safetensors",
+    "model.layers.9.input_layernorm.weight": "model-00002-of-00004.safetensors",
+    "model.layers.9.mlp.down_proj.weight": "model-00002-of-00004.safetensors",
+    "model.layers.9.mlp.gate_proj.weight": "model-00002-of-00004.safetensors",
+    "model.layers.9.mlp.up_proj.weight": "model-00002-of-00004.safetensors",
+    "model.layers.9.post_attention_layernorm.weight": "model-00002-of-00004.safetensors",
+    "model.layers.9.self_attn.k_proj.weight": "model-00002-of-00004.safetensors",
+    "model.layers.9.self_attn.o_proj.weight": "model-00002-of-00004.safetensors",
+    "model.layers.9.self_attn.q_proj.weight": "model-00002-of-00004.safetensors",
+    "model.layers.9.self_attn.v_proj.weight": "model-00002-of-00004.safetensors",
+    "model.norm.weight": "model-00004-of-00004.safetensors"
+  }
+}

checkpoint-190/rng_state_0.pth ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:5a0ef6f96a48e59aa52c4b471312c2a62378c19acc7ebbae839612b03a7d775a
+size 15984

checkpoint-190/rng_state_1.pth ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:ab11d533c0fdad46ea8b8e295ba5fdb705e078eeb88cc28f37d82913508766e9
+size 15984

checkpoint-190/rng_state_2.pth ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:615c168147e3465ce5bfab6da2ff4afc68566ce00ec0f0c6c9fc988038a58d0a
+size 15984

checkpoint-190/rng_state_3.pth ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:79f71e8f8674ecaef9f8cdcbf7ac457a8b8ff15b12694ba2a2fffcb4b43f0f08
+size 15984

checkpoint-190/rng_state_4.pth ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:88cf6d674dab5545c300a55135f08ca935730a3d35e2c419fb0b333f19482c19
+size 15984

checkpoint-190/rng_state_5.pth ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:2754f2cd8824702f027870d93748b3c0491b0ecd30f1e3d8e937116b2be6151f
+size 15984

checkpoint-190/rng_state_6.pth ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:1385124ac55604598f45ea6e2d141f29456647d3e7c10d12ca64ec93d312be8d
+size 15984

checkpoint-190/rng_state_7.pth ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:416538efaec7391fa8fe782fb15146b83e5612d9e1961292c34c53e964806873
+size 15984

checkpoint-190/scheduler.pt ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:e610dd5e9f27fcc75487bd147a6e92e36d0c3d068f260ff6e94230dced07d21d
+size 1064

checkpoint-190/special_tokens_map.json ADDED Viewed

	@@ -0,0 +1,17 @@

+{
+  "bos_token": {
+    "content": "<|begin_of_text|>",
+    "lstrip": false,
+    "normalized": false,
+    "rstrip": false,
+    "single_word": false
+  },
+  "eos_token": {
+    "content": "<|eot_id|>",
+    "lstrip": false,
+    "normalized": false,
+    "rstrip": false,
+    "single_word": false
+  },
+  "pad_token": "<|eot_id|>"
+}

checkpoint-190/tokenizer.json ADDED Viewed

The diff for this file is too large to render. See raw diff

checkpoint-190/tokenizer_config.json ADDED Viewed

	@@ -0,0 +1,2065 @@

+{
+  "added_tokens_decoder": {
+    "128000": {
+      "content": "<|begin_of_text|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128001": {
+      "content": "<|end_of_text|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128002": {
+      "content": "<|reserved_special_token_0|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128003": {
+      "content": "<|reserved_special_token_1|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128004": {
+      "content": "<|reserved_special_token_2|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128005": {
+      "content": "<|reserved_special_token_3|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128006": {
+      "content": "<|start_header_id|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128007": {
+      "content": "<|end_header_id|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128008": {
+      "content": "<|reserved_special_token_4|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128009": {
+      "content": "<|eot_id|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128010": {
+      "content": "<|reserved_special_token_5|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128011": {
+      "content": "<|reserved_special_token_6|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128012": {
+      "content": "<|reserved_special_token_7|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128013": {
+      "content": "<|reserved_special_token_8|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128014": {
+      "content": "<|reserved_special_token_9|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128015": {
+      "content": "<|reserved_special_token_10|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128016": {
+      "content": "<|reserved_special_token_11|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128017": {
+      "content": "<|reserved_special_token_12|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128018": {
+      "content": "<|reserved_special_token_13|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128019": {
+      "content": "<|reserved_special_token_14|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128020": {
+      "content": "<|reserved_special_token_15|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128021": {
+      "content": "<|reserved_special_token_16|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128022": {
+      "content": "<|reserved_special_token_17|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128023": {
+      "content": "<|reserved_special_token_18|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128024": {
+      "content": "<|reserved_special_token_19|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128025": {
+      "content": "<|reserved_special_token_20|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128026": {
+      "content": "<|reserved_special_token_21|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128027": {
+      "content": "<|reserved_special_token_22|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128028": {
+      "content": "<|reserved_special_token_23|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128029": {
+      "content": "<|reserved_special_token_24|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128030": {
+      "content": "<|reserved_special_token_25|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128031": {
+      "content": "<|reserved_special_token_26|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128032": {
+      "content": "<|reserved_special_token_27|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128033": {
+      "content": "<|reserved_special_token_28|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128034": {
+      "content": "<|reserved_special_token_29|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128035": {
+      "content": "<|reserved_special_token_30|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128036": {
+      "content": "<|reserved_special_token_31|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128037": {
+      "content": "<|reserved_special_token_32|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128038": {
+      "content": "<|reserved_special_token_33|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128039": {
+      "content": "<|reserved_special_token_34|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128040": {
+      "content": "<|reserved_special_token_35|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128041": {
+      "content": "<|reserved_special_token_36|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128042": {
+      "content": "<|reserved_special_token_37|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128043": {
+      "content": "<|reserved_special_token_38|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128044": {
+      "content": "<|reserved_special_token_39|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128045": {
+      "content": "<|reserved_special_token_40|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128046": {
+      "content": "<|reserved_special_token_41|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128047": {
+      "content": "<|reserved_special_token_42|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128048": {
+      "content": "<|reserved_special_token_43|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128049": {
+      "content": "<|reserved_special_token_44|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128050": {
+      "content": "<|reserved_special_token_45|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128051": {
+      "content": "<|reserved_special_token_46|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128052": {
+      "content": "<|reserved_special_token_47|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128053": {
+      "content": "<|reserved_special_token_48|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128054": {
+      "content": "<|reserved_special_token_49|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128055": {
+      "content": "<|reserved_special_token_50|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128056": {
+      "content": "<|reserved_special_token_51|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128057": {
+      "content": "<|reserved_special_token_52|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128058": {
+      "content": "<|reserved_special_token_53|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128059": {
+      "content": "<|reserved_special_token_54|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128060": {
+      "content": "<|reserved_special_token_55|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128061": {
+      "content": "<|reserved_special_token_56|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128062": {
+      "content": "<|reserved_special_token_57|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128063": {
+      "content": "<|reserved_special_token_58|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128064": {
+      "content": "<|reserved_special_token_59|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128065": {
+      "content": "<|reserved_special_token_60|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128066": {
+      "content": "<|reserved_special_token_61|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128067": {
+      "content": "<|reserved_special_token_62|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128068": {
+      "content": "<|reserved_special_token_63|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128069": {
+      "content": "<|reserved_special_token_64|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128070": {
+      "content": "<|reserved_special_token_65|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128071": {
+      "content": "<|reserved_special_token_66|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128072": {
+      "content": "<|reserved_special_token_67|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128073": {
+      "content": "<|reserved_special_token_68|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128074": {
+      "content": "<|reserved_special_token_69|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128075": {
+      "content": "<|reserved_special_token_70|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128076": {
+      "content": "<|reserved_special_token_71|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128077": {
+      "content": "<|reserved_special_token_72|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128078": {
+      "content": "<|reserved_special_token_73|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128079": {
+      "content": "<|reserved_special_token_74|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128080": {
+      "content": "<|reserved_special_token_75|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128081": {
+      "content": "<|reserved_special_token_76|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128082": {
+      "content": "<|reserved_special_token_77|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128083": {
+      "content": "<|reserved_special_token_78|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128084": {
+      "content": "<|reserved_special_token_79|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128085": {
+      "content": "<|reserved_special_token_80|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128086": {
+      "content": "<|reserved_special_token_81|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128087": {
+      "content": "<|reserved_special_token_82|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128088": {
+      "content": "<|reserved_special_token_83|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128089": {
+      "content": "<|reserved_special_token_84|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128090": {
+      "content": "<|reserved_special_token_85|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128091": {
+      "content": "<|reserved_special_token_86|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128092": {
+      "content": "<|reserved_special_token_87|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128093": {
+      "content": "<|reserved_special_token_88|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128094": {
+      "content": "<|reserved_special_token_89|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128095": {
+      "content": "<|reserved_special_token_90|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128096": {
+      "content": "<|reserved_special_token_91|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128097": {
+      "content": "<|reserved_special_token_92|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128098": {
+      "content": "<|reserved_special_token_93|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128099": {
+      "content": "<|reserved_special_token_94|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128100": {
+      "content": "<|reserved_special_token_95|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128101": {
+      "content": "<|reserved_special_token_96|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128102": {
+      "content": "<|reserved_special_token_97|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128103": {
+      "content": "<|reserved_special_token_98|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128104": {
+      "content": "<|reserved_special_token_99|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128105": {
+      "content": "<|reserved_special_token_100|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128106": {
+      "content": "<|reserved_special_token_101|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128107": {
+      "content": "<|reserved_special_token_102|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128108": {
+      "content": "<|reserved_special_token_103|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128109": {
+      "content": "<|reserved_special_token_104|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128110": {
+      "content": "<|reserved_special_token_105|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128111": {
+      "content": "<|reserved_special_token_106|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128112": {
+      "content": "<|reserved_special_token_107|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128113": {
+      "content": "<|reserved_special_token_108|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128114": {
+      "content": "<|reserved_special_token_109|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128115": {
+      "content": "<|reserved_special_token_110|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128116": {
+      "content": "<|reserved_special_token_111|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128117": {
+      "content": "<|reserved_special_token_112|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128118": {
+      "content": "<|reserved_special_token_113|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128119": {
+      "content": "<|reserved_special_token_114|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128120": {
+      "content": "<|reserved_special_token_115|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128121": {
+      "content": "<|reserved_special_token_116|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128122": {
+      "content": "<|reserved_special_token_117|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128123": {
+      "content": "<|reserved_special_token_118|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128124": {
+      "content": "<|reserved_special_token_119|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128125": {
+      "content": "<|reserved_special_token_120|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128126": {
+      "content": "<|reserved_special_token_121|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128127": {
+      "content": "<|reserved_special_token_122|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128128": {
+      "content": "<|reserved_special_token_123|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128129": {
+      "content": "<|reserved_special_token_124|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128130": {
+      "content": "<|reserved_special_token_125|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128131": {
+      "content": "<|reserved_special_token_126|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128132": {
+      "content": "<|reserved_special_token_127|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128133": {
+      "content": "<|reserved_special_token_128|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128134": {
+      "content": "<|reserved_special_token_129|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128135": {
+      "content": "<|reserved_special_token_130|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128136": {
+      "content": "<|reserved_special_token_131|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128137": {
+      "content": "<|reserved_special_token_132|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128138": {
+      "content": "<|reserved_special_token_133|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128139": {
+      "content": "<|reserved_special_token_134|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128140": {
+      "content": "<|reserved_special_token_135|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128141": {
+      "content": "<|reserved_special_token_136|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128142": {
+      "content": "<|reserved_special_token_137|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128143": {
+      "content": "<|reserved_special_token_138|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128144": {
+      "content": "<|reserved_special_token_139|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128145": {
+      "content": "<|reserved_special_token_140|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128146": {
+      "content": "<|reserved_special_token_141|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128147": {
+      "content": "<|reserved_special_token_142|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128148": {
+      "content": "<|reserved_special_token_143|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128149": {
+      "content": "<|reserved_special_token_144|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128150": {
+      "content": "<|reserved_special_token_145|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128151": {
+      "content": "<|reserved_special_token_146|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128152": {
+      "content": "<|reserved_special_token_147|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128153": {
+      "content": "<|reserved_special_token_148|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128154": {
+      "content": "<|reserved_special_token_149|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128155": {
+      "content": "<|reserved_special_token_150|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128156": {
+      "content": "<|reserved_special_token_151|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128157": {
+      "content": "<|reserved_special_token_152|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128158": {
+      "content": "<|reserved_special_token_153|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128159": {
+      "content": "<|reserved_special_token_154|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128160": {
+      "content": "<|reserved_special_token_155|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128161": {
+      "content": "<|reserved_special_token_156|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128162": {
+      "content": "<|reserved_special_token_157|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128163": {
+      "content": "<|reserved_special_token_158|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128164": {
+      "content": "<|reserved_special_token_159|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128165": {
+      "content": "<|reserved_special_token_160|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128166": {
+      "content": "<|reserved_special_token_161|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128167": {
+      "content": "<|reserved_special_token_162|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128168": {
+      "content": "<|reserved_special_token_163|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128169": {
+      "content": "<|reserved_special_token_164|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128170": {
+      "content": "<|reserved_special_token_165|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128171": {
+      "content": "<|reserved_special_token_166|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128172": {
+      "content": "<|reserved_special_token_167|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128173": {
+      "content": "<|reserved_special_token_168|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128174": {
+      "content": "<|reserved_special_token_169|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128175": {
+      "content": "<|reserved_special_token_170|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128176": {
+      "content": "<|reserved_special_token_171|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128177": {
+      "content": "<|reserved_special_token_172|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128178": {
+      "content": "<|reserved_special_token_173|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128179": {
+      "content": "<|reserved_special_token_174|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128180": {
+      "content": "<|reserved_special_token_175|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128181": {
+      "content": "<|reserved_special_token_176|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128182": {
+      "content": "<|reserved_special_token_177|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128183": {
+      "content": "<|reserved_special_token_178|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128184": {
+      "content": "<|reserved_special_token_179|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128185": {
+      "content": "<|reserved_special_token_180|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128186": {
+      "content": "<|reserved_special_token_181|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128187": {
+      "content": "<|reserved_special_token_182|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128188": {
+      "content": "<|reserved_special_token_183|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128189": {
+      "content": "<|reserved_special_token_184|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128190": {
+      "content": "<|reserved_special_token_185|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128191": {
+      "content": "<|reserved_special_token_186|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128192": {
+      "content": "<|reserved_special_token_187|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128193": {
+      "content": "<|reserved_special_token_188|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128194": {
+      "content": "<|reserved_special_token_189|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128195": {
+      "content": "<|reserved_special_token_190|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128196": {
+      "content": "<|reserved_special_token_191|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128197": {
+      "content": "<|reserved_special_token_192|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128198": {
+      "content": "<|reserved_special_token_193|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128199": {
+      "content": "<|reserved_special_token_194|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128200": {
+      "content": "<|reserved_special_token_195|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128201": {
+      "content": "<|reserved_special_token_196|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128202": {
+      "content": "<|reserved_special_token_197|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128203": {
+      "content": "<|reserved_special_token_198|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128204": {
+      "content": "<|reserved_special_token_199|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128205": {
+      "content": "<|reserved_special_token_200|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128206": {
+      "content": "<|reserved_special_token_201|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128207": {
+      "content": "<|reserved_special_token_202|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128208": {
+      "content": "<|reserved_special_token_203|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128209": {
+      "content": "<|reserved_special_token_204|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128210": {
+      "content": "<|reserved_special_token_205|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128211": {
+      "content": "<|reserved_special_token_206|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128212": {
+      "content": "<|reserved_special_token_207|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128213": {
+      "content": "<|reserved_special_token_208|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128214": {
+      "content": "<|reserved_special_token_209|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128215": {
+      "content": "<|reserved_special_token_210|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128216": {
+      "content": "<|reserved_special_token_211|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128217": {
+      "content": "<|reserved_special_token_212|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128218": {
+      "content": "<|reserved_special_token_213|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128219": {
+      "content": "<|reserved_special_token_214|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128220": {
+      "content": "<|reserved_special_token_215|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128221": {
+      "content": "<|reserved_special_token_216|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128222": {
+      "content": "<|reserved_special_token_217|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128223": {
+      "content": "<|reserved_special_token_218|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128224": {
+      "content": "<|reserved_special_token_219|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128225": {
+      "content": "<|reserved_special_token_220|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128226": {
+      "content": "<|reserved_special_token_221|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128227": {
+      "content": "<|reserved_special_token_222|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128228": {
+      "content": "<|reserved_special_token_223|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128229": {
+      "content": "<|reserved_special_token_224|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128230": {
+      "content": "<|reserved_special_token_225|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128231": {
+      "content": "<|reserved_special_token_226|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128232": {
+      "content": "<|reserved_special_token_227|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128233": {
+      "content": "<|reserved_special_token_228|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128234": {
+      "content": "<|reserved_special_token_229|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128235": {
+      "content": "<|reserved_special_token_230|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128236": {
+      "content": "<|reserved_special_token_231|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128237": {
+      "content": "<|reserved_special_token_232|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128238": {
+      "content": "<|reserved_special_token_233|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128239": {
+      "content": "<|reserved_special_token_234|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128240": {
+      "content": "<|reserved_special_token_235|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128241": {
+      "content": "<|reserved_special_token_236|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128242": {
+      "content": "<|reserved_special_token_237|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128243": {
+      "content": "<|reserved_special_token_238|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128244": {
+      "content": "<|reserved_special_token_239|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128245": {
+      "content": "<|reserved_special_token_240|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128246": {
+      "content": "<|reserved_special_token_241|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128247": {
+      "content": "<|reserved_special_token_242|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128248": {
+      "content": "<|reserved_special_token_243|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128249": {
+      "content": "<|reserved_special_token_244|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128250": {
+      "content": "<|reserved_special_token_245|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128251": {
+      "content": "<|reserved_special_token_246|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128252": {
+      "content": "<|reserved_special_token_247|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128253": {
+      "content": "<|reserved_special_token_248|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128254": {
+      "content": "<|reserved_special_token_249|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128255": {
+      "content": "<|reserved_special_token_250|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    }
+  },
+  "bos_token": "<|begin_of_text|>",
+  "chat_template": "{{ '<|begin_of_text|>' }}{% if messages[0]['role'] == 'system' %}{% set system_message = messages[0]['content'] %}{% endif %}{% if system_message is defined %}{{ '<|start_header_id|>system<|end_header_id|>\n\n' + system_message + '<|eot_id|>' }}{% endif %}{% for message in messages %}{% set content = message['content'] %}{% if message['role'] == 'user' %}{{ '<|start_header_id|>user<|end_header_id|>\n\n' + content + '<|eot_id|><|start_header_id|>assistant<|end_header_id|>\n\n' }}{% elif message['role'] == 'assistant' %}{{ content + '<|eot_id|>' }}{% endif %}{% endfor %}",
+  "clean_up_tokenization_spaces": true,
+  "eos_token": "<|eot_id|>",
+  "model_input_names": [
+    "input_ids",
+    "attention_mask"
+  ],
+  "model_max_length": 1000000000000000019884624838656,
+  "pad_token": "<|eot_id|>",
+  "padding_side": "right",
+  "split_special_tokens": false,
+  "tokenizer_class": "PreTrainedTokenizerFast"
+}

checkpoint-190/trainer_state.json ADDED Viewed

	@@ -0,0 +1,1553 @@

+{
+  "best_metric": null,
+  "best_model_checkpoint": null,
+  "epoch": 4.903225806451613,
+  "eval_steps": 500,
+  "global_step": 190,
+  "is_hyper_param_search": false,
+  "is_local_process_zero": true,
+  "is_world_process_zero": true,
+  "log_history": [
+    {
+      "epoch": 0.025806451612903226,
+      "grad_norm": 611.8341064453125,
+      "learning_rate": 5.000000000000001e-07,
+      "loss": 13.7821,
+      "num_input_tokens_seen": 6416,
+      "step": 1
+    },
+    {
+      "epoch": 0.05161290322580645,
+      "grad_norm": 617.9733276367188,
+      "learning_rate": 1.0000000000000002e-06,
+      "loss": 13.6363,
+      "num_input_tokens_seen": 12992,
+      "step": 2
+    },
+    {
+      "epoch": 0.07741935483870968,
+      "grad_norm": 608.6278686523438,
+      "learning_rate": 1.5e-06,
+      "loss": 13.6033,
+      "num_input_tokens_seen": 19472,
+      "step": 3
+    },
+    {
+      "epoch": 0.1032258064516129,
+      "grad_norm": 618.8984985351562,
+      "learning_rate": 2.0000000000000003e-06,
+      "loss": 12.5696,
+      "num_input_tokens_seen": 25936,
+      "step": 4
+    },
+    {
+      "epoch": 0.12903225806451613,
+      "grad_norm": 481.14508056640625,
+      "learning_rate": 2.5e-06,
+      "loss": 9.3589,
+      "num_input_tokens_seen": 32272,
+      "step": 5
+    },
+    {
+      "epoch": 0.15483870967741936,
+      "grad_norm": 592.4844970703125,
+      "learning_rate": 3e-06,
+      "loss": 6.7715,
+      "num_input_tokens_seen": 38640,
+      "step": 6
+    },
+    {
+      "epoch": 0.18064516129032257,
+      "grad_norm": 468.1033935546875,
+      "learning_rate": 3.5e-06,
+      "loss": 5.3541,
+      "num_input_tokens_seen": 44992,
+      "step": 7
+    },
+    {
+      "epoch": 0.2064516129032258,
+      "grad_norm": 226.9576416015625,
+      "learning_rate": 4.000000000000001e-06,
+      "loss": 1.9295,
+      "num_input_tokens_seen": 51328,
+      "step": 8
+    },
+    {
+      "epoch": 0.23225806451612904,
+      "grad_norm": 106.9604721069336,
+      "learning_rate": 4.5e-06,
+      "loss": 0.6328,
+      "num_input_tokens_seen": 57408,
+      "step": 9
+    },
+    {
+      "epoch": 0.25806451612903225,
+      "grad_norm": 426.4488830566406,
+      "learning_rate": 5e-06,
+      "loss": 3.3225,
+      "num_input_tokens_seen": 63696,
+      "step": 10
+    },
+    {
+      "epoch": 0.2838709677419355,
+      "grad_norm": 28.350229263305664,
+      "learning_rate": 4.9996192378909785e-06,
+      "loss": 0.2598,
+      "num_input_tokens_seen": 69984,
+      "step": 11
+    },
+    {
+      "epoch": 0.3096774193548387,
+      "grad_norm": 198.60235595703125,
+      "learning_rate": 4.99847706754774e-06,
+      "loss": 0.6874,
+      "num_input_tokens_seen": 76384,
+      "step": 12
+    },
+    {
+      "epoch": 0.33548387096774196,
+      "grad_norm": 286.51763916015625,
+      "learning_rate": 4.9965738368864345e-06,
+      "loss": 2.0329,
+      "num_input_tokens_seen": 82704,
+      "step": 13
+    },
+    {
+      "epoch": 0.36129032258064514,
+      "grad_norm": 76.4217300415039,
+      "learning_rate": 4.993910125649561e-06,
+      "loss": 0.4942,
+      "num_input_tokens_seen": 88976,
+      "step": 14
+    },
+    {
+      "epoch": 0.3870967741935484,
+      "grad_norm": 150.88587951660156,
+      "learning_rate": 4.990486745229364e-06,
+      "loss": 1.1786,
+      "num_input_tokens_seen": 95472,
+      "step": 15
+    },
+    {
+      "epoch": 0.4129032258064516,
+      "grad_norm": 60.549949645996094,
+      "learning_rate": 4.986304738420684e-06,
+      "loss": 0.4424,
+      "num_input_tokens_seen": 101904,
+      "step": 16
+    },
+    {
+      "epoch": 0.43870967741935485,
+      "grad_norm": 56.29042053222656,
+      "learning_rate": 4.981365379103306e-06,
+      "loss": 0.3336,
+      "num_input_tokens_seen": 108272,
+      "step": 17
+    },
+    {
+      "epoch": 0.4645161290322581,
+      "grad_norm": 27.45728874206543,
+      "learning_rate": 4.975670171853926e-06,
+      "loss": 0.2568,
+      "num_input_tokens_seen": 114464,
+      "step": 18
+    },
+    {
+      "epoch": 0.49032258064516127,
+      "grad_norm": 20.99466323852539,
+      "learning_rate": 4.9692208514878445e-06,
+      "loss": 0.1889,
+      "num_input_tokens_seen": 120816,
+      "step": 19
+    },
+    {
+      "epoch": 0.5161290322580645,
+      "grad_norm": 13.661433219909668,
+      "learning_rate": 4.962019382530521e-06,
+      "loss": 0.1974,
+      "num_input_tokens_seen": 127120,
+      "step": 20
+    },
+    {
+      "epoch": 0.5419354838709678,
+      "grad_norm": 16.250490188598633,
+      "learning_rate": 4.9540679586191605e-06,
+      "loss": 0.1766,
+      "num_input_tokens_seen": 133712,
+      "step": 21
+    },
+    {
+      "epoch": 0.567741935483871,
+      "grad_norm": 10.539461135864258,
+      "learning_rate": 4.9453690018345144e-06,
+      "loss": 0.1694,
+      "num_input_tokens_seen": 139904,
+      "step": 22
+    },
+    {
+      "epoch": 0.5935483870967742,
+      "grad_norm": 11.246196746826172,
+      "learning_rate": 4.935925161963089e-06,
+      "loss": 0.1374,
+      "num_input_tokens_seen": 146256,
+      "step": 23
+    },
+    {
+      "epoch": 0.6193548387096774,
+      "grad_norm": 16.509199142456055,
+      "learning_rate": 4.925739315689991e-06,
+      "loss": 0.1496,
+      "num_input_tokens_seen": 152784,
+      "step": 24
+    },
+    {
+      "epoch": 0.6451612903225806,
+      "grad_norm": 7.252533435821533,
+      "learning_rate": 4.914814565722671e-06,
+      "loss": 0.1554,
+      "num_input_tokens_seen": 158976,
+      "step": 25
+    },
+    {
+      "epoch": 0.6709677419354839,
+      "grad_norm": 11.432785034179688,
+      "learning_rate": 4.903154239845798e-06,
+      "loss": 0.0918,
+      "num_input_tokens_seen": 165280,
+      "step": 26
+    },
+    {
+      "epoch": 0.6967741935483871,
+      "grad_norm": 8.87109375,
+      "learning_rate": 4.890761889907589e-06,
+      "loss": 0.1062,
+      "num_input_tokens_seen": 171808,
+      "step": 27
+    },
+    {
+      "epoch": 0.7225806451612903,
+      "grad_norm": 26.34603500366211,
+      "learning_rate": 4.8776412907378845e-06,
+      "loss": 0.1975,
+      "num_input_tokens_seen": 178112,
+      "step": 28
+    },
+    {
+      "epoch": 0.7483870967741936,
+      "grad_norm": 20.092260360717773,
+      "learning_rate": 4.863796438998293e-06,
+      "loss": 0.1389,
+      "num_input_tokens_seen": 184448,
+      "step": 29
+    },
+    {
+      "epoch": 0.7741935483870968,
+      "grad_norm": 16.30493927001953,
+      "learning_rate": 4.849231551964771e-06,
+      "loss": 0.1382,
+      "num_input_tokens_seen": 190896,
+      "step": 30
+    },
+    {
+      "epoch": 0.8,
+      "grad_norm": 20.723533630371094,
+      "learning_rate": 4.833951066243004e-06,
+      "loss": 0.1982,
+      "num_input_tokens_seen": 197024,
+      "step": 31
+    },
+    {
+      "epoch": 0.8258064516129032,
+      "grad_norm": 7.432217597961426,
+      "learning_rate": 4.817959636416969e-06,
+      "loss": 0.1072,
+      "num_input_tokens_seen": 203248,
+      "step": 32
+    },
+    {
+      "epoch": 0.8516129032258064,
+      "grad_norm": 8.914057731628418,
+      "learning_rate": 4.801262133631101e-06,
+      "loss": 0.0757,
+      "num_input_tokens_seen": 209760,
+      "step": 33
+    },
+    {
+      "epoch": 0.8774193548387097,
+      "grad_norm": 12.913470268249512,
+      "learning_rate": 4.783863644106502e-06,
+      "loss": 0.0829,
+      "num_input_tokens_seen": 215968,
+      "step": 34
+    },
+    {
+      "epoch": 0.9032258064516129,
+      "grad_norm": 8.646073341369629,
+      "learning_rate": 4.765769467591626e-06,
+      "loss": 0.1017,
+      "num_input_tokens_seen": 222192,
+      "step": 35
+    },
+    {
+      "epoch": 0.9290322580645162,
+      "grad_norm": 11.357608795166016,
+      "learning_rate": 4.746985115747918e-06,
+      "loss": 0.0957,
+      "num_input_tokens_seen": 228512,
+      "step": 36
+    },
+    {
+      "epoch": 0.9548387096774194,
+      "grad_norm": 6.806307315826416,
+      "learning_rate": 4.72751631047092e-06,
+      "loss": 0.0999,
+      "num_input_tokens_seen": 235120,
+      "step": 37
+    },
+    {
+      "epoch": 0.9806451612903225,
+      "grad_norm": 7.694289684295654,
+      "learning_rate": 4.707368982147318e-06,
+      "loss": 0.0581,
+      "num_input_tokens_seen": 241584,
+      "step": 38
+    },
+    {
+      "epoch": 1.0064516129032257,
+      "grad_norm": 6.573248386383057,
+      "learning_rate": 4.68654926784849e-06,
+      "loss": 0.0923,
+      "num_input_tokens_seen": 248080,
+      "step": 39
+    },
+    {
+      "epoch": 1.032258064516129,
+      "grad_norm": 6.997208118438721,
+      "learning_rate": 4.665063509461098e-06,
+      "loss": 0.0506,
+      "num_input_tokens_seen": 254416,
+      "step": 40
+    },
+    {
+      "epoch": 1.0580645161290323,
+      "grad_norm": 8.015267372131348,
+      "learning_rate": 4.642918251755281e-06,
+      "loss": 0.0333,
+      "num_input_tokens_seen": 260640,
+      "step": 41
+    },
+    {
+      "epoch": 1.0838709677419356,
+      "grad_norm": 6.756544589996338,
+      "learning_rate": 4.620120240391065e-06,
+      "loss": 0.038,
+      "num_input_tokens_seen": 267072,
+      "step": 42
+    },
+    {
+      "epoch": 1.1096774193548387,
+      "grad_norm": 4.104006290435791,
+      "learning_rate": 4.596676419863561e-06,
+      "loss": 0.0416,
+      "num_input_tokens_seen": 273392,
+      "step": 43
+    },
+    {
+      "epoch": 1.135483870967742,
+      "grad_norm": 16.92180633544922,
+      "learning_rate": 4.572593931387604e-06,
+      "loss": 0.1068,
+      "num_input_tokens_seen": 279680,
+      "step": 44
+    },
+    {
+      "epoch": 1.1612903225806452,
+      "grad_norm": 6.803272247314453,
+      "learning_rate": 4.54788011072248e-06,
+      "loss": 0.0369,
+      "num_input_tokens_seen": 285968,
+      "step": 45
+    },
+    {
+      "epoch": 1.1870967741935483,
+      "grad_norm": 10.87576675415039,
+      "learning_rate": 4.522542485937369e-06,
+      "loss": 0.1703,
+      "num_input_tokens_seen": 292304,
+      "step": 46
+    },
+    {
+      "epoch": 1.2129032258064516,
+      "grad_norm": 10.078003883361816,
+      "learning_rate": 4.496588775118232e-06,
+      "loss": 0.1102,
+      "num_input_tokens_seen": 298608,
+      "step": 47
+    },
+    {
+      "epoch": 1.238709677419355,
+      "grad_norm": 14.269394874572754,
+      "learning_rate": 4.470026884016805e-06,
+      "loss": 0.0595,
+      "num_input_tokens_seen": 304912,
+      "step": 48
+    },
+    {
+      "epoch": 1.2645161290322582,
+      "grad_norm": 12.623174667358398,
+      "learning_rate": 4.442864903642428e-06,
+      "loss": 0.1009,
+      "num_input_tokens_seen": 311328,
+      "step": 49
+    },
+    {
+      "epoch": 1.2903225806451613,
+      "grad_norm": 6.7360053062438965,
+      "learning_rate": 4.415111107797445e-06,
+      "loss": 0.0434,
+      "num_input_tokens_seen": 317664,
+      "step": 50
+    },
+    {
+      "epoch": 1.3161290322580645,
+      "grad_norm": 1.8871471881866455,
+      "learning_rate": 4.386773950556931e-06,
+      "loss": 0.0281,
+      "num_input_tokens_seen": 324128,
+      "step": 51
+    },
+    {
+      "epoch": 1.3419354838709676,
+      "grad_norm": 8.304376602172852,
+      "learning_rate": 4.357862063693486e-06,
+      "loss": 0.0513,
+      "num_input_tokens_seen": 330304,
+      "step": 52
+    },
+    {
+      "epoch": 1.367741935483871,
+      "grad_norm": 9.218457221984863,
+      "learning_rate": 4.328384254047927e-06,
+      "loss": 0.0902,
+      "num_input_tokens_seen": 336608,
+      "step": 53
+    },
+    {
+      "epoch": 1.3935483870967742,
+      "grad_norm": 6.52198600769043,
+      "learning_rate": 4.2983495008466285e-06,
+      "loss": 0.0448,
+      "num_input_tokens_seen": 342944,
+      "step": 54
+    },
+    {
+      "epoch": 1.4193548387096775,
+      "grad_norm": 5.9580397605896,
+      "learning_rate": 4.267766952966369e-06,
+      "loss": 0.036,
+      "num_input_tokens_seen": 349504,
+      "step": 55
+    },
+    {
+      "epoch": 1.4451612903225808,
+      "grad_norm": 7.217082977294922,
+      "learning_rate": 4.236645926147493e-06,
+      "loss": 0.0279,
+      "num_input_tokens_seen": 355808,
+      "step": 56
+    },
+    {
+      "epoch": 1.4709677419354839,
+      "grad_norm": 8.09554386138916,
+      "learning_rate": 4.204995900156247e-06,
+      "loss": 0.0527,
+      "num_input_tokens_seen": 362144,
+      "step": 57
+    },
+    {
+      "epoch": 1.4967741935483871,
+      "grad_norm": 9.561200141906738,
+      "learning_rate": 4.172826515897146e-06,
+      "loss": 0.0466,
+      "num_input_tokens_seen": 368800,
+      "step": 58
+    },
+    {
+      "epoch": 1.5225806451612902,
+      "grad_norm": 4.221444606781006,
+      "learning_rate": 4.140147572476269e-06,
+      "loss": 0.0203,
+      "num_input_tokens_seen": 375264,
+      "step": 59
+    },
+    {
+      "epoch": 1.5483870967741935,
+      "grad_norm": 8.664204597473145,
+      "learning_rate": 4.106969024216348e-06,
+      "loss": 0.0693,
+      "num_input_tokens_seen": 381408,
+      "step": 60
+    },
+    {
+      "epoch": 1.5741935483870968,
+      "grad_norm": 3.899017333984375,
+      "learning_rate": 4.073300977624594e-06,
+      "loss": 0.0193,
+      "num_input_tokens_seen": 387552,
+      "step": 61
+    },
+    {
+      "epoch": 1.6,
+      "grad_norm": 8.732043266296387,
+      "learning_rate": 4.039153688314146e-06,
+      "loss": 0.1155,
+      "num_input_tokens_seen": 394128,
+      "step": 62
+    },
+    {
+      "epoch": 1.6258064516129034,
+      "grad_norm": 5.531858921051025,
+      "learning_rate": 4.0045375578801216e-06,
+      "loss": 0.0594,
+      "num_input_tokens_seen": 400512,
+      "step": 63
+    },
+    {
+      "epoch": 1.6516129032258065,
+      "grad_norm": 8.751105308532715,
+      "learning_rate": 3.969463130731183e-06,
+      "loss": 0.0391,
+      "num_input_tokens_seen": 406752,
+      "step": 64
+    },
+    {
+      "epoch": 1.6774193548387095,
+      "grad_norm": 5.837942600250244,
+      "learning_rate": 3.933941090877615e-06,
+      "loss": 0.0552,
+      "num_input_tokens_seen": 413040,
+      "step": 65
+    },
+    {
+      "epoch": 1.7032258064516128,
+      "grad_norm": 3.627204418182373,
+      "learning_rate": 3.897982258676867e-06,
+      "loss": 0.03,
+      "num_input_tokens_seen": 419408,
+      "step": 66
+    },
+    {
+      "epoch": 1.729032258064516,
+      "grad_norm": 7.315670490264893,
+      "learning_rate": 3.861597587537568e-06,
+      "loss": 0.0458,
+      "num_input_tokens_seen": 425920,
+      "step": 67
+    },
+    {
+      "epoch": 1.7548387096774194,
+      "grad_norm": 5.958889484405518,
+      "learning_rate": 3.824798160583012e-06,
+      "loss": 0.0502,
+      "num_input_tokens_seen": 432400,
+      "step": 68
+    },
+    {
+      "epoch": 1.7806451612903227,
+      "grad_norm": 6.365023136138916,
+      "learning_rate": 3.787595187275136e-06,
+      "loss": 0.0513,
+      "num_input_tokens_seen": 438688,
+      "step": 69
+    },
+    {
+      "epoch": 1.8064516129032258,
+      "grad_norm": 3.058981418609619,
+      "learning_rate": 3.7500000000000005e-06,
+      "loss": 0.0309,
+      "num_input_tokens_seen": 445280,
+      "step": 70
+    },
+    {
+      "epoch": 1.832258064516129,
+      "grad_norm": 4.8149003982543945,
+      "learning_rate": 3.7120240506158433e-06,
+      "loss": 0.0889,
+      "num_input_tokens_seen": 451616,
+      "step": 71
+    },
+    {
+      "epoch": 1.8580645161290321,
+      "grad_norm": 7.181830406188965,
+      "learning_rate": 3.6736789069647273e-06,
+      "loss": 0.0868,
+      "num_input_tokens_seen": 457856,
+      "step": 72
+    },
+    {
+      "epoch": 1.8838709677419354,
+      "grad_norm": 7.750051975250244,
+      "learning_rate": 3.634976249348867e-06,
+      "loss": 0.0516,
+      "num_input_tokens_seen": 464144,
+      "step": 73
+    },
+    {
+      "epoch": 1.9096774193548387,
+      "grad_norm": 5.294251918792725,
+      "learning_rate": 3.595927866972694e-06,
+      "loss": 0.059,
+      "num_input_tokens_seen": 470736,
+      "step": 74
+    },
+    {
+      "epoch": 1.935483870967742,
+      "grad_norm": 4.239963531494141,
+      "learning_rate": 3.556545654351749e-06,
+      "loss": 0.0475,
+      "num_input_tokens_seen": 477168,
+      "step": 75
+    },
+    {
+      "epoch": 1.9612903225806453,
+      "grad_norm": 5.429728031158447,
+      "learning_rate": 3.516841607689501e-06,
+      "loss": 0.0704,
+      "num_input_tokens_seen": 483536,
+      "step": 76
+    },
+    {
+      "epoch": 1.9870967741935484,
+      "grad_norm": 11.018205642700195,
+      "learning_rate": 3.476827821223184e-06,
+      "loss": 0.0666,
+      "num_input_tokens_seen": 489760,
+      "step": 77
+    },
+    {
+      "epoch": 2.0129032258064514,
+      "grad_norm": 8.510910987854004,
+      "learning_rate": 3.436516483539781e-06,
+      "loss": 0.0275,
+      "num_input_tokens_seen": 496000,
+      "step": 78
+    },
+    {
+      "epoch": 2.0387096774193547,
+      "grad_norm": 4.036402225494385,
+      "learning_rate": 3.39591987386325e-06,
+      "loss": 0.0169,
+      "num_input_tokens_seen": 502384,
+      "step": 79
+    },
+    {
+      "epoch": 2.064516129032258,
+      "grad_norm": 1.8402727842330933,
+      "learning_rate": 3.3550503583141726e-06,
+      "loss": 0.0056,
+      "num_input_tokens_seen": 508992,
+      "step": 80
+    },
+    {
+      "epoch": 2.0903225806451613,
+      "grad_norm": 3.9755101203918457,
+      "learning_rate": 3.313920386142892e-06,
+      "loss": 0.0139,
+      "num_input_tokens_seen": 515216,
+      "step": 81
+    },
+    {
+      "epoch": 2.1161290322580646,
+      "grad_norm": 6.4678168296813965,
+      "learning_rate": 3.272542485937369e-06,
+      "loss": 0.0561,
+      "num_input_tokens_seen": 521792,
+      "step": 82
+    },
+    {
+      "epoch": 2.141935483870968,
+      "grad_norm": 4.438370704650879,
+      "learning_rate": 3.230929261806842e-06,
+      "loss": 0.0098,
+      "num_input_tokens_seen": 528176,
+      "step": 83
+    },
+    {
+      "epoch": 2.167741935483871,
+      "grad_norm": 1.3302000761032104,
+      "learning_rate": 3.189093389542498e-06,
+      "loss": 0.0037,
+      "num_input_tokens_seen": 534496,
+      "step": 84
+    },
+    {
+      "epoch": 2.193548387096774,
+      "grad_norm": 4.607197284698486,
+      "learning_rate": 3.147047612756302e-06,
+      "loss": 0.0194,
+      "num_input_tokens_seen": 541024,
+      "step": 85
+    },
+    {
+      "epoch": 2.2193548387096773,
+      "grad_norm": 0.3103199899196625,
+      "learning_rate": 3.1048047389991693e-06,
+      "loss": 0.0004,
+      "num_input_tokens_seen": 547328,
+      "step": 86
+    },
+    {
+      "epoch": 2.2451612903225806,
+      "grad_norm": 0.17417627573013306,
+      "learning_rate": 3.062377635859663e-06,
+      "loss": 0.0003,
+      "num_input_tokens_seen": 553760,
+      "step": 87
+    },
+    {
+      "epoch": 2.270967741935484,
+      "grad_norm": 21.153165817260742,
+      "learning_rate": 3.019779227044398e-06,
+      "loss": 0.0511,
+      "num_input_tokens_seen": 560048,
+      "step": 88
+    },
+    {
+      "epoch": 2.296774193548387,
+      "grad_norm": 1.729843020439148,
+      "learning_rate": 2.9770224884413625e-06,
+      "loss": 0.0974,
+      "num_input_tokens_seen": 566624,
+      "step": 89
+    },
+    {
+      "epoch": 2.3225806451612905,
+      "grad_norm": 14.893946647644043,
+      "learning_rate": 2.9341204441673267e-06,
+      "loss": 0.0442,
+      "num_input_tokens_seen": 572864,
+      "step": 90
+    },
+    {
+      "epoch": 2.3483870967741938,
+      "grad_norm": 6.81472110748291,
+      "learning_rate": 2.8910861626005774e-06,
+      "loss": 0.0802,
+      "num_input_tokens_seen": 579024,
+      "step": 91
+    },
+    {
+      "epoch": 2.3741935483870966,
+      "grad_norm": 8.73901653289795,
+      "learning_rate": 2.847932752400164e-06,
+      "loss": 0.0195,
+      "num_input_tokens_seen": 585536,
+      "step": 92
+    },
+    {
+      "epoch": 2.4,
+      "grad_norm": 2.9088733196258545,
+      "learning_rate": 2.804673358512869e-06,
+      "loss": 0.055,
+      "num_input_tokens_seen": 591792,
+      "step": 93
+    },
+    {
+      "epoch": 2.425806451612903,
+      "grad_norm": 4.13192081451416,
+      "learning_rate": 2.761321158169134e-06,
+      "loss": 0.0268,
+      "num_input_tokens_seen": 598144,
+      "step": 94
+    },
+    {
+      "epoch": 2.4516129032258065,
+      "grad_norm": 3.6112844944000244,
+      "learning_rate": 2.717889356869146e-06,
+      "loss": 0.0196,
+      "num_input_tokens_seen": 604496,
+      "step": 95
+    },
+    {
+      "epoch": 2.47741935483871,
+      "grad_norm": 6.083769798278809,
+      "learning_rate": 2.6743911843603134e-06,
+      "loss": 0.0363,
+      "num_input_tokens_seen": 610784,
+      "step": 96
+    },
+    {
+      "epoch": 2.5032258064516126,
+      "grad_norm": 1.1240483522415161,
+      "learning_rate": 2.6308398906073603e-06,
+      "loss": 0.0046,
+      "num_input_tokens_seen": 617024,
+      "step": 97
+    },
+    {
+      "epoch": 2.5290322580645164,
+      "grad_norm": 7.753751277923584,
+      "learning_rate": 2.587248741756253e-06,
+      "loss": 0.0366,
+      "num_input_tokens_seen": 623312,
+      "step": 98
+    },
+    {
+      "epoch": 2.554838709677419,
+      "grad_norm": 1.1425215005874634,
+      "learning_rate": 2.543631016093209e-06,
+      "loss": 0.0051,
+      "num_input_tokens_seen": 629616,
+      "step": 99
+    },
+    {
+      "epoch": 2.5806451612903225,
+      "grad_norm": 2.6504504680633545,
+      "learning_rate": 2.5e-06,
+      "loss": 0.0226,
+      "num_input_tokens_seen": 636144,
+      "step": 100
+    },
+    {
+      "epoch": 2.606451612903226,
+      "grad_norm": 5.269250869750977,
+      "learning_rate": 2.4563689839067913e-06,
+      "loss": 0.0818,
+      "num_input_tokens_seen": 642496,
+      "step": 101
+    },
+    {
+      "epoch": 2.632258064516129,
+      "grad_norm": 6.670433044433594,
+      "learning_rate": 2.4127512582437486e-06,
+      "loss": 0.0247,
+      "num_input_tokens_seen": 648912,
+      "step": 102
+    },
+    {
+      "epoch": 2.6580645161290324,
+      "grad_norm": 2.8113598823547363,
+      "learning_rate": 2.3691601093926406e-06,
+      "loss": 0.0593,
+      "num_input_tokens_seen": 655088,
+      "step": 103
+    },
+    {
+      "epoch": 2.6838709677419352,
+      "grad_norm": 4.226614475250244,
+      "learning_rate": 2.325608815639687e-06,
+      "loss": 0.0073,
+      "num_input_tokens_seen": 661680,
+      "step": 104
+    },
+    {
+      "epoch": 2.709677419354839,
+      "grad_norm": 2.636570453643799,
+      "learning_rate": 2.2821106431308546e-06,
+      "loss": 0.0295,
+      "num_input_tokens_seen": 668016,
+      "step": 105
+    },
+    {
+      "epoch": 2.735483870967742,
+      "grad_norm": 7.529627323150635,
+      "learning_rate": 2.238678841830867e-06,
+      "loss": 0.0115,
+      "num_input_tokens_seen": 674176,
+      "step": 106
+    },
+    {
+      "epoch": 2.761290322580645,
+      "grad_norm": 2.3682408332824707,
+      "learning_rate": 2.195326641487132e-06,
+      "loss": 0.0064,
+      "num_input_tokens_seen": 680464,
+      "step": 107
+    },
+    {
+      "epoch": 2.7870967741935484,
+      "grad_norm": 4.345768451690674,
+      "learning_rate": 2.1520672475998374e-06,
+      "loss": 0.0229,
+      "num_input_tokens_seen": 686688,
+      "step": 108
+    },
+    {
+      "epoch": 2.8129032258064517,
+      "grad_norm": 8.903531074523926,
+      "learning_rate": 2.1089138373994226e-06,
+      "loss": 0.0605,
+      "num_input_tokens_seen": 692992,
+      "step": 109
+    },
+    {
+      "epoch": 2.838709677419355,
+      "grad_norm": 9.090164184570312,
+      "learning_rate": 2.0658795558326745e-06,
+      "loss": 0.05,
+      "num_input_tokens_seen": 699392,
+      "step": 110
+    },
+    {
+      "epoch": 2.864516129032258,
+      "grad_norm": 5.729383945465088,
+      "learning_rate": 2.022977511558638e-06,
+      "loss": 0.0544,
+      "num_input_tokens_seen": 705680,
+      "step": 111
+    },
+    {
+      "epoch": 2.8903225806451616,
+      "grad_norm": 2.055316925048828,
+      "learning_rate": 1.9802207729556023e-06,
+      "loss": 0.0109,
+      "num_input_tokens_seen": 711952,
+      "step": 112
+    },
+    {
+      "epoch": 2.9161290322580644,
+      "grad_norm": 4.638775825500488,
+      "learning_rate": 1.937622364140338e-06,
+      "loss": 0.0242,
+      "num_input_tokens_seen": 718192,
+      "step": 113
+    },
+    {
+      "epoch": 2.9419354838709677,
+      "grad_norm": 6.185389995574951,
+      "learning_rate": 1.895195261000831e-06,
+      "loss": 0.0223,
+      "num_input_tokens_seen": 724832,
+      "step": 114
+    },
+    {
+      "epoch": 2.967741935483871,
+      "grad_norm": 3.262885332107544,
+      "learning_rate": 1.852952387243698e-06,
+      "loss": 0.0263,
+      "num_input_tokens_seen": 731312,
+      "step": 115
+    },
+    {
+      "epoch": 2.9935483870967743,
+      "grad_norm": 0.28118520975112915,
+      "learning_rate": 1.8109066104575023e-06,
+      "loss": 0.0014,
+      "num_input_tokens_seen": 737488,
+      "step": 116
+    },
+    {
+      "epoch": 3.0193548387096776,
+      "grad_norm": 0.9135170578956604,
+      "learning_rate": 1.7690707381931585e-06,
+      "loss": 0.0061,
+      "num_input_tokens_seen": 743760,
+      "step": 117
+    },
+    {
+      "epoch": 3.0451612903225804,
+      "grad_norm": 2.3123724460601807,
+      "learning_rate": 1.7274575140626318e-06,
+      "loss": 0.0296,
+      "num_input_tokens_seen": 750048,
+      "step": 118
+    },
+    {
+      "epoch": 3.0709677419354837,
+      "grad_norm": 0.6837524771690369,
+      "learning_rate": 1.686079613857109e-06,
+      "loss": 0.0186,
+      "num_input_tokens_seen": 756400,
+      "step": 119
+    },
+    {
+      "epoch": 3.096774193548387,
+      "grad_norm": 1.3550941944122314,
+      "learning_rate": 1.6449496416858285e-06,
+      "loss": 0.0038,
+      "num_input_tokens_seen": 762432,
+      "step": 120
+    },
+    {
+      "epoch": 3.1225806451612903,
+      "grad_norm": 1.2603812217712402,
+      "learning_rate": 1.6040801261367494e-06,
+      "loss": 0.0033,
+      "num_input_tokens_seen": 768688,
+      "step": 121
+    },
+    {
+      "epoch": 3.1483870967741936,
+      "grad_norm": 2.1692001819610596,
+      "learning_rate": 1.56348351646022e-06,
+      "loss": 0.0091,
+      "num_input_tokens_seen": 775024,
+      "step": 122
+    },
+    {
+      "epoch": 3.174193548387097,
+      "grad_norm": 0.3110519349575043,
+      "learning_rate": 1.5231721787768162e-06,
+      "loss": 0.0012,
+      "num_input_tokens_seen": 781360,
+      "step": 123
+    },
+    {
+      "epoch": 3.2,
+      "grad_norm": 1.8163748979568481,
+      "learning_rate": 1.4831583923105e-06,
+      "loss": 0.0223,
+      "num_input_tokens_seen": 787888,
+      "step": 124
+    },
+    {
+      "epoch": 3.225806451612903,
+      "grad_norm": 3.2385294437408447,
+      "learning_rate": 1.443454345648252e-06,
+      "loss": 0.0131,
+      "num_input_tokens_seen": 794112,
+      "step": 125
+    },
+    {
+      "epoch": 3.2516129032258063,
+      "grad_norm": 0.23872306942939758,
+      "learning_rate": 1.4040721330273063e-06,
+      "loss": 0.0008,
+      "num_input_tokens_seen": 800384,
+      "step": 126
+    },
+    {
+      "epoch": 3.2774193548387096,
+      "grad_norm": 2.089226722717285,
+      "learning_rate": 1.3650237506511333e-06,
+      "loss": 0.0058,
+      "num_input_tokens_seen": 806848,
+      "step": 127
+    },
+    {
+      "epoch": 3.303225806451613,
+      "grad_norm": 4.151247501373291,
+      "learning_rate": 1.3263210930352737e-06,
+      "loss": 0.0065,
+      "num_input_tokens_seen": 813136,
+      "step": 128
+    },
+    {
+      "epoch": 3.329032258064516,
+      "grad_norm": 3.59883189201355,
+      "learning_rate": 1.2879759493841577e-06,
+      "loss": 0.0398,
+      "num_input_tokens_seen": 819504,
+      "step": 129
+    },
+    {
+      "epoch": 3.3548387096774195,
+      "grad_norm": 0.13131457567214966,
+      "learning_rate": 1.2500000000000007e-06,
+      "loss": 0.0005,
+      "num_input_tokens_seen": 825936,
+      "step": 130
+    },
+    {
+      "epoch": 3.3806451612903228,
+      "grad_norm": 0.9149203896522522,
+      "learning_rate": 1.2124048127248644e-06,
+      "loss": 0.0049,
+      "num_input_tokens_seen": 832496,
+      "step": 131
+    },
+    {
+      "epoch": 3.4064516129032256,
+      "grad_norm": 1.6843948364257812,
+      "learning_rate": 1.1752018394169882e-06,
+      "loss": 0.0061,
+      "num_input_tokens_seen": 838864,
+      "step": 132
+    },
+    {
+      "epoch": 3.432258064516129,
+      "grad_norm": 1.2536215782165527,
+      "learning_rate": 1.1384024124624324e-06,
+      "loss": 0.0111,
+      "num_input_tokens_seen": 845504,
+      "step": 133
+    },
+    {
+      "epoch": 3.458064516129032,
+      "grad_norm": 1.0523045063018799,
+      "learning_rate": 1.1020177413231334e-06,
+      "loss": 0.0049,
+      "num_input_tokens_seen": 851888,
+      "step": 134
+    },
+    {
+      "epoch": 3.4838709677419355,
+      "grad_norm": 0.698330819606781,
+      "learning_rate": 1.0660589091223854e-06,
+      "loss": 0.0012,
+      "num_input_tokens_seen": 858144,
+      "step": 135
+    },
+    {
+      "epoch": 3.509677419354839,
+      "grad_norm": 0.35953453183174133,
+      "learning_rate": 1.0305368692688175e-06,
+      "loss": 0.0004,
+      "num_input_tokens_seen": 864496,
+      "step": 136
+    },
+    {
+      "epoch": 3.535483870967742,
+      "grad_norm": 0.17629964649677277,
+      "learning_rate": 9.95462442119879e-07,
+      "loss": 0.0006,
+      "num_input_tokens_seen": 870672,
+      "step": 137
+    },
+    {
+      "epoch": 3.5612903225806454,
+      "grad_norm": 0.060391154140233994,
+      "learning_rate": 9.608463116858544e-07,
+      "loss": 0.0003,
+      "num_input_tokens_seen": 876944,
+      "step": 138
+    },
+    {
+      "epoch": 3.587096774193548,
+      "grad_norm": 0.08453088998794556,
+      "learning_rate": 9.266990223754069e-07,
+      "loss": 0.0004,
+      "num_input_tokens_seen": 883488,
+      "step": 139
+    },
+    {
+      "epoch": 3.6129032258064515,
+      "grad_norm": 0.6224934458732605,
+      "learning_rate": 8.930309757836517e-07,
+      "loss": 0.0016,
+      "num_input_tokens_seen": 889824,
+      "step": 140
+    },
+    {
+      "epoch": 3.638709677419355,
+      "grad_norm": 2.8432862758636475,
+      "learning_rate": 8.598524275237321e-07,
+      "loss": 0.0268,
+      "num_input_tokens_seen": 896176,
+      "step": 141
+    },
+    {
+      "epoch": 3.664516129032258,
+      "grad_norm": 0.6191421747207642,
+      "learning_rate": 8.271734841028553e-07,
+      "loss": 0.0018,
+      "num_input_tokens_seen": 902272,
+      "step": 142
+    },
+    {
+      "epoch": 3.6903225806451614,
+      "grad_norm": 1.3128641843795776,
+      "learning_rate": 7.950040998437541e-07,
+      "loss": 0.01,
+      "num_input_tokens_seen": 908512,
+      "step": 143
+    },
+    {
+      "epoch": 3.7161290322580647,
+      "grad_norm": 1.9438813924789429,
+      "learning_rate": 7.633540738525066e-07,
+      "loss": 0.0209,
+      "num_input_tokens_seen": 915152,
+      "step": 144
+    },
+    {
+      "epoch": 3.741935483870968,
+      "grad_norm": 1.1845624446868896,
+      "learning_rate": 7.322330470336314e-07,
+      "loss": 0.0076,
+      "num_input_tokens_seen": 921552,
+      "step": 145
+    },
+    {
+      "epoch": 3.767741935483871,
+      "grad_norm": 4.526978492736816,
+      "learning_rate": 7.016504991533727e-07,
+      "loss": 0.0227,
+      "num_input_tokens_seen": 928048,
+      "step": 146
+    },
+    {
+      "epoch": 3.793548387096774,
+      "grad_norm": 0.03266080841422081,
+      "learning_rate": 6.716157459520739e-07,
+      "loss": 0.0002,
+      "num_input_tokens_seen": 934512,
+      "step": 147
+    },
+    {
+      "epoch": 3.8193548387096774,
+      "grad_norm": 5.138983249664307,
+      "learning_rate": 6.421379363065142e-07,
+      "loss": 0.0296,
+      "num_input_tokens_seen": 940816,
+      "step": 148
+    },
+    {
+      "epoch": 3.8451612903225807,
+      "grad_norm": 0.3178328275680542,
+      "learning_rate": 6.1322604944307e-07,
+      "loss": 0.0006,
+      "num_input_tokens_seen": 946992,
+      "step": 149
+    },
+    {
+      "epoch": 3.870967741935484,
+      "grad_norm": 1.1145384311676025,
+      "learning_rate": 5.848888922025553e-07,
+      "loss": 0.0012,
+      "num_input_tokens_seen": 953424,
+      "step": 150
+    },
+    {
+      "epoch": 3.896774193548387,
+      "grad_norm": 0.23422469198703766,
+      "learning_rate": 5.571350963575728e-07,
+      "loss": 0.0007,
+      "num_input_tokens_seen": 959616,
+      "step": 151
+    },
+    {
+      "epoch": 3.9225806451612906,
+      "grad_norm": 0.09516251087188721,
+      "learning_rate": 5.299731159831953e-07,
+      "loss": 0.0003,
+      "num_input_tokens_seen": 966096,
+      "step": 152
+    },
+    {
+      "epoch": 3.9483870967741934,
+      "grad_norm": 0.3407827317714691,
+      "learning_rate": 5.034112248817685e-07,
+      "loss": 0.0005,
+      "num_input_tokens_seen": 972368,
+      "step": 153
+    },
+    {
+      "epoch": 3.9741935483870967,
+      "grad_norm": 0.2334306687116623,
+      "learning_rate": 4.774575140626317e-07,
+      "loss": 0.0008,
+      "num_input_tokens_seen": 978848,
+      "step": 154
+    },
+    {
+      "epoch": 4.0,
+      "grad_norm": 0.10143516212701797,
+      "learning_rate": 4.5211988927752026e-07,
+      "loss": 0.0003,
+      "num_input_tokens_seen": 985520,
+      "step": 155
+    },
+    {
+      "epoch": 4.025806451612903,
+      "grad_norm": 0.25746700167655945,
+      "learning_rate": 4.27406068612396e-07,
+      "loss": 0.0015,
+      "num_input_tokens_seen": 991904,
+      "step": 156
+    },
+    {
+      "epoch": 4.051612903225807,
+      "grad_norm": 0.22239096462726593,
+      "learning_rate": 4.033235801364402e-07,
+      "loss": 0.0007,
+      "num_input_tokens_seen": 998288,
+      "step": 157
+    },
+    {
+      "epoch": 4.077419354838709,
+      "grad_norm": 0.05284583568572998,
+      "learning_rate": 3.798797596089351e-07,
+      "loss": 0.0002,
+      "num_input_tokens_seen": 1004432,
+      "step": 158
+    },
+    {
+      "epoch": 4.103225806451613,
+      "grad_norm": 1.299528956413269,
+      "learning_rate": 3.5708174824471947e-07,
+      "loss": 0.0052,
+      "num_input_tokens_seen": 1010608,
+      "step": 159
+    },
+    {
+      "epoch": 4.129032258064516,
+      "grad_norm": 1.0830060243606567,
+      "learning_rate": 3.3493649053890325e-07,
+      "loss": 0.004,
+      "num_input_tokens_seen": 1016848,
+      "step": 160
+    },
+    {
+      "epoch": 4.15483870967742,
+      "grad_norm": 0.16024000942707062,
+      "learning_rate": 3.134507321515107e-07,
+      "loss": 0.0004,
+      "num_input_tokens_seen": 1023360,
+      "step": 161
+    },
+    {
+      "epoch": 4.180645161290323,
+      "grad_norm": 0.6330615878105164,
+      "learning_rate": 2.9263101785268253e-07,
+      "loss": 0.002,
+      "num_input_tokens_seen": 1029808,
+      "step": 162
+    },
+    {
+      "epoch": 4.2064516129032254,
+      "grad_norm": 0.03194880485534668,
+      "learning_rate": 2.7248368952908055e-07,
+      "loss": 0.0001,
+      "num_input_tokens_seen": 1036080,
+      "step": 163
+    },
+    {
+      "epoch": 4.232258064516129,
+      "grad_norm": 0.02812141925096512,
+      "learning_rate": 2.53014884252083e-07,
+      "loss": 0.0001,
+      "num_input_tokens_seen": 1042240,
+      "step": 164
+    },
+    {
+      "epoch": 4.258064516129032,
+      "grad_norm": 0.029427967965602875,
+      "learning_rate": 2.3423053240837518e-07,
+      "loss": 0.0002,
+      "num_input_tokens_seen": 1048672,
+      "step": 165
+    },
+    {
+      "epoch": 4.283870967741936,
+      "grad_norm": 2.0345771312713623,
+      "learning_rate": 2.1613635589349756e-07,
+      "loss": 0.0076,
+      "num_input_tokens_seen": 1054832,
+      "step": 166
+    },
+    {
+      "epoch": 4.309677419354839,
+      "grad_norm": 0.02240203320980072,
+      "learning_rate": 1.9873786636889908e-07,
+      "loss": 0.0001,
+      "num_input_tokens_seen": 1061312,
+      "step": 167
+    },
+    {
+      "epoch": 4.335483870967742,
+      "grad_norm": 0.08536162972450256,
+      "learning_rate": 1.8204036358303173e-07,
+      "loss": 0.0002,
+      "num_input_tokens_seen": 1067488,
+      "step": 168
+    },
+    {
+      "epoch": 4.361290322580645,
+      "grad_norm": 0.0193481482565403,
+      "learning_rate": 1.6604893375699594e-07,
+      "loss": 0.0001,
+      "num_input_tokens_seen": 1073648,
+      "step": 169
+    },
+    {
+      "epoch": 4.387096774193548,
+      "grad_norm": 0.021560601890087128,
+      "learning_rate": 1.507684480352292e-07,
+      "loss": 0.0001,
+      "num_input_tokens_seen": 1080160,
+      "step": 170
+    },
+    {
+      "epoch": 4.412903225806452,
+      "grad_norm": 0.03216614946722984,
+      "learning_rate": 1.362035610017079e-07,
+      "loss": 0.0002,
+      "num_input_tokens_seen": 1086832,
+      "step": 171
+    },
+    {
+      "epoch": 4.438709677419355,
+      "grad_norm": 0.04035123065114021,
+      "learning_rate": 1.223587092621162e-07,
+      "loss": 0.0001,
+      "num_input_tokens_seen": 1093184,
+      "step": 172
+    },
+    {
+      "epoch": 4.464516129032258,
+      "grad_norm": 0.17049850523471832,
+      "learning_rate": 1.0923811009241142e-07,
+      "loss": 0.0005,
+      "num_input_tokens_seen": 1099728,
+      "step": 173
+    },
+    {
+      "epoch": 4.490322580645161,
+      "grad_norm": 0.02470760978758335,
+      "learning_rate": 9.684576015420277e-08,
+      "loss": 0.0001,
+      "num_input_tokens_seen": 1106032,
+      "step": 174
+    },
+    {
+      "epoch": 4.516129032258064,
+      "grad_norm": 0.009991397149860859,
+      "learning_rate": 8.518543427732951e-08,
+      "loss": 0.0001,
+      "num_input_tokens_seen": 1112496,
+      "step": 175
+    },
+    {
+      "epoch": 4.541935483870968,
+      "grad_norm": 1.3486413955688477,
+      "learning_rate": 7.426068431000883e-08,
+      "loss": 0.0081,
+      "num_input_tokens_seen": 1119152,
+      "step": 176
+    },
+    {
+      "epoch": 4.567741935483871,
+      "grad_norm": 0.04406896233558655,
+      "learning_rate": 6.407483803691216e-08,
+      "loss": 0.0002,
+      "num_input_tokens_seen": 1125360,
+      "step": 177
+    },
+    {
+      "epoch": 4.593548387096774,
+      "grad_norm": 0.07763337343931198,
+      "learning_rate": 5.463099816548578e-08,
+      "loss": 0.0003,
+      "num_input_tokens_seen": 1131824,
+      "step": 178
+    },
+    {
+      "epoch": 4.619354838709677,
+      "grad_norm": 0.028237691149115562,
+      "learning_rate": 4.593204138084006e-08,
+      "loss": 0.0001,
+      "num_input_tokens_seen": 1138224,
+      "step": 179
+    },
+    {
+      "epoch": 4.645161290322581,
+      "grad_norm": 0.12385120242834091,
+      "learning_rate": 3.798061746947995e-08,
+      "loss": 0.0005,
+      "num_input_tokens_seen": 1144528,
+      "step": 180
+    },
+    {
+      "epoch": 4.670967741935484,
+      "grad_norm": 0.033041104674339294,
+      "learning_rate": 3.077914851215585e-08,
+      "loss": 0.0001,
+      "num_input_tokens_seen": 1150880,
+      "step": 181
+    },
+    {
+      "epoch": 4.6967741935483875,
+      "grad_norm": 0.025356203317642212,
+      "learning_rate": 2.4329828146074096e-08,
+      "loss": 0.0002,
+      "num_input_tokens_seen": 1157184,
+      "step": 182
+    },
+    {
+      "epoch": 4.72258064516129,
+      "grad_norm": 0.021917220205068588,
+      "learning_rate": 1.8634620896695044e-08,
+      "loss": 0.0001,
+      "num_input_tokens_seen": 1163536,
+      "step": 183
+    },
+    {
+      "epoch": 4.748387096774193,
+      "grad_norm": 0.05064333602786064,
+      "learning_rate": 1.3695261579316776e-08,
+      "loss": 0.0002,
+      "num_input_tokens_seen": 1169888,
+      "step": 184
+    },
+    {
+      "epoch": 4.774193548387097,
+      "grad_norm": 0.07646457105875015,
+      "learning_rate": 9.513254770636138e-09,
+      "loss": 0.0002,
+      "num_input_tokens_seen": 1176400,
+      "step": 185
+    },
+    {
+      "epoch": 4.8,
+      "grad_norm": 0.02895214594900608,
+      "learning_rate": 6.089874350439507e-09,
+      "loss": 0.0002,
+      "num_input_tokens_seen": 1182608,
+      "step": 186
+    },
+    {
+      "epoch": 4.825806451612904,
+      "grad_norm": 0.015325246378779411,
+      "learning_rate": 3.4261631135654174e-09,
+      "loss": 0.0001,
+      "num_input_tokens_seen": 1189008,
+      "step": 187
+    },
+    {
+      "epoch": 4.851612903225806,
+      "grad_norm": 0.159898042678833,
+      "learning_rate": 1.5229324522605949e-09,
+      "loss": 0.0004,
+      "num_input_tokens_seen": 1195280,
+      "step": 188
+    },
+    {
+      "epoch": 4.877419354838709,
+      "grad_norm": 0.4591263234615326,
+      "learning_rate": 3.8076210902182607e-10,
+      "loss": 0.0013,
+      "num_input_tokens_seen": 1201456,
+      "step": 189
+    },
+    {
+      "epoch": 4.903225806451613,
+      "grad_norm": 0.39459678530693054,
+      "learning_rate": 0.0,
+      "loss": 0.0008,
+      "num_input_tokens_seen": 1207760,
+      "step": 190
+    }
+  ],
+  "logging_steps": 1,
+  "max_steps": 190,
+  "num_input_tokens_seen": 1207760,
+  "num_train_epochs": 5,
+  "save_steps": 1000,
+  "stateful_callbacks": {
+    "TrainerControl": {
+      "args": {
+        "should_epoch_stop": false,
+        "should_evaluate": false,
+        "should_log": false,
+        "should_save": true,
+        "should_training_stop": true
+      },
+      "attributes": {}
+    }
+  },
+  "total_flos": 5.438488809413018e+16,
+  "train_batch_size": 2,
+  "trial_name": null,
+  "trial_params": null
+}

checkpoint-190/training_args.bin ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:b5ec177d398d6cb226db1b1f630ec171ad7ecc41028ab76df8127e78e197e7c2
+size 6584

checkpoint-190/zero_to_fp32.py ADDED Viewed

	@@ -0,0 +1,604 @@

+#!/usr/bin/env python
+# Copyright (c) Microsoft Corporation.
+# SPDX-License-Identifier: Apache-2.0
+# DeepSpeed Team
+# This script extracts fp32 consolidated weights from a zero 1, 2 and 3 DeepSpeed checkpoints. It gets
+# copied into the top level checkpoint dir, so the user can easily do the conversion at any point in
+# the future. Once extracted, the weights don't require DeepSpeed and can be used in any
+# application.
+#
+# example: python zero_to_fp32.py . pytorch_model.bin
+import argparse
+import torch
+import glob
+import math
+import os
+import re
+from collections import OrderedDict
+from dataclasses import dataclass
+# while this script doesn't use deepspeed to recover data, since the checkpoints are pickled with
+# DeepSpeed data structures it has to be available in the current python environment.
+from deepspeed.utils import logger
+from deepspeed.checkpoint.constants import (DS_VERSION, OPTIMIZER_STATE_DICT, SINGLE_PARTITION_OF_FP32_GROUPS,
+                                            FP32_FLAT_GROUPS, ZERO_STAGE, PARTITION_COUNT, PARAM_SHAPES, BUFFER_NAMES,
+                                            FROZEN_PARAM_SHAPES, FROZEN_PARAM_FRAGMENTS)
+@dataclass
+class zero_model_state:
+    buffers: dict()
+    param_shapes: dict()
+    shared_params: list
+    ds_version: int
+    frozen_param_shapes: dict()
+    frozen_param_fragments: dict()
+debug = 0
+# load to cpu
+device = torch.device('cpu')
+def atoi(text):
+    return int(text) if text.isdigit() else text
+def natural_keys(text):
+    '''
+    alist.sort(key=natural_keys) sorts in human order
+    http://nedbatchelder.com/blog/200712/human_sorting.html
+    (See Toothy's implementation in the comments)
+    '''
+    return [atoi(c) for c in re.split(r'(\d+)', text)]
+def get_model_state_file(checkpoint_dir, zero_stage):
+    if not os.path.isdir(checkpoint_dir):
+        raise FileNotFoundError(f"Directory '{checkpoint_dir}' doesn't exist")
+    # there should be only one file
+    if zero_stage <= 2:
+        file = os.path.join(checkpoint_dir, "mp_rank_00_model_states.pt")
+    elif zero_stage == 3:
+        file = os.path.join(checkpoint_dir, "zero_pp_rank_0_mp_rank_00_model_states.pt")
+    if not os.path.exists(file):
+        raise FileNotFoundError(f"can't find model states file at '{file}'")
+    return file
+def get_checkpoint_files(checkpoint_dir, glob_pattern):
+    # XXX: need to test that this simple glob rule works for multi-node setup too
+    ckpt_files = sorted(glob.glob(os.path.join(checkpoint_dir, glob_pattern)), key=natural_keys)
+    if len(ckpt_files) == 0:
+        raise FileNotFoundError(f"can't find {glob_pattern} files in directory '{checkpoint_dir}'")
+    return ckpt_files
+def get_optim_files(checkpoint_dir):
+    return get_checkpoint_files(checkpoint_dir, "*_optim_states.pt")
+def get_model_state_files(checkpoint_dir):
+    return get_checkpoint_files(checkpoint_dir, "*_model_states.pt")
+def parse_model_states(files):
+    zero_model_states = []
+    for file in files:
+        state_dict = torch.load(file, map_location=device)
+        if BUFFER_NAMES not in state_dict:
+            raise ValueError(f"{file} is not a model state checkpoint")
+        buffer_names = state_dict[BUFFER_NAMES]
+        if debug:
+            print("Found buffers:", buffer_names)
+        # recover just the buffers while restoring them to fp32 if they were saved in fp16
+        buffers = {k: v.float() for k, v in state_dict["module"].items() if k in buffer_names}
+        param_shapes = state_dict[PARAM_SHAPES]
+        # collect parameters that are included in param_shapes
+        param_names = []
+        for s in param_shapes:
+            for name in s.keys():
+                param_names.append(name)
+        # update with frozen parameters
+        frozen_param_shapes = state_dict.get(FROZEN_PARAM_SHAPES, None)
+        if frozen_param_shapes is not None:
+            if debug:
+                print(f"Found frozen_param_shapes: {frozen_param_shapes}")
+            param_names += list(frozen_param_shapes.keys())
+        # handle shared params
+        shared_params = [[k, v] for k, v in state_dict["shared_params"].items()]
+        ds_version = state_dict.get(DS_VERSION, None)
+        frozen_param_fragments = state_dict.get(FROZEN_PARAM_FRAGMENTS, None)
+        z_model_state = zero_model_state(buffers=buffers,
+                                         param_shapes=param_shapes,
+                                         shared_params=shared_params,
+                                         ds_version=ds_version,
+                                         frozen_param_shapes=frozen_param_shapes,
+                                         frozen_param_fragments=frozen_param_fragments)
+        zero_model_states.append(z_model_state)
+    return zero_model_states
+def parse_optim_states(files, ds_checkpoint_dir):
+    total_files = len(files)
+    state_dicts = []
+    for f in files:
+        state_dict = torch.load(f, map_location=device)
+        # immediately discard the potentially huge 2 optimizer states as we only care for fp32 master weights
+        # and also handle the case where it was already removed by another helper script
+        state_dict["optimizer_state_dict"].pop("optimizer_state_dict", None)
+        state_dicts.append(state_dict)
+    if not ZERO_STAGE in state_dicts[0][OPTIMIZER_STATE_DICT]:
+        raise ValueError(f"{files[0]} is not a zero checkpoint")
+    zero_stage = state_dicts[0][OPTIMIZER_STATE_DICT][ZERO_STAGE]
+    world_size = state_dicts[0][OPTIMIZER_STATE_DICT][PARTITION_COUNT]
+    # For ZeRO-2 each param group can have different partition_count as data parallelism for expert
+    # parameters can be different from data parallelism for non-expert parameters. So we can just
+    # use the max of the partition_count to get the dp world_size.
+    if type(world_size) is list:
+        world_size = max(world_size)
+    if world_size != total_files:
+        raise ValueError(
+            f"Expected {world_size} of '*_optim_states.pt' under '{ds_checkpoint_dir}' but found {total_files} files. "
+            "Possibly due to an overwrite of an old checkpoint, or a checkpoint didn't get saved by one or more processes."
+        )
+    # the groups are named differently in each stage
+    if zero_stage <= 2:
+        fp32_groups_key = SINGLE_PARTITION_OF_FP32_GROUPS
+    elif zero_stage == 3:
+        fp32_groups_key = FP32_FLAT_GROUPS
+    else:
+        raise ValueError(f"unknown zero stage {zero_stage}")
+    if zero_stage <= 2:
+        fp32_flat_groups = [state_dicts[i][OPTIMIZER_STATE_DICT][fp32_groups_key] for i in range(len(state_dicts))]
+    elif zero_stage == 3:
+        # if there is more than one param group, there will be multiple flattened tensors - one
+        # flattened tensor per group - for simplicity merge them into a single tensor
+        #
+        # XXX: could make the script more memory efficient for when there are multiple groups - it
+        # will require matching the sub-lists of param_shapes for each param group flattened tensor
+        fp32_flat_groups = [
+            torch.cat(state_dicts[i][OPTIMIZER_STATE_DICT][fp32_groups_key], 0) for i in range(len(state_dicts))
+        ]
+    return zero_stage, world_size, fp32_flat_groups
+def _get_fp32_state_dict_from_zero_checkpoint(ds_checkpoint_dir, exclude_frozen_parameters):
+    """
+    Returns fp32 state_dict reconstructed from ds checkpoint
+    Args:
+        - ``ds_checkpoint_dir``: path to the deepspeed checkpoint folder (where the optimizer files are)
+    """
+    print(f"Processing zero checkpoint '{ds_checkpoint_dir}'")
+    optim_files = get_optim_files(ds_checkpoint_dir)
+    zero_stage, world_size, fp32_flat_groups = parse_optim_states(optim_files, ds_checkpoint_dir)
+    print(f"Detected checkpoint of type zero stage {zero_stage}, world_size: {world_size}")
+    model_files = get_model_state_files(ds_checkpoint_dir)
+    zero_model_states = parse_model_states(model_files)
+    print(f'Parsing checkpoint created by deepspeed=={zero_model_states[0].ds_version}')
+    if zero_stage <= 2:
+        return _get_fp32_state_dict_from_zero2_checkpoint(world_size, fp32_flat_groups, zero_model_states,
+                                                          exclude_frozen_parameters)
+    elif zero_stage == 3:
+        return _get_fp32_state_dict_from_zero3_checkpoint(world_size, fp32_flat_groups, zero_model_states,
+                                                          exclude_frozen_parameters)
+def _zero2_merge_frozen_params(state_dict, zero_model_states):
+    if zero_model_states[0].frozen_param_shapes is None or len(zero_model_states[0].frozen_param_shapes) == 0:
+        return
+    frozen_param_shapes = zero_model_states[0].frozen_param_shapes
+    frozen_param_fragments = zero_model_states[0].frozen_param_fragments
+    if debug:
+        num_elem = sum(s.numel() for s in frozen_param_shapes.values())
+        print(f'rank 0: {FROZEN_PARAM_SHAPES}.numel = {num_elem}')
+        wanted_params = len(frozen_param_shapes)
+        wanted_numel = sum(s.numel() for s in frozen_param_shapes.values())
+        avail_numel = sum([p.numel() for p in frozen_param_fragments.values()])
+        print(f'Frozen params: Have {avail_numel} numels to process.')
+        print(f'Frozen params: Need {wanted_numel} numels in {wanted_params} params')
+    total_params = 0
+    total_numel = 0
+    for name, shape in frozen_param_shapes.items():
+        total_params += 1
+        unpartitioned_numel = shape.numel()
+        total_numel += unpartitioned_numel
+        state_dict[name] = frozen_param_fragments[name]
+        if debug:
+            print(f"{name} full shape: {shape} unpartitioned numel {unpartitioned_numel} ")
+    print(f"Reconstructed Frozen fp32 state dict with {total_params} params {total_numel} elements")
+def _has_callable(obj, fn):
+    attr = getattr(obj, fn, None)
+    return callable(attr)
+def _zero2_merge_trainable_params(state_dict, world_size, fp32_flat_groups, zero_model_states):
+    param_shapes = zero_model_states[0].param_shapes
+    # Reconstruction protocol:
+    #
+    # XXX: document this
+    if debug:
+        for i in range(world_size):
+            for j in range(len(fp32_flat_groups[0])):
+                print(f"{FP32_FLAT_GROUPS}[{i}][{j}].shape={fp32_flat_groups[i][j].shape}")
+    # XXX: memory usage doubles here (zero2)
+    num_param_groups = len(fp32_flat_groups[0])
+    merged_single_partition_of_fp32_groups = []
+    for i in range(num_param_groups):
+        merged_partitions = [sd[i] for sd in fp32_flat_groups]
+        full_single_fp32_vector = torch.cat(merged_partitions, 0)
+        merged_single_partition_of_fp32_groups.append(full_single_fp32_vector)
+    avail_numel = sum(
+        [full_single_fp32_vector.numel() for full_single_fp32_vector in merged_single_partition_of_fp32_groups])
+    if debug:
+        wanted_params = sum([len(shapes) for shapes in param_shapes])
+        wanted_numel = sum([sum(shape.numel() for shape in shapes.values()) for shapes in param_shapes])
+        # not asserting if there is a mismatch due to possible padding
+        print(f"Have {avail_numel} numels to process.")
+        print(f"Need {wanted_numel} numels in {wanted_params} params.")
+    # params
+    # XXX: for huge models that can't fit into the host's RAM we will have to recode this to support
+    # out-of-core computing solution
+    total_numel = 0
+    total_params = 0
+    for shapes, full_single_fp32_vector in zip(param_shapes, merged_single_partition_of_fp32_groups):
+        offset = 0
+        avail_numel = full_single_fp32_vector.numel()
+        for name, shape in shapes.items():
+            unpartitioned_numel = shape.numel() if _has_callable(shape, 'numel') else math.prod(shape)
+            total_numel += unpartitioned_numel
+            total_params += 1
+            if debug:
+                print(f"{name} full shape: {shape} unpartitioned numel {unpartitioned_numel} ")
+            state_dict[name] = full_single_fp32_vector.narrow(0, offset, unpartitioned_numel).view(shape)
+            offset += unpartitioned_numel
+        # Z2 started to align to 2*world_size to improve nccl performance. Therefore both offset and
+        # avail_numel can differ by anywhere between 0..2*world_size. Due to two unrelated complex
+        # paddings performed in the code it's almost impossible to predict the exact numbers w/o the
+        # live optimizer object, so we are checking that the numbers are within the right range
+        align_to = 2 * world_size
+        def zero2_align(x):
+            return align_to * math.ceil(x / align_to)
+        if debug:
+            print(f"original offset={offset}, avail_numel={avail_numel}")
+        offset = zero2_align(offset)
+        avail_numel = zero2_align(avail_numel)
+        if debug:
+            print(f"aligned  offset={offset}, avail_numel={avail_numel}")
+        # Sanity check
+        if offset != avail_numel:
+            raise ValueError(f"consumed {offset} numels out of {avail_numel} - something is wrong")
+    print(f"Reconstructed fp32 state dict with {total_params} params {total_numel} elements")
+def _get_fp32_state_dict_from_zero2_checkpoint(world_size, fp32_flat_groups, zero_model_states,
+                                               exclude_frozen_parameters):
+    state_dict = OrderedDict()
+    # buffers
+    buffers = zero_model_states[0].buffers
+    state_dict.update(buffers)
+    if debug:
+        print(f"added {len(buffers)} buffers")
+    if not exclude_frozen_parameters:
+        _zero2_merge_frozen_params(state_dict, zero_model_states)
+    _zero2_merge_trainable_params(state_dict, world_size, fp32_flat_groups, zero_model_states)
+    # recover shared parameters
+    for pair in zero_model_states[0].shared_params:
+        if pair[1] in state_dict:
+            state_dict[pair[0]] = state_dict[pair[1]]
+    return state_dict
+def zero3_partitioned_param_info(unpartitioned_numel, world_size):
+    remainder = unpartitioned_numel % world_size
+    padding_numel = (world_size - remainder) if remainder else 0
+    partitioned_numel = math.ceil(unpartitioned_numel / world_size)
+    return partitioned_numel, padding_numel
+def _zero3_merge_frozen_params(state_dict, world_size, zero_model_states):
+    if zero_model_states[0].frozen_param_shapes is None or len(zero_model_states[0].frozen_param_shapes) == 0:
+        return
+    if debug:
+        for i in range(world_size):
+            num_elem = sum(s.numel() for s in zero_model_states[i].frozen_param_fragments.values())
+            print(f'rank {i}: {FROZEN_PARAM_SHAPES}.numel = {num_elem}')
+        frozen_param_shapes = zero_model_states[0].frozen_param_shapes
+        wanted_params = len(frozen_param_shapes)
+        wanted_numel = sum(s.numel() for s in frozen_param_shapes.values())
+        avail_numel = sum([p.numel() for p in zero_model_states[0].frozen_param_fragments.values()]) * world_size
+        print(f'Frozen params: Have {avail_numel} numels to process.')
+        print(f'Frozen params: Need {wanted_numel} numels in {wanted_params} params')
+    total_params = 0
+    total_numel = 0
+    for name, shape in zero_model_states[0].frozen_param_shapes.items():
+        total_params += 1
+        unpartitioned_numel = shape.numel()
+        total_numel += unpartitioned_numel
+        param_frags = tuple(model_state.frozen_param_fragments[name] for model_state in zero_model_states)
+        state_dict[name] = torch.cat(param_frags, 0).narrow(0, 0, unpartitioned_numel).view(shape)
+        partitioned_numel, partitioned_padding_numel = zero3_partitioned_param_info(unpartitioned_numel, world_size)
+        if debug:
+            print(
+                f"Frozen params: {total_params} {name} full shape: {shape} partition0 numel={partitioned_numel} partitioned_padding_numel={partitioned_padding_numel}"
+            )
+    print(f"Reconstructed Frozen fp32 state dict with {total_params} params {total_numel} elements")
+def _zero3_merge_trainable_params(state_dict, world_size, fp32_flat_groups, zero_model_states):
+    param_shapes = zero_model_states[0].param_shapes
+    avail_numel = fp32_flat_groups[0].numel() * world_size
+    # Reconstruction protocol: For zero3 we need to zip the partitions together at boundary of each
+    # param, re-consolidating each param, while dealing with padding if any
+    # merge list of dicts, preserving order
+    param_shapes = {k: v for d in param_shapes for k, v in d.items()}
+    if debug:
+        for i in range(world_size):
+            print(f"{FP32_FLAT_GROUPS}[{i}].shape={fp32_flat_groups[i].shape}")
+        wanted_params = len(param_shapes)
+        wanted_numel = sum(shape.numel() for shape in param_shapes.values())
+        # not asserting if there is a mismatch due to possible padding
+        avail_numel = fp32_flat_groups[0].numel() * world_size
+        print(f"Trainable params: Have {avail_numel} numels to process.")
+        print(f"Trainable params: Need {wanted_numel} numels in {wanted_params} params.")
+    # params
+    # XXX: for huge models that can't fit into the host's RAM we will have to recode this to support
+    # out-of-core computing solution
+    offset = 0
+    total_numel = 0
+    total_params = 0
+    for name, shape in param_shapes.items():
+        unpartitioned_numel = shape.numel()
+        total_numel += unpartitioned_numel
+        total_params += 1
+        partitioned_numel, partitioned_padding_numel = zero3_partitioned_param_info(unpartitioned_numel, world_size)
+        if debug:
+            print(
+                f"Trainable params: {total_params} {name} full shape: {shape} partition0 numel={partitioned_numel} partitioned_padding_numel={partitioned_padding_numel}"
+            )
+        # XXX: memory usage doubles here
+        state_dict[name] = torch.cat(
+            tuple(fp32_flat_groups[i].narrow(0, offset, partitioned_numel) for i in range(world_size)),
+            0).narrow(0, 0, unpartitioned_numel).view(shape)
+        offset += partitioned_numel
+    offset *= world_size
+    # Sanity check
+    if offset != avail_numel:
+        raise ValueError(f"consumed {offset} numels out of {avail_numel} - something is wrong")
+    print(f"Reconstructed Trainable fp32 state dict with {total_params} params {total_numel} elements")
+def _get_fp32_state_dict_from_zero3_checkpoint(world_size, fp32_flat_groups, zero_model_states,
+                                               exclude_frozen_parameters):
+    state_dict = OrderedDict()
+    # buffers
+    buffers = zero_model_states[0].buffers
+    state_dict.update(buffers)
+    if debug:
+        print(f"added {len(buffers)} buffers")
+    if not exclude_frozen_parameters:
+        _zero3_merge_frozen_params(state_dict, world_size, zero_model_states)
+    _zero3_merge_trainable_params(state_dict, world_size, fp32_flat_groups, zero_model_states)
+    # recover shared parameters
+    for pair in zero_model_states[0].shared_params:
+        if pair[1] in state_dict:
+            state_dict[pair[0]] = state_dict[pair[1]]
+    return state_dict
+def get_fp32_state_dict_from_zero_checkpoint(checkpoint_dir, tag=None, exclude_frozen_parameters=False):
+    """
+    Convert ZeRO 2 or 3 checkpoint into a single fp32 consolidated state_dict that can be loaded with
+    ``load_state_dict()`` and used for training without DeepSpeed or shared with others, for example
+    via a model hub.
+    Args:
+        - ``checkpoint_dir``: path to the desired checkpoint folder
+        - ``tag``: checkpoint tag used as a unique identifier for checkpoint. If not provided will attempt to load tag in 'latest' file. e.g., ``global_step14``
+        - ``exclude_frozen_parameters``: exclude frozen parameters
+    Returns:
+        - pytorch ``state_dict``
+    Note: this approach may not work if your application doesn't have sufficient free CPU memory and
+    you may need to use the offline approach using the ``zero_to_fp32.py`` script that is saved with
+    the checkpoint.
+    A typical usage might be ::
+        from deepspeed.utils.zero_to_fp32 import get_fp32_state_dict_from_zero_checkpoint
+        # do the training and checkpoint saving
+        state_dict = get_fp32_state_dict_from_zero_checkpoint(checkpoint_dir) # already on cpu
+        model = model.cpu() # move to cpu
+        model.load_state_dict(state_dict)
+        # submit to model hub or save the model to share with others
+    In this example the ``model`` will no longer be usable in the deepspeed context of the same
+    application. i.e. you will need to re-initialize the deepspeed engine, since
+    ``model.load_state_dict(state_dict)`` will remove all the deepspeed magic from it.
+    If you want it all done for you, use ``load_state_dict_from_zero_checkpoint`` instead.
+    """
+    if tag is None:
+        latest_path = os.path.join(checkpoint_dir, 'latest')
+        if os.path.isfile(latest_path):
+            with open(latest_path, 'r') as fd:
+                tag = fd.read().strip()
+        else:
+            raise ValueError(f"Unable to find 'latest' file at {latest_path}")
+    ds_checkpoint_dir = os.path.join(checkpoint_dir, tag)
+    if not os.path.isdir(ds_checkpoint_dir):
+        raise FileNotFoundError(f"Directory '{ds_checkpoint_dir}' doesn't exist")
+    return _get_fp32_state_dict_from_zero_checkpoint(ds_checkpoint_dir, exclude_frozen_parameters)
+def convert_zero_checkpoint_to_fp32_state_dict(checkpoint_dir, output_file, tag=None, exclude_frozen_parameters=False):
+    """
+    Convert ZeRO 2 or 3 checkpoint into a single fp32 consolidated ``state_dict`` file that can be
+    loaded with ``torch.load(file)`` + ``load_state_dict()`` and used for training without DeepSpeed.
+    Args:
+        - ``checkpoint_dir``: path to the desired checkpoint folder. (one that contains the tag-folder, like ``global_step14``)
+        - ``output_file``: path to the pytorch fp32 state_dict output file (e.g. path/pytorch_model.bin)
+        - ``tag``: checkpoint tag used as a unique identifier for checkpoint. If not provided will attempt to load tag in the file named ``latest`` in the checkpoint folder, e.g., ``global_step14``
+        - ``exclude_frozen_parameters``: exclude frozen parameters
+    """
+    state_dict = get_fp32_state_dict_from_zero_checkpoint(checkpoint_dir, tag, exclude_frozen_parameters)
+    print(f"Saving fp32 state dict to {output_file}")
+    torch.save(state_dict, output_file)
+def load_state_dict_from_zero_checkpoint(model, checkpoint_dir, tag=None):
+    """
+    1. Put the provided model to cpu
+    2. Convert ZeRO 2 or 3 checkpoint into a single fp32 consolidated ``state_dict``
+    3. Load it into the provided model
+    Args:
+        - ``model``: the model object to update
+        - ``checkpoint_dir``: path to the desired checkpoint folder. (one that contains the tag-folder, like ``global_step14``)
+        - ``tag``: checkpoint tag used as a unique identifier for checkpoint. If not provided will attempt to load tag in the file named ``latest`` in the checkpoint folder, e.g., ``global_step14``
+    Returns:
+        - ``model`: modified model
+    Make sure you have plenty of CPU memory available before you call this function. If you don't
+    have enough use the ``zero_to_fp32.py`` utility to do the conversion. You will find it
+    conveniently placed for you in the checkpoint folder.
+    A typical usage might be ::
+        from deepspeed.utils.zero_to_fp32 import load_state_dict_from_zero_checkpoint
+        model = load_state_dict_from_zero_checkpoint(trainer.model, checkpoint_dir)
+        # submit to model hub or save the model to share with others
+    Note, that once this was run, the ``model`` will no longer be usable in the deepspeed context
+    of the same application. i.e. you will need to re-initialize the deepspeed engine, since
+    ``model.load_state_dict(state_dict)`` will remove all the deepspeed magic from it.
+    """
+    logger.info(f"Extracting fp32 weights")
+    state_dict = get_fp32_state_dict_from_zero_checkpoint(checkpoint_dir, tag)
+    logger.info(f"Overwriting model with fp32 weights")
+    model = model.cpu()
+    model.load_state_dict(state_dict, strict=False)
+    return model
+if __name__ == "__main__":
+    parser = argparse.ArgumentParser()
+    parser.add_argument("checkpoint_dir",
+                        type=str,
+                        help="path to the desired checkpoint folder, e.g., path/checkpoint-12")
+    parser.add_argument(
+        "output_file",
+        type=str,
+        help="path to the pytorch fp32 state_dict output file (e.g. path/checkpoint-12/pytorch_model.bin)")
+    parser.add_argument("-t",
+                        "--tag",
+                        type=str,
+                        default=None,
+                        help="checkpoint tag used as a unique identifier for checkpoint. e.g., global_step1")
+    parser.add_argument("--exclude_frozen_parameters", action='store_true', help="exclude frozen parameters")
+    parser.add_argument("-d", "--debug", action='store_true', help="enable debug")
+    args = parser.parse_args()
+    debug = args.debug
+    convert_zero_checkpoint_to_fp32_state_dict(args.checkpoint_dir,
+                                               args.output_file,
+                                               tag=args.tag,
+                                               exclude_frozen_parameters=args.exclude_frozen_parameters)

config.json ADDED Viewed

	@@ -0,0 +1,29 @@

+{
+  "_name_or_path": "meta-llama/Meta-Llama-3-8B-Instruct",
+  "architectures": [
+    "LlamaForCausalLM"
+  ],
+  "attention_bias": false,
+  "attention_dropout": 0.0,
+  "bos_token_id": 128000,
+  "eos_token_id": 128009,
+  "hidden_act": "silu",
+  "hidden_size": 4096,
+  "initializer_range": 0.02,
+  "intermediate_size": 14336,
+  "max_position_embeddings": 8192,
+  "mlp_bias": false,
+  "model_type": "llama",
+  "num_attention_heads": 32,
+  "num_hidden_layers": 32,
+  "num_key_value_heads": 8,
+  "pretraining_tp": 1,
+  "rms_norm_eps": 1e-05,
+  "rope_scaling": null,
+  "rope_theta": 500000.0,
+  "tie_word_embeddings": false,
+  "torch_dtype": "bfloat16",
+  "transformers_version": "4.42.3",
+  "use_cache": false,
+  "vocab_size": 128256
+}

generation_config.json ADDED Viewed

	@@ -0,0 +1,12 @@

+{
+  "bos_token_id": 128000,
+  "do_sample": true,
+  "eos_token_id": [
+    128001,
+    128009
+  ],
+  "max_length": 4096,
+  "temperature": 0.6,
+  "top_p": 0.9,
+  "transformers_version": "4.42.3"
+}

llamaboard_config.yaml ADDED Viewed

	@@ -0,0 +1,65 @@

+top.booster: auto
+top.checkpoint_path: null
+top.finetuning_type: full
+top.model_name: LLaMA3-8B-Chat
+top.quantization_bit: none
+top.quantization_method: bitsandbytes
+top.rope_scaling: none
+top.template: llama3
+top.visual_inputs: false
+train.additional_target: ''
+train.badam_mode: layer
+train.badam_switch_interval: 50
+train.badam_switch_mode: ascending
+train.badam_update_ratio: 0.05
+train.batch_size: 2
+train.compute_type: bf16
+train.create_new_adapter: false
+train.cutoff_len: 1024
+train.dataset:
+- truth_train_0716_2
+train.dataset_dir: data
+train.ds_offload: false
+train.ds_stage: '2'
+train.freeze_extra_modules: ''
+train.freeze_trainable_layers: 2
+train.freeze_trainable_modules: all
+train.galore_rank: 16
+train.galore_scale: 0.25
+train.galore_target: all
+train.galore_update_interval: 200
+train.gradient_accumulation_steps: 8
+train.learning_rate: 5e-6
+train.logging_steps: 1
+train.lora_alpha: 16
+train.lora_dropout: 0
+train.lora_rank: 8
+train.lora_target: ''
+train.loraplus_lr_ratio: 0
+train.lr_scheduler_type: cosine
+train.max_grad_norm: '1.0'
+train.max_samples: '100000'
+train.neat_packing: false
+train.neftune_alpha: 0
+train.num_train_epochs: '5.0'
+train.optim: adamw_torch
+train.packing: false
+train.ppo_score_norm: false
+train.ppo_whiten_rewards: false
+train.pref_beta: 0.1
+train.pref_ftx: 0
+train.pref_loss: sigmoid
+train.report_to: false
+train.resize_vocab: false
+train.reward_model: null
+train.save_steps: 1000
+train.shift_attn: false
+train.training_stage: Supervised Fine-Tuning
+train.use_badam: false
+train.use_dora: false
+train.use_galore: false
+train.use_llama_pro: false
+train.use_pissa: false
+train.use_rslora: false
+train.val_size: 0
+train.warmup_steps: 10

model-00001-of-00004.safetensors ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:5abbc702551994c8c8d2d5d1c3ba91b10fdf6b45da98baec62c196fbb91d1461
+size 4976698672

model-00002-of-00004.safetensors ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:93c01ac54008452872e54ffe1ae49d26a09d0085972ccf967d4e7c150e6694c6
+size 4999802720

model-00003-of-00004.safetensors ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:987f1c6ab10c142d1ed8fd02354572080e00d2926c78109143d589e694ae4012
+size 4915916176

model-00004-of-00004.safetensors ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:b5034a644f7b62dcbb02e08ea800d4efaa440f2e1790446387be5e9edcfd8aa4
+size 1168138808

model.safetensors.index.json ADDED Viewed

	@@ -0,0 +1,298 @@

+{
+  "metadata": {
+    "total_size": 16060522496
+  },
+  "weight_map": {
+    "lm_head.weight": "model-00004-of-00004.safetensors",
+    "model.embed_tokens.weight": "model-00001-of-00004.safetensors",
+    "model.layers.0.input_layernorm.weight": "model-00001-of-00004.safetensors",
+    "model.layers.0.mlp.down_proj.weight": "model-00001-of-00004.safetensors",
+    "model.layers.0.mlp.gate_proj.weight": "model-00001-of-00004.safetensors",
+    "model.layers.0.mlp.up_proj.weight": "model-00001-of-00004.safetensors",
+    "model.layers.0.post_attention_layernorm.weight": "model-00001-of-00004.safetensors",
+    "model.layers.0.self_attn.k_proj.weight": "model-00001-of-00004.safetensors",
+    "model.layers.0.self_attn.o_proj.weight": "model-00001-of-00004.safetensors",
+    "model.layers.0.self_attn.q_proj.weight": "model-00001-of-00004.safetensors",
+    "model.layers.0.self_attn.v_proj.weight": "model-00001-of-00004.safetensors",
+    "model.layers.1.input_layernorm.weight": "model-00001-of-00004.safetensors",
+    "model.layers.1.mlp.down_proj.weight": "model-00001-of-00004.safetensors",
+    "model.layers.1.mlp.gate_proj.weight": "model-00001-of-00004.safetensors",
+    "model.layers.1.mlp.up_proj.weight": "model-00001-of-00004.safetensors",
+    "model.layers.1.post_attention_layernorm.weight": "model-00001-of-00004.safetensors",
+    "model.layers.1.self_attn.k_proj.weight": "model-00001-of-00004.safetensors",
+    "model.layers.1.self_attn.o_proj.weight": "model-00001-of-00004.safetensors",
+    "model.layers.1.self_attn.q_proj.weight": "model-00001-of-00004.safetensors",
+    "model.layers.1.self_attn.v_proj.weight": "model-00001-of-00004.safetensors",
+    "model.layers.10.input_layernorm.weight": "model-00002-of-00004.safetensors",
+    "model.layers.10.mlp.down_proj.weight": "model-00002-of-00004.safetensors",
+    "model.layers.10.mlp.gate_proj.weight": "model-00002-of-00004.safetensors",
+    "model.layers.10.mlp.up_proj.weight": "model-00002-of-00004.safetensors",
+    "model.layers.10.post_attention_layernorm.weight": "model-00002-of-00004.safetensors",
+    "model.layers.10.self_attn.k_proj.weight": "model-00002-of-00004.safetensors",
+    "model.layers.10.self_attn.o_proj.weight": "model-00002-of-00004.safetensors",
+    "model.layers.10.self_attn.q_proj.weight": "model-00002-of-00004.safetensors",
+    "model.layers.10.self_attn.v_proj.weight": "model-00002-of-00004.safetensors",
+    "model.layers.11.input_layernorm.weight": "model-00002-of-00004.safetensors",
+    "model.layers.11.mlp.down_proj.weight": "model-00002-of-00004.safetensors",
+    "model.layers.11.mlp.gate_proj.weight": "model-00002-of-00004.safetensors",
+    "model.layers.11.mlp.up_proj.weight": "model-00002-of-00004.safetensors",
+    "model.layers.11.post_attention_layernorm.weight": "model-00002-of-00004.safetensors",
+    "model.layers.11.self_attn.k_proj.weight": "model-00002-of-00004.safetensors",
+    "model.layers.11.self_attn.o_proj.weight": "model-00002-of-00004.safetensors",
+    "model.layers.11.self_attn.q_proj.weight": "model-00002-of-00004.safetensors",
+    "model.layers.11.self_attn.v_proj.weight": "model-00002-of-00004.safetensors",
+    "model.layers.12.input_layernorm.weight": "model-00002-of-00004.safetensors",
+    "model.layers.12.mlp.down_proj.weight": "model-00002-of-00004.safetensors",
+    "model.layers.12.mlp.gate_proj.weight": "model-00002-of-00004.safetensors",
+    "model.layers.12.mlp.up_proj.weight": "model-00002-of-00004.safetensors",
+    "model.layers.12.post_attention_layernorm.weight": "model-00002-of-00004.safetensors",
+    "model.layers.12.self_attn.k_proj.weight": "model-00002-of-00004.safetensors",
+    "model.layers.12.self_attn.o_proj.weight": "model-00002-of-00004.safetensors",
+    "model.layers.12.self_attn.q_proj.weight": "model-00002-of-00004.safetensors",
+    "model.layers.12.self_attn.v_proj.weight": "model-00002-of-00004.safetensors",
+    "model.layers.13.input_layernorm.weight": "model-00002-of-00004.safetensors",
+    "model.layers.13.mlp.down_proj.weight": "model-00002-of-00004.safetensors",
+    "model.layers.13.mlp.gate_proj.weight": "model-00002-of-00004.safetensors",
+    "model.layers.13.mlp.up_proj.weight": "model-00002-of-00004.safetensors",
+    "model.layers.13.post_attention_layernorm.weight": "model-00002-of-00004.safetensors",
+    "model.layers.13.self_attn.k_proj.weight": "model-00002-of-00004.safetensors",
+    "model.layers.13.self_attn.o_proj.weight": "model-00002-of-00004.safetensors",
+    "model.layers.13.self_attn.q_proj.weight": "model-00002-of-00004.safetensors",
+    "model.layers.13.self_attn.v_proj.weight": "model-00002-of-00004.safetensors",
+    "model.layers.14.input_layernorm.weight": "model-00002-of-00004.safetensors",
+    "model.layers.14.mlp.down_proj.weight": "model-00002-of-00004.safetensors",
+    "model.layers.14.mlp.gate_proj.weight": "model-00002-of-00004.safetensors",
+    "model.layers.14.mlp.up_proj.weight": "model-00002-of-00004.safetensors",
+    "model.layers.14.post_attention_layernorm.weight": "model-00002-of-00004.safetensors",
+    "model.layers.14.self_attn.k_proj.weight": "model-00002-of-00004.safetensors",
+    "model.layers.14.self_attn.o_proj.weight": "model-00002-of-00004.safetensors",
+    "model.layers.14.self_attn.q_proj.weight": "model-00002-of-00004.safetensors",
+    "model.layers.14.self_attn.v_proj.weight": "model-00002-of-00004.safetensors",
+    "model.layers.15.input_layernorm.weight": "model-00002-of-00004.safetensors",
+    "model.layers.15.mlp.down_proj.weight": "model-00002-of-00004.safetensors",
+    "model.layers.15.mlp.gate_proj.weight": "model-00002-of-00004.safetensors",
+    "model.layers.15.mlp.up_proj.weight": "model-00002-of-00004.safetensors",
+    "model.layers.15.post_attention_layernorm.weight": "model-00002-of-00004.safetensors",
+    "model.layers.15.self_attn.k_proj.weight": "model-00002-of-00004.safetensors",
+    "model.layers.15.self_attn.o_proj.weight": "model-00002-of-00004.safetensors",
+    "model.layers.15.self_attn.q_proj.weight": "model-00002-of-00004.safetensors",
+    "model.layers.15.self_attn.v_proj.weight": "model-00002-of-00004.safetensors",
+    "model.layers.16.input_layernorm.weight": "model-00002-of-00004.safetensors",
+    "model.layers.16.mlp.down_proj.weight": "model-00002-of-00004.safetensors",
+    "model.layers.16.mlp.gate_proj.weight": "model-00002-of-00004.safetensors",
+    "model.layers.16.mlp.up_proj.weight": "model-00002-of-00004.safetensors",
+    "model.layers.16.post_attention_layernorm.weight": "model-00002-of-00004.safetensors",
+    "model.layers.16.self_attn.k_proj.weight": "model-00002-of-00004.safetensors",
+    "model.layers.16.self_attn.o_proj.weight": "model-00002-of-00004.safetensors",
+    "model.layers.16.self_attn.q_proj.weight": "model-00002-of-00004.safetensors",
+    "model.layers.16.self_attn.v_proj.weight": "model-00002-of-00004.safetensors",
+    "model.layers.17.input_layernorm.weight": "model-00002-of-00004.safetensors",
+    "model.layers.17.mlp.down_proj.weight": "model-00002-of-00004.safetensors",
+    "model.layers.17.mlp.gate_proj.weight": "model-00002-of-00004.safetensors",
+    "model.layers.17.mlp.up_proj.weight": "model-00002-of-00004.safetensors",
+    "model.layers.17.post_attention_layernorm.weight": "model-00002-of-00004.safetensors",
+    "model.layers.17.self_attn.k_proj.weight": "model-00002-of-00004.safetensors",
+    "model.layers.17.self_attn.o_proj.weight": "model-00002-of-00004.safetensors",
+    "model.layers.17.self_attn.q_proj.weight": "model-00002-of-00004.safetensors",
+    "model.layers.17.self_attn.v_proj.weight": "model-00002-of-00004.safetensors",
+    "model.layers.18.input_layernorm.weight": "model-00002-of-00004.safetensors",
+    "model.layers.18.mlp.down_proj.weight": "model-00002-of-00004.safetensors",
+    "model.layers.18.mlp.gate_proj.weight": "model-00002-of-00004.safetensors",
+    "model.layers.18.mlp.up_proj.weight": "model-00002-of-00004.safetensors",
+    "model.layers.18.post_attention_layernorm.weight": "model-00002-of-00004.safetensors",
+    "model.layers.18.self_attn.k_proj.weight": "model-00002-of-00004.safetensors",
+    "model.layers.18.self_attn.o_proj.weight": "model-00002-of-00004.safetensors",
+    "model.layers.18.self_attn.q_proj.weight": "model-00002-of-00004.safetensors",
+    "model.layers.18.self_attn.v_proj.weight": "model-00002-of-00004.safetensors",
+    "model.layers.19.input_layernorm.weight": "model-00002-of-00004.safetensors",
+    "model.layers.19.mlp.down_proj.weight": "model-00002-of-00004.safetensors",
+    "model.layers.19.mlp.gate_proj.weight": "model-00002-of-00004.safetensors",
+    "model.layers.19.mlp.up_proj.weight": "model-00002-of-00004.safetensors",
+    "model.layers.19.post_attention_layernorm.weight": "model-00002-of-00004.safetensors",
+    "model.layers.19.self_attn.k_proj.weight": "model-00002-of-00004.safetensors",
+    "model.layers.19.self_attn.o_proj.weight": "model-00002-of-00004.safetensors",
+    "model.layers.19.self_attn.q_proj.weight": "model-00002-of-00004.safetensors",
+    "model.layers.19.self_attn.v_proj.weight": "model-00002-of-00004.safetensors",
+    "model.layers.2.input_layernorm.weight": "model-00001-of-00004.safetensors",
+    "model.layers.2.mlp.down_proj.weight": "model-00001-of-00004.safetensors",
+    "model.layers.2.mlp.gate_proj.weight": "model-00001-of-00004.safetensors",
+    "model.layers.2.mlp.up_proj.weight": "model-00001-of-00004.safetensors",
+    "model.layers.2.post_attention_layernorm.weight": "model-00001-of-00004.safetensors",
+    "model.layers.2.self_attn.k_proj.weight": "model-00001-of-00004.safetensors",
+    "model.layers.2.self_attn.o_proj.weight": "model-00001-of-00004.safetensors",
+    "model.layers.2.self_attn.q_proj.weight": "model-00001-of-00004.safetensors",
+    "model.layers.2.self_attn.v_proj.weight": "model-00001-of-00004.safetensors",
+    "model.layers.20.input_layernorm.weight": "model-00003-of-00004.safetensors",
+    "model.layers.20.mlp.down_proj.weight": "model-00003-of-00004.safetensors",
+    "model.layers.20.mlp.gate_proj.weight": "model-00002-of-00004.safetensors",
+    "model.layers.20.mlp.up_proj.weight": "model-00003-of-00004.safetensors",
+    "model.layers.20.post_attention_layernorm.weight": "model-00003-of-00004.safetensors",
+    "model.layers.20.self_attn.k_proj.weight": "model-00002-of-00004.safetensors",
+    "model.layers.20.self_attn.o_proj.weight": "model-00002-of-00004.safetensors",
+    "model.layers.20.self_attn.q_proj.weight": "model-00002-of-00004.safetensors",
+    "model.layers.20.self_attn.v_proj.weight": "model-00002-of-00004.safetensors",
+    "model.layers.21.input_layernorm.weight": "model-00003-of-00004.safetensors",
+    "model.layers.21.mlp.down_proj.weight": "model-00003-of-00004.safetensors",
+    "model.layers.21.mlp.gate_proj.weight": "model-00003-of-00004.safetensors",
+    "model.layers.21.mlp.up_proj.weight": "model-00003-of-00004.safetensors",
+    "model.layers.21.post_attention_layernorm.weight": "model-00003-of-00004.safetensors",
+    "model.layers.21.self_attn.k_proj.weight": "model-00003-of-00004.safetensors",
+    "model.layers.21.self_attn.o_proj.weight": "model-00003-of-00004.safetensors",
+    "model.layers.21.self_attn.q_proj.weight": "model-00003-of-00004.safetensors",
+    "model.layers.21.self_attn.v_proj.weight": "model-00003-of-00004.safetensors",
+    "model.layers.22.input_layernorm.weight": "model-00003-of-00004.safetensors",
+    "model.layers.22.mlp.down_proj.weight": "model-00003-of-00004.safetensors",
+    "model.layers.22.mlp.gate_proj.weight": "model-00003-of-00004.safetensors",
+    "model.layers.22.mlp.up_proj.weight": "model-00003-of-00004.safetensors",
+    "model.layers.22.post_attention_layernorm.weight": "model-00003-of-00004.safetensors",
+    "model.layers.22.self_attn.k_proj.weight": "model-00003-of-00004.safetensors",
+    "model.layers.22.self_attn.o_proj.weight": "model-00003-of-00004.safetensors",
+    "model.layers.22.self_attn.q_proj.weight": "model-00003-of-00004.safetensors",
+    "model.layers.22.self_attn.v_proj.weight": "model-00003-of-00004.safetensors",
+    "model.layers.23.input_layernorm.weight": "model-00003-of-00004.safetensors",
+    "model.layers.23.mlp.down_proj.weight": "model-00003-of-00004.safetensors",
+    "model.layers.23.mlp.gate_proj.weight": "model-00003-of-00004.safetensors",
+    "model.layers.23.mlp.up_proj.weight": "model-00003-of-00004.safetensors",
+    "model.layers.23.post_attention_layernorm.weight": "model-00003-of-00004.safetensors",
+    "model.layers.23.self_attn.k_proj.weight": "model-00003-of-00004.safetensors",
+    "model.layers.23.self_attn.o_proj.weight": "model-00003-of-00004.safetensors",
+    "model.layers.23.self_attn.q_proj.weight": "model-00003-of-00004.safetensors",
+    "model.layers.23.self_attn.v_proj.weight": "model-00003-of-00004.safetensors",
+    "model.layers.24.input_layernorm.weight": "model-00003-of-00004.safetensors",
+    "model.layers.24.mlp.down_proj.weight": "model-00003-of-00004.safetensors",
+    "model.layers.24.mlp.gate_proj.weight": "model-00003-of-00004.safetensors",
+    "model.layers.24.mlp.up_proj.weight": "model-00003-of-00004.safetensors",
+    "model.layers.24.post_attention_layernorm.weight": "model-00003-of-00004.safetensors",
+    "model.layers.24.self_attn.k_proj.weight": "model-00003-of-00004.safetensors",
+    "model.layers.24.self_attn.o_proj.weight": "model-00003-of-00004.safetensors",
+    "model.layers.24.self_attn.q_proj.weight": "model-00003-of-00004.safetensors",
+    "model.layers.24.self_attn.v_proj.weight": "model-00003-of-00004.safetensors",
+    "model.layers.25.input_layernorm.weight": "model-00003-of-00004.safetensors",
+    "model.layers.25.mlp.down_proj.weight": "model-00003-of-00004.safetensors",
+    "model.layers.25.mlp.gate_proj.weight": "model-00003-of-00004.safetensors",
+    "model.layers.25.mlp.up_proj.weight": "model-00003-of-00004.safetensors",
+    "model.layers.25.post_attention_layernorm.weight": "model-00003-of-00004.safetensors",
+    "model.layers.25.self_attn.k_proj.weight": "model-00003-of-00004.safetensors",
+    "model.layers.25.self_attn.o_proj.weight": "model-00003-of-00004.safetensors",
+    "model.layers.25.self_attn.q_proj.weight": "model-00003-of-00004.safetensors",
+    "model.layers.25.self_attn.v_proj.weight": "model-00003-of-00004.safetensors",
+    "model.layers.26.input_layernorm.weight": "model-00003-of-00004.safetensors",
+    "model.layers.26.mlp.down_proj.weight": "model-00003-of-00004.safetensors",
+    "model.layers.26.mlp.gate_proj.weight": "model-00003-of-00004.safetensors",
+    "model.layers.26.mlp.up_proj.weight": "model-00003-of-00004.safetensors",
+    "model.layers.26.post_attention_layernorm.weight": "model-00003-of-00004.safetensors",
+    "model.layers.26.self_attn.k_proj.weight": "model-00003-of-00004.safetensors",
+    "model.layers.26.self_attn.o_proj.weight": "model-00003-of-00004.safetensors",
+    "model.layers.26.self_attn.q_proj.weight": "model-00003-of-00004.safetensors",
+    "model.layers.26.self_attn.v_proj.weight": "model-00003-of-00004.safetensors",
+    "model.layers.27.input_layernorm.weight": "model-00003-of-00004.safetensors",
+    "model.layers.27.mlp.down_proj.weight": "model-00003-of-00004.safetensors",
+    "model.layers.27.mlp.gate_proj.weight": "model-00003-of-00004.safetensors",
+    "model.layers.27.mlp.up_proj.weight": "model-00003-of-00004.safetensors",
+    "model.layers.27.post_attention_layernorm.weight": "model-00003-of-00004.safetensors",
+    "model.layers.27.self_attn.k_proj.weight": "model-00003-of-00004.safetensors",
+    "model.layers.27.self_attn.o_proj.weight": "model-00003-of-00004.safetensors",
+    "model.layers.27.self_attn.q_proj.weight": "model-00003-of-00004.safetensors",
+    "model.layers.27.self_attn.v_proj.weight": "model-00003-of-00004.safetensors",
+    "model.layers.28.input_layernorm.weight": "model-00003-of-00004.safetensors",
+    "model.layers.28.mlp.down_proj.weight": "model-00003-of-00004.safetensors",
+    "model.layers.28.mlp.gate_proj.weight": "model-00003-of-00004.safetensors",
+    "model.layers.28.mlp.up_proj.weight": "model-00003-of-00004.safetensors",
+    "model.layers.28.post_attention_layernorm.weight": "model-00003-of-00004.safetensors",
+    "model.layers.28.self_attn.k_proj.weight": "model-00003-of-00004.safetensors",
+    "model.layers.28.self_attn.o_proj.weight": "model-00003-of-00004.safetensors",
+    "model.layers.28.self_attn.q_proj.weight": "model-00003-of-00004.safetensors",
+    "model.layers.28.self_attn.v_proj.weight": "model-00003-of-00004.safetensors",
+    "model.layers.29.input_layernorm.weight": "model-00003-of-00004.safetensors",
+    "model.layers.29.mlp.down_proj.weight": "model-00003-of-00004.safetensors",
+    "model.layers.29.mlp.gate_proj.weight": "model-00003-of-00004.safetensors",
+    "model.layers.29.mlp.up_proj.weight": "model-00003-of-00004.safetensors",
+    "model.layers.29.post_attention_layernorm.weight": "model-00003-of-00004.safetensors",
+    "model.layers.29.self_attn.k_proj.weight": "model-00003-of-00004.safetensors",
+    "model.layers.29.self_attn.o_proj.weight": "model-00003-of-00004.safetensors",
+    "model.layers.29.self_attn.q_proj.weight": "model-00003-of-00004.safetensors",
+    "model.layers.29.self_attn.v_proj.weight": "model-00003-of-00004.safetensors",
+    "model.layers.3.input_layernorm.weight": "model-00001-of-00004.safetensors",
+    "model.layers.3.mlp.down_proj.weight": "model-00001-of-00004.safetensors",
+    "model.layers.3.mlp.gate_proj.weight": "model-00001-of-00004.safetensors",
+    "model.layers.3.mlp.up_proj.weight": "model-00001-of-00004.safetensors",
+    "model.layers.3.post_attention_layernorm.weight": "model-00001-of-00004.safetensors",
+    "model.layers.3.self_attn.k_proj.weight": "model-00001-of-00004.safetensors",
+    "model.layers.3.self_attn.o_proj.weight": "model-00001-of-00004.safetensors",
+    "model.layers.3.self_attn.q_proj.weight": "model-00001-of-00004.safetensors",
+    "model.layers.3.self_attn.v_proj.weight": "model-00001-of-00004.safetensors",
+    "model.layers.30.input_layernorm.weight": "model-00003-of-00004.safetensors",
+    "model.layers.30.mlp.down_proj.weight": "model-00003-of-00004.safetensors",
+    "model.layers.30.mlp.gate_proj.weight": "model-00003-of-00004.safetensors",
+    "model.layers.30.mlp.up_proj.weight": "model-00003-of-00004.safetensors",
+    "model.layers.30.post_attention_layernorm.weight": "model-00003-of-00004.safetensors",
+    "model.layers.30.self_attn.k_proj.weight": "model-00003-of-00004.safetensors",
+    "model.layers.30.self_attn.o_proj.weight": "model-00003-of-00004.safetensors",
+    "model.layers.30.self_attn.q_proj.weight": "model-00003-of-00004.safetensors",
+    "model.layers.30.self_attn.v_proj.weight": "model-00003-of-00004.safetensors",
+    "model.layers.31.input_layernorm.weight": "model-00004-of-00004.safetensors",
+    "model.layers.31.mlp.down_proj.weight": "model-00004-of-00004.safetensors",
+    "model.layers.31.mlp.gate_proj.weight": "model-00003-of-00004.safetensors",
+    "model.layers.31.mlp.up_proj.weight": "model-00003-of-00004.safetensors",
+    "model.layers.31.post_attention_layernorm.weight": "model-00004-of-00004.safetensors",
+    "model.layers.31.self_attn.k_proj.weight": "model-00003-of-00004.safetensors",
+    "model.layers.31.self_attn.o_proj.weight": "model-00003-of-00004.safetensors",
+    "model.layers.31.self_attn.q_proj.weight": "model-00003-of-00004.safetensors",
+    "model.layers.31.self_attn.v_proj.weight": "model-00003-of-00004.safetensors",
+    "model.layers.4.input_layernorm.weight": "model-00001-of-00004.safetensors",
+    "model.layers.4.mlp.down_proj.weight": "model-00001-of-00004.safetensors",
+    "model.layers.4.mlp.gate_proj.weight": "model-00001-of-00004.safetensors",
+    "model.layers.4.mlp.up_proj.weight": "model-00001-of-00004.safetensors",
+    "model.layers.4.post_attention_layernorm.weight": "model-00001-of-00004.safetensors",
+    "model.layers.4.self_attn.k_proj.weight": "model-00001-of-00004.safetensors",
+    "model.layers.4.self_attn.o_proj.weight": "model-00001-of-00004.safetensors",
+    "model.layers.4.self_attn.q_proj.weight": "model-00001-of-00004.safetensors",
+    "model.layers.4.self_attn.v_proj.weight": "model-00001-of-00004.safetensors",
+    "model.layers.5.input_layernorm.weight": "model-00001-of-00004.safetensors",
+    "model.layers.5.mlp.down_proj.weight": "model-00001-of-00004.safetensors",
+    "model.layers.5.mlp.gate_proj.weight": "model-00001-of-00004.safetensors",
+    "model.layers.5.mlp.up_proj.weight": "model-00001-of-00004.safetensors",
+    "model.layers.5.post_attention_layernorm.weight": "model-00001-of-00004.safetensors",
+    "model.layers.5.self_attn.k_proj.weight": "model-00001-of-00004.safetensors",
+    "model.layers.5.self_attn.o_proj.weight": "model-00001-of-00004.safetensors",
+    "model.layers.5.self_attn.q_proj.weight": "model-00001-of-00004.safetensors",
+    "model.layers.5.self_attn.v_proj.weight": "model-00001-of-00004.safetensors",
+    "model.layers.6.input_layernorm.weight": "model-00001-of-00004.safetensors",
+    "model.layers.6.mlp.down_proj.weight": "model-00001-of-00004.safetensors",
+    "model.layers.6.mlp.gate_proj.weight": "model-00001-of-00004.safetensors",
+    "model.layers.6.mlp.up_proj.weight": "model-00001-of-00004.safetensors",
+    "model.layers.6.post_attention_layernorm.weight": "model-00001-of-00004.safetensors",
+    "model.layers.6.self_attn.k_proj.weight": "model-00001-of-00004.safetensors",
+    "model.layers.6.self_attn.o_proj.weight": "model-00001-of-00004.safetensors",
+    "model.layers.6.self_attn.q_proj.weight": "model-00001-of-00004.safetensors",
+    "model.layers.6.self_attn.v_proj.weight": "model-00001-of-00004.safetensors",
+    "model.layers.7.input_layernorm.weight": "model-00001-of-00004.safetensors",
+    "model.layers.7.mlp.down_proj.weight": "model-00001-of-00004.safetensors",
+    "model.layers.7.mlp.gate_proj.weight": "model-00001-of-00004.safetensors",
+    "model.layers.7.mlp.up_proj.weight": "model-00001-of-00004.safetensors",
+    "model.layers.7.post_attention_layernorm.weight": "model-00001-of-00004.safetensors",
+    "model.layers.7.self_attn.k_proj.weight": "model-00001-of-00004.safetensors",
+    "model.layers.7.self_attn.o_proj.weight": "model-00001-of-00004.safetensors",
+    "model.layers.7.self_attn.q_proj.weight": "model-00001-of-00004.safetensors",
+    "model.layers.7.self_attn.v_proj.weight": "model-00001-of-00004.safetensors",
+    "model.layers.8.input_layernorm.weight": "model-00001-of-00004.safetensors",
+    "model.layers.8.mlp.down_proj.weight": "model-00001-of-00004.safetensors",
+    "model.layers.8.mlp.gate_proj.weight": "model-00001-of-00004.safetensors",
+    "model.layers.8.mlp.up_proj.weight": "model-00001-of-00004.safetensors",
+    "model.layers.8.post_attention_layernorm.weight": "model-00001-of-00004.safetensors",
+    "model.layers.8.self_attn.k_proj.weight": "model-00001-of-00004.safetensors",
+    "model.layers.8.self_attn.o_proj.weight": "model-00001-of-00004.safetensors",
+    "model.layers.8.self_attn.q_proj.weight": "model-00001-of-00004.safetensors",
+    "model.layers.8.self_attn.v_proj.weight": "model-00001-of-00004.safetensors",
+    "model.layers.9.input_layernorm.weight": "model-00002-of-00004.safetensors",
+    "model.layers.9.mlp.down_proj.weight": "model-00002-of-00004.safetensors",
+    "model.layers.9.mlp.gate_proj.weight": "model-00002-of-00004.safetensors",
+    "model.layers.9.mlp.up_proj.weight": "model-00002-of-00004.safetensors",
+    "model.layers.9.post_attention_layernorm.weight": "model-00002-of-00004.safetensors",
+    "model.layers.9.self_attn.k_proj.weight": "model-00002-of-00004.safetensors",
+    "model.layers.9.self_attn.o_proj.weight": "model-00002-of-00004.safetensors",
+    "model.layers.9.self_attn.q_proj.weight": "model-00002-of-00004.safetensors",
+    "model.layers.9.self_attn.v_proj.weight": "model-00002-of-00004.safetensors",
+    "model.norm.weight": "model-00004-of-00004.safetensors"
+  }
+}

running_log.txt ADDED Viewed

	@@ -0,0 +1,667 @@

+07/16/2024 16:00:59 - INFO - llamafactory.hparams.parser - Process rank: 7, device: cuda:7, n_gpu: 1, distributed training: True, compute dtype: torch.bfloat16
+07/16/2024 16:00:59 - INFO - llamafactory.hparams.parser - Process rank: 6, device: cuda:6, n_gpu: 1, distributed training: True, compute dtype: torch.bfloat16
+07/16/2024 16:00:59 - INFO - llamafactory.hparams.parser - Process rank: 4, device: cuda:4, n_gpu: 1, distributed training: True, compute dtype: torch.bfloat16
+07/16/2024 16:01:00 - INFO - llamafactory.hparams.parser - Process rank: 5, device: cuda:5, n_gpu: 1, distributed training: True, compute dtype: torch.bfloat16
+07/16/2024 16:01:00 - INFO - llamafactory.hparams.parser - Process rank: 3, device: cuda:3, n_gpu: 1, distributed training: True, compute dtype: torch.bfloat16
+07/16/2024 16:01:00 - INFO - llamafactory.hparams.parser - Process rank: 2, device: cuda:2, n_gpu: 1, distributed training: True, compute dtype: torch.bfloat16
+07/16/2024 16:01:00 - INFO - llamafactory.hparams.parser - Process rank: 1, device: cuda:1, n_gpu: 1, distributed training: True, compute dtype: torch.bfloat16
+[INFO|parser.py:325] 2024-07-16 16:01:00,148 >> Process rank: 0, device: cuda:0, n_gpu: 1, distributed training: True, compute dtype: torch.bfloat16
+07/16/2024 16:01:00 - WARNING - transformers.tokenization_utils_base - Special tokens have been added in the vocabulary, make sure the associated word embeddings are fine-tuned or trained.
+07/16/2024 16:01:00 - INFO - llamafactory.data.template - Replace eos token: <|eot_id|>
+07/16/2024 16:01:00 - INFO - llamafactory.data.template - Add pad token: <|eot_id|>
+07/16/2024 16:01:00 - WARNING - transformers.tokenization_utils_base - Special tokens have been added in the vocabulary, make sure the associated word embeddings are fine-tuned or trained.
+07/16/2024 16:01:00 - INFO - llamafactory.data.template - Replace eos token: <|eot_id|>
+07/16/2024 16:01:00 - INFO - llamafactory.data.template - Add pad token: <|eot_id|>
+07/16/2024 16:01:00 - WARNING - transformers.tokenization_utils_base - Special tokens have been added in the vocabulary, make sure the associated word embeddings are fine-tuned or trained.
+07/16/2024 16:01:00 - INFO - llamafactory.data.template - Replace eos token: <|eot_id|>
+07/16/2024 16:01:00 - INFO - llamafactory.data.template - Add pad token: <|eot_id|>
+07/16/2024 16:01:00 - WARNING - transformers.tokenization_utils_base - Special tokens have been added in the vocabulary, make sure the associated word embeddings are fine-tuned or trained.
+07/16/2024 16:01:00 - INFO - llamafactory.data.template - Replace eos token: <|eot_id|>
+07/16/2024 16:01:00 - INFO - llamafactory.data.template - Add pad token: <|eot_id|>
+07/16/2024 16:01:00 - WARNING - transformers.tokenization_utils_base - Special tokens have been added in the vocabulary, make sure the associated word embeddings are fine-tuned or trained.
+07/16/2024 16:01:00 - INFO - llamafactory.data.template - Replace eos token: <|eot_id|>
+07/16/2024 16:01:00 - INFO - llamafactory.data.template - Add pad token: <|eot_id|>
+07/16/2024 16:01:00 - WARNING - transformers.tokenization_utils_base - Special tokens have been added in the vocabulary, make sure the associated word embeddings are fine-tuned or trained.
+07/16/2024 16:01:00 - INFO - llamafactory.data.template - Replace eos token: <|eot_id|>
+07/16/2024 16:01:00 - INFO - llamafactory.data.template - Add pad token: <|eot_id|>
+07/16/2024 16:01:00 - WARNING - transformers.tokenization_utils_base - Special tokens have been added in the vocabulary, make sure the associated word embeddings are fine-tuned or trained.
+07/16/2024 16:01:00 - INFO - llamafactory.data.template - Replace eos token: <|eot_id|>
+07/16/2024 16:01:00 - INFO - llamafactory.data.template - Add pad token: <|eot_id|>
+[INFO|tokenization_utils_base.py:2161] 2024-07-16 16:01:00,358 >> loading file tokenizer.json from cache at /root/.cache/huggingface/hub/models--meta-llama--Meta-Llama-3-8B-Instruct/snapshots/e1945c40cd546c78e41f1151f4db032b271faeaa/tokenizer.json
+[INFO|tokenization_utils_base.py:2161] 2024-07-16 16:01:00,358 >> loading file added_tokens.json from cache at None
+[INFO|tokenization_utils_base.py:2161] 2024-07-16 16:01:00,359 >> loading file special_tokens_map.json from cache at /root/.cache/huggingface/hub/models--meta-llama--Meta-Llama-3-8B-Instruct/snapshots/e1945c40cd546c78e41f1151f4db032b271faeaa/special_tokens_map.json
+[INFO|tokenization_utils_base.py:2161] 2024-07-16 16:01:00,359 >> loading file tokenizer_config.json from cache at /root/.cache/huggingface/hub/models--meta-llama--Meta-Llama-3-8B-Instruct/snapshots/e1945c40cd546c78e41f1151f4db032b271faeaa/tokenizer_config.json
+[WARNING|logging.py:313] 2024-07-16 16:01:00,655 >> Special tokens have been added in the vocabulary, make sure the associated word embeddings are fine-tuned or trained.
+[INFO|template.py:270] 2024-07-16 16:01:00,656 >> Replace eos token: <|eot_id|>
+[INFO|template.py:372] 2024-07-16 16:01:00,656 >> Add pad token: <|eot_id|>
+[INFO|loader.py:50] 2024-07-16 16:01:00,657 >> Loading dataset 0716_truthfulqa_benchmark_train_2.json...
+07/16/2024 16:01:02 - INFO - llamafactory.data.loader - Loading dataset 0716_truthfulqa_benchmark_train_2.json...
+07/16/2024 16:01:02 - INFO - llamafactory.data.loader - Loading dataset 0716_truthfulqa_benchmark_train_2.json...
+07/16/2024 16:01:02 - INFO - llamafactory.data.loader - Loading dataset 0716_truthfulqa_benchmark_train_2.json...
+07/16/2024 16:01:02 - INFO - llamafactory.data.loader - Loading dataset 0716_truthfulqa_benchmark_train_2.json...
+07/16/2024 16:01:02 - INFO - llamafactory.data.loader - Loading dataset 0716_truthfulqa_benchmark_train_2.json...
+07/16/2024 16:01:02 - INFO - llamafactory.data.loader - Loading dataset 0716_truthfulqa_benchmark_train_2.json...
+07/16/2024 16:01:02 - INFO - llamafactory.data.loader - Loading dataset 0716_truthfulqa_benchmark_train_2.json...
+[INFO|configuration_utils.py:733] 2024-07-16 16:01:06,083 >> loading configuration file config.json from cache at /root/.cache/huggingface/hub/models--meta-llama--Meta-Llama-3-8B-Instruct/snapshots/e1945c40cd546c78e41f1151f4db032b271faeaa/config.json
+[INFO|configuration_utils.py:800] 2024-07-16 16:01:06,086 >> Model config LlamaConfig {
+  "_name_or_path": "meta-llama/Meta-Llama-3-8B-Instruct",
+  "architectures": [
+    "LlamaForCausalLM"
+  ],
+  "attention_bias": false,
+  "attention_dropout": 0.0,
+  "bos_token_id": 128000,
+  "eos_token_id": 128009,
+  "hidden_act": "silu",
+  "hidden_size": 4096,
+  "initializer_range": 0.02,
+  "intermediate_size": 14336,
+  "max_position_embeddings": 8192,
+  "mlp_bias": false,
+  "model_type": "llama",
+  "num_attention_heads": 32,
+  "num_hidden_layers": 32,
+  "num_key_value_heads": 8,
+  "pretraining_tp": 1,
+  "rms_norm_eps": 1e-05,
+  "rope_scaling": null,
+  "rope_theta": 500000.0,
+  "tie_word_embeddings": false,
+  "torch_dtype": "bfloat16",
+  "transformers_version": "4.42.3",
+  "use_cache": true,
+  "vocab_size": 128256
+}
+[INFO|modeling_utils.py:3556] 2024-07-16 16:01:06,138 >> loading weights file model.safetensors from cache at /root/.cache/huggingface/hub/models--meta-llama--Meta-Llama-3-8B-Instruct/snapshots/e1945c40cd546c78e41f1151f4db032b271faeaa/model.safetensors.index.json
+[INFO|modeling_utils.py:1531] 2024-07-16 16:01:06,140 >> Instantiating LlamaForCausalLM model under default dtype torch.bfloat16.
+[INFO|configuration_utils.py:1000] 2024-07-16 16:01:06,142 >> Generate config GenerationConfig {
+  "bos_token_id": 128000,
+  "eos_token_id": 128009
+}
+[INFO|modeling_utils.py:4364] 2024-07-16 16:01:10,034 >> All model checkpoint weights were used when initializing LlamaForCausalLM.
+[INFO|modeling_utils.py:4372] 2024-07-16 16:01:10,034 >> All the weights of LlamaForCausalLM were initialized from the model checkpoint at meta-llama/Meta-Llama-3-8B-Instruct.
+If your task is similar to the task the model of the checkpoint was trained on, you can already use LlamaForCausalLM for predictions without further training.
+[INFO|configuration_utils.py:955] 2024-07-16 16:01:10,203 >> loading configuration file generation_config.json from cache at /root/.cache/huggingface/hub/models--meta-llama--Meta-Llama-3-8B-Instruct/snapshots/e1945c40cd546c78e41f1151f4db032b271faeaa/generation_config.json
+[INFO|configuration_utils.py:1000] 2024-07-16 16:01:10,204 >> Generate config GenerationConfig {
+  "bos_token_id": 128000,
+  "do_sample": true,
+  "eos_token_id": [
+    128001,
+    128009
+  ],
+  "max_length": 4096,
+  "temperature": 0.6,
+  "top_p": 0.9
+}
+[INFO|checkpointing.py:103] 2024-07-16 16:01:10,211 >> Gradient checkpointing enabled.
+[INFO|attention.py:80] 2024-07-16 16:01:10,211 >> Using torch SDPA for faster training and inference.
+[INFO|adapter.py:302] 2024-07-16 16:01:10,212 >> Upcasting trainable params to float32.
+[INFO|adapter.py:48] 2024-07-16 16:01:10,212 >> Fine-tuning method: Full
+[INFO|loader.py:196] 2024-07-16 16:01:10,254 >> trainable params: 8,030,261,248 || all params: 8,030,261,248 || trainable%: 100.0000
+07/16/2024 16:01:10 - INFO - llamafactory.model.model_utils.checkpointing - Gradient checkpointing enabled.
+07/16/2024 16:01:10 - INFO - llamafactory.model.model_utils.attention - Using torch SDPA for faster training and inference.
+07/16/2024 16:01:10 - INFO - llamafactory.model.adapter - Upcasting trainable params to float32.
+07/16/2024 16:01:10 - INFO - llamafactory.model.adapter - Fine-tuning method: Full
+07/16/2024 16:01:10 - INFO - llamafactory.model.model_utils.checkpointing - Gradient checkpointing enabled.
+07/16/2024 16:01:10 - INFO - llamafactory.model.model_utils.attention - Using torch SDPA for faster training and inference.
+07/16/2024 16:01:10 - INFO - llamafactory.model.adapter - Upcasting trainable params to float32.
+07/16/2024 16:01:10 - INFO - llamafactory.model.adapter - Fine-tuning method: Full
+07/16/2024 16:01:10 - INFO - llamafactory.model.model_utils.checkpointing - Gradient checkpointing enabled.
+07/16/2024 16:01:10 - INFO - llamafactory.model.model_utils.attention - Using torch SDPA for faster training and inference.
+07/16/2024 16:01:10 - INFO - llamafactory.model.adapter - Upcasting trainable params to float32.
+07/16/2024 16:01:10 - INFO - llamafactory.model.adapter - Fine-tuning method: Full
+07/16/2024 16:01:10 - INFO - llamafactory.model.loader - trainable params: 8,030,261,248 || all params: 8,030,261,248 || trainable%: 100.0000
+07/16/2024 16:01:10 - INFO - llamafactory.model.loader - trainable params: 8,030,261,248 || all params: 8,030,261,248 || trainable%: 100.0000
+07/16/2024 16:01:10 - INFO - llamafactory.model.model_utils.checkpointing - Gradient checkpointing enabled.
+07/16/2024 16:01:10 - INFO - llamafactory.model.model_utils.attention - Using torch SDPA for faster training and inference.
+07/16/2024 16:01:10 - INFO - llamafactory.model.adapter - Upcasting trainable params to float32.
+07/16/2024 16:01:10 - INFO - llamafactory.model.adapter - Fine-tuning method: Full
+07/16/2024 16:01:10 - INFO - llamafactory.model.loader - trainable params: 8,030,261,248 || all params: 8,030,261,248 || trainable%: 100.0000
+07/16/2024 16:01:10 - INFO - llamafactory.model.model_utils.checkpointing - Gradient checkpointing enabled.
+07/16/2024 16:01:10 - INFO - llamafactory.model.model_utils.attention - Using torch SDPA for faster training and inference.
+07/16/2024 16:01:10 - INFO - llamafactory.model.adapter - Upcasting trainable params to float32.
+07/16/2024 16:01:10 - INFO - llamafactory.model.adapter - Fine-tuning method: Full
+07/16/2024 16:01:10 - INFO - llamafactory.model.loader - trainable params: 8,030,261,248 || all params: 8,030,261,248 || trainable%: 100.0000
+07/16/2024 16:01:10 - INFO - llamafactory.model.loader - trainable params: 8,030,261,248 || all params: 8,030,261,248 || trainable%: 100.0000
+07/16/2024 16:01:10 - INFO - llamafactory.model.model_utils.checkpointing - Gradient checkpointing enabled.
+07/16/2024 16:01:10 - INFO - llamafactory.model.model_utils.attention - Using torch SDPA for faster training and inference.
+07/16/2024 16:01:10 - INFO - llamafactory.model.adapter - Upcasting trainable params to float32.
+07/16/2024 16:01:10 - INFO - llamafactory.model.adapter - Fine-tuning method: Full
+[INFO|trainer.py:642] 2024-07-16 16:01:10,260 >> Using auto half precision backend
+07/16/2024 16:01:10 - INFO - llamafactory.model.loader - trainable params: 8,030,261,248 || all params: 8,030,261,248 || trainable%: 100.0000
+07/16/2024 16:01:10 - INFO - llamafactory.model.model_utils.checkpointing - Gradient checkpointing enabled.
+07/16/2024 16:01:10 - INFO - llamafactory.model.model_utils.attention - Using torch SDPA for faster training and inference.
+07/16/2024 16:01:10 - INFO - llamafactory.model.adapter - Upcasting trainable params to float32.
+07/16/2024 16:01:10 - INFO - llamafactory.model.adapter - Fine-tuning method: Full
+07/16/2024 16:01:10 - INFO - llamafactory.model.loader - trainable params: 8,030,261,248 || all params: 8,030,261,248 || trainable%: 100.0000
+[INFO|trainer.py:2128] 2024-07-16 16:01:34,721 >> ***** Running training *****
+[INFO|trainer.py:2129] 2024-07-16 16:01:34,721 >>   Num examples = 4,958
+[INFO|trainer.py:2130] 2024-07-16 16:01:34,721 >>   Num Epochs = 5
+[INFO|trainer.py:2131] 2024-07-16 16:01:34,721 >>   Instantaneous batch size per device = 2
+[INFO|trainer.py:2134] 2024-07-16 16:01:34,721 >>   Total train batch size (w. parallel, distributed & accumulation) = 128
+[INFO|trainer.py:2135] 2024-07-16 16:01:34,721 >>   Gradient Accumulation steps = 8
+[INFO|trainer.py:2136] 2024-07-16 16:01:34,721 >>   Total optimization steps = 190
+[INFO|trainer.py:2137] 2024-07-16 16:01:34,722 >>   Number of trainable parameters = 8,030,261,248
+[INFO|callbacks.py:310] 2024-07-16 16:01:59,318 >> {'loss': 13.7821, 'learning_rate': 5.0000e-07, 'epoch': 0.03, 'throughput': 260.88}
+[INFO|callbacks.py:310] 2024-07-16 16:02:12,483 >> {'loss': 13.6363, 'learning_rate': 1.0000e-06, 'epoch': 0.05, 'throughput': 344.08}
+[INFO|callbacks.py:310] 2024-07-16 16:02:25,669 >> {'loss': 13.6033, 'learning_rate': 1.5000e-06, 'epoch': 0.08, 'throughput': 382.21}
+[INFO|callbacks.py:310] 2024-07-16 16:02:38,846 >> {'loss': 12.5696, 'learning_rate': 2.0000e-06, 'epoch': 0.10, 'throughput': 404.48}
+[INFO|callbacks.py:310] 2024-07-16 16:02:52,032 >> {'loss': 9.3589, 'learning_rate': 2.5000e-06, 'epoch': 0.13, 'throughput': 417.45}
+[INFO|callbacks.py:310] 2024-07-16 16:03:05,202 >> {'loss': 6.7715, 'learning_rate': 3.0000e-06, 'epoch': 0.15, 'throughput': 427.06}
+[INFO|callbacks.py:310] 2024-07-16 16:03:18,375 >> {'loss': 5.3541, 'learning_rate': 3.5000e-06, 'epoch': 0.18, 'throughput': 434.07}
+[INFO|callbacks.py:310] 2024-07-16 16:03:31,565 >> {'loss': 1.9295, 'learning_rate': 4.0000e-06, 'epoch': 0.21, 'throughput': 439.30}
+[INFO|callbacks.py:310] 2024-07-16 16:03:44,763 >> {'loss': 0.6328, 'learning_rate': 4.5000e-06, 'epoch': 0.23, 'throughput': 441.47}
+[INFO|callbacks.py:310] 2024-07-16 16:03:57,936 >> {'loss': 3.3225, 'learning_rate': 5.0000e-06, 'epoch': 0.26, 'throughput': 444.77}
+[INFO|callbacks.py:310] 2024-07-16 16:04:11,125 >> {'loss': 0.2598, 'learning_rate': 4.9996e-06, 'epoch': 0.28, 'throughput': 447.47}
+[INFO|callbacks.py:310] 2024-07-16 16:04:24,294 >> {'loss': 0.6874, 'learning_rate': 4.9985e-06, 'epoch': 0.31, 'throughput': 450.46}
+[INFO|callbacks.py:310] 2024-07-16 16:04:37,477 >> {'loss': 2.0329, 'learning_rate': 4.9966e-06, 'epoch': 0.34, 'throughput': 452.54}
+[INFO|callbacks.py:310] 2024-07-16 16:04:50,644 >> {'loss': 0.4942, 'learning_rate': 4.9939e-06, 'epoch': 0.36, 'throughput': 454.14}
+[INFO|callbacks.py:310] 2024-07-16 16:05:03,824 >> {'loss': 1.1786, 'learning_rate': 4.9905e-06, 'epoch': 0.39, 'throughput': 456.59}
+[INFO|callbacks.py:310] 2024-07-16 16:05:17,004 >> {'loss': 0.4424, 'learning_rate': 4.9863e-06, 'epoch': 0.41, 'throughput': 458.45}
+[INFO|callbacks.py:310] 2024-07-16 16:05:30,183 >> {'loss': 0.3336, 'learning_rate': 4.9814e-06, 'epoch': 0.44, 'throughput': 459.83}
+[INFO|callbacks.py:310] 2024-07-16 16:05:43,368 >> {'loss': 0.2568, 'learning_rate': 4.9757e-06, 'epoch': 0.46, 'throughput': 460.35}
+[INFO|callbacks.py:310] 2024-07-16 16:05:56,545 >> {'loss': 0.1889, 'learning_rate': 4.9692e-06, 'epoch': 0.49, 'throughput': 461.44}
+[INFO|callbacks.py:310] 2024-07-16 16:06:09,717 >> {'loss': 0.1974, 'learning_rate': 4.9620e-06, 'epoch': 0.52, 'throughput': 462.27}
+[INFO|callbacks.py:310] 2024-07-16 16:06:22,902 >> {'loss': 0.1766, 'learning_rate': 4.9541e-06, 'epoch': 0.54, 'throughput': 463.99}
+[INFO|callbacks.py:310] 2024-07-16 16:06:36,060 >> {'loss': 0.1694, 'learning_rate': 4.9454e-06, 'epoch': 0.57, 'throughput': 464.28}
+[INFO|callbacks.py:310] 2024-07-16 16:06:49,233 >> {'loss': 0.1374, 'learning_rate': 4.9359e-06, 'epoch': 0.59, 'throughput': 465.03}
+[INFO|callbacks.py:310] 2024-07-16 16:07:02,410 >> {'loss': 0.1496, 'learning_rate': 4.9257e-06, 'epoch': 0.62, 'throughput': 466.25}
+[INFO|callbacks.py:310] 2024-07-16 16:07:15,596 >> {'loss': 0.1554, 'learning_rate': 4.9148e-06, 'epoch': 0.65, 'throughput': 466.38}
+[INFO|callbacks.py:310] 2024-07-16 16:07:28,752 >> {'loss': 0.0918, 'learning_rate': 4.9032e-06, 'epoch': 0.67, 'throughput': 466.86}
+[INFO|callbacks.py:310] 2024-07-16 16:07:41,916 >> {'loss': 0.1062, 'learning_rate': 4.8908e-06, 'epoch': 0.70, 'throughput': 467.90}
+[INFO|callbacks.py:310] 2024-07-16 16:07:55,082 >> {'loss': 0.1975, 'learning_rate': 4.8776e-06, 'epoch': 0.72, 'throughput': 468.27}
+[INFO|callbacks.py:310] 2024-07-16 16:08:08,244 >> {'loss': 0.1389, 'learning_rate': 4.8638e-06, 'epoch': 0.75, 'throughput': 468.71}
+[INFO|callbacks.py:310] 2024-07-16 16:08:21,418 >> {'loss': 0.1382, 'learning_rate': 4.8492e-06, 'epoch': 0.77, 'throughput': 469.38}
+[INFO|callbacks.py:310] 2024-07-16 16:08:34,599 >> {'loss': 0.1982, 'learning_rate': 4.8340e-06, 'epoch': 0.80, 'throughput': 469.24}
+[INFO|callbacks.py:310] 2024-07-16 16:08:47,765 >> {'loss': 0.1072, 'learning_rate': 4.8180e-06, 'epoch': 0.83, 'throughput': 469.35}
+[INFO|callbacks.py:310] 2024-07-16 16:09:00,929 >> {'loss': 0.0757, 'learning_rate': 4.8013e-06, 'epoch': 0.85, 'throughput': 470.10}
+[INFO|callbacks.py:310] 2024-07-16 16:09:14,099 >> {'loss': 0.0829, 'learning_rate': 4.7839e-06, 'epoch': 0.88, 'throughput': 470.13}
+[INFO|callbacks.py:310] 2024-07-16 16:09:27,270 >> {'loss': 0.1017, 'learning_rate': 4.7658e-06, 'epoch': 0.90, 'throughput': 470.20}
+[INFO|callbacks.py:310] 2024-07-16 16:09:40,431 >> {'loss': 0.0957, 'learning_rate': 4.7470e-06, 'epoch': 0.93, 'throughput': 470.47}
+[INFO|callbacks.py:310] 2024-07-16 16:09:53,603 >> {'loss': 0.0999, 'learning_rate': 4.7275e-06, 'epoch': 0.95, 'throughput': 471.30}
+[INFO|callbacks.py:310] 2024-07-16 16:10:06,768 >> {'loss': 0.0581, 'learning_rate': 4.7074e-06, 'epoch': 0.98, 'throughput': 471.80}
+[INFO|callbacks.py:310] 2024-07-16 16:10:19,934 >> {'loss': 0.0923, 'learning_rate': 4.6865e-06, 'epoch': 1.01, 'throughput': 472.34}
+[INFO|callbacks.py:310] 2024-07-16 16:10:33,082 >> {'loss': 0.0506, 'learning_rate': 4.6651e-06, 'epoch': 1.03, 'throughput': 472.58}
+[INFO|callbacks.py:310] 2024-07-16 16:10:46,249 >> {'loss': 0.0333, 'learning_rate': 4.6429e-06, 'epoch': 1.06, 'throughput': 472.58}
+[INFO|callbacks.py:310] 2024-07-16 16:10:59,408 >> {'loss': 0.0380, 'learning_rate': 4.6201e-06, 'epoch': 1.08, 'throughput': 472.96}
+[INFO|callbacks.py:310] 2024-07-16 16:11:12,564 >> {'loss': 0.0416, 'learning_rate': 4.5967e-06, 'epoch': 1.11, 'throughput': 473.13}
+[INFO|callbacks.py:310] 2024-07-16 16:11:25,735 >> {'loss': 0.1068, 'learning_rate': 4.5726e-06, 'epoch': 1.14, 'throughput': 473.22}
+[INFO|callbacks.py:310] 2024-07-16 16:11:38,904 >> {'loss': 0.0369, 'learning_rate': 4.5479e-06, 'epoch': 1.16, 'throughput': 473.32}
+[INFO|callbacks.py:310] 2024-07-16 16:11:52,063 >> {'loss': 0.1703, 'learning_rate': 4.5225e-06, 'epoch': 1.19, 'throughput': 473.49}
+[INFO|callbacks.py:310] 2024-07-16 16:12:05,226 >> {'loss': 0.1102, 'learning_rate': 4.4966e-06, 'epoch': 1.21, 'throughput': 473.60}
+[INFO|callbacks.py:310] 2024-07-16 16:12:18,398 >> {'loss': 0.0595, 'learning_rate': 4.4700e-06, 'epoch': 1.24, 'throughput': 473.71}
+[INFO|callbacks.py:310] 2024-07-16 16:12:31,565 >> {'loss': 0.1009, 'learning_rate': 4.4429e-06, 'epoch': 1.26, 'throughput': 473.98}
+[INFO|callbacks.py:310] 2024-07-16 16:12:44,725 >> {'loss': 0.0434, 'learning_rate': 4.4151e-06, 'epoch': 1.29, 'throughput': 474.12}
+[INFO|callbacks.py:310] 2024-07-16 16:12:57,869 >> {'loss': 0.0281, 'learning_rate': 4.3868e-06, 'epoch': 1.32, 'throughput': 474.46}
+[INFO|callbacks.py:310] 2024-07-16 16:13:11,049 >> {'loss': 0.0513, 'learning_rate': 4.3579e-06, 'epoch': 1.34, 'throughput': 474.35}
+[INFO|callbacks.py:310] 2024-07-16 16:13:24,229 >> {'loss': 0.0902, 'learning_rate': 4.3284e-06, 'epoch': 1.37, 'throughput': 474.43}
+[INFO|callbacks.py:310] 2024-07-16 16:13:37,389 >> {'loss': 0.0448, 'learning_rate': 4.2983e-06, 'epoch': 1.39, 'throughput': 474.55}
+[INFO|callbacks.py:310] 2024-07-16 16:13:50,556 >> {'loss': 0.0360, 'learning_rate': 4.2678e-06, 'epoch': 1.42, 'throughput': 474.98}
+[INFO|callbacks.py:310] 2024-07-16 16:14:03,729 >> {'loss': 0.0279, 'learning_rate': 4.2366e-06, 'epoch': 1.45, 'throughput': 475.04}
+[INFO|callbacks.py:310] 2024-07-16 16:14:16,913 >> {'loss': 0.0527, 'learning_rate': 4.2050e-06, 'epoch': 1.47, 'throughput': 475.14}
+[INFO|callbacks.py:310] 2024-07-16 16:14:30,074 >> {'loss': 0.0466, 'learning_rate': 4.1728e-06, 'epoch': 1.50, 'throughput': 475.66}
+[INFO|callbacks.py:310] 2024-07-16 16:14:43,261 >> {'loss': 0.0203, 'learning_rate': 4.1401e-06, 'epoch': 1.52, 'throughput': 475.90}
+[INFO|callbacks.py:310] 2024-07-16 16:14:56,437 >> {'loss': 0.0693, 'learning_rate': 4.1070e-06, 'epoch': 1.55, 'throughput': 475.74}
+[INFO|callbacks.py:310] 2024-07-16 16:15:09,625 >> {'loss': 0.0193, 'learning_rate': 4.0733e-06, 'epoch': 1.57, 'throughput': 475.58}
+[INFO|callbacks.py:310] 2024-07-16 16:15:22,819 >> {'loss': 0.1155, 'learning_rate': 4.0392e-06, 'epoch': 1.60, 'throughput': 475.95}
+[INFO|callbacks.py:310] 2024-07-16 16:15:36,030 >> {'loss': 0.0594, 'learning_rate': 4.0045e-06, 'epoch': 1.63, 'throughput': 476.06}
+[INFO|callbacks.py:310] 2024-07-16 16:15:49,202 >> {'loss': 0.0391, 'learning_rate': 3.9695e-06, 'epoch': 1.65, 'throughput': 476.02}
+[INFO|callbacks.py:310] 2024-07-16 16:16:02,414 >> {'loss': 0.0552, 'learning_rate': 3.9339e-06, 'epoch': 1.68, 'throughput': 476.02}
+[INFO|callbacks.py:310] 2024-07-16 16:16:15,619 >> {'loss': 0.0300, 'learning_rate': 3.8980e-06, 'epoch': 1.70, 'throughput': 476.12}
+[INFO|callbacks.py:310] 2024-07-16 16:16:28,843 >> {'loss': 0.0458, 'learning_rate': 3.8616e-06, 'epoch': 1.73, 'throughput': 476.36}
+[INFO|callbacks.py:310] 2024-07-16 16:16:42,017 >> {'loss': 0.0502, 'learning_rate': 3.8248e-06, 'epoch': 1.75, 'throughput': 476.58}
+[INFO|callbacks.py:310] 2024-07-16 16:16:55,194 >> {'loss': 0.0513, 'learning_rate': 3.7876e-06, 'epoch': 1.78, 'throughput': 476.59}
+[INFO|callbacks.py:310] 2024-07-16 16:17:08,356 >> {'loss': 0.0309, 'learning_rate': 3.7500e-06, 'epoch': 1.81, 'throughput': 476.93}
+[INFO|callbacks.py:310] 2024-07-16 16:17:21,528 >> {'loss': 0.0889, 'learning_rate': 3.7120e-06, 'epoch': 1.83, 'throughput': 476.99}
+[INFO|callbacks.py:310] 2024-07-16 16:17:34,696 >> {'loss': 0.0868, 'learning_rate': 3.6737e-06, 'epoch': 1.86, 'throughput': 476.95}
+[INFO|callbacks.py:310] 2024-07-16 16:17:47,854 >> {'loss': 0.0516, 'learning_rate': 3.6350e-06, 'epoch': 1.88, 'throughput': 476.96}
+[INFO|callbacks.py:310] 2024-07-16 16:18:01,019 >> {'loss': 0.0590, 'learning_rate': 3.5959e-06, 'epoch': 1.91, 'throughput': 477.28}
+[INFO|callbacks.py:310] 2024-07-16 16:18:14,190 >> {'loss': 0.0475, 'learning_rate': 3.5565e-06, 'epoch': 1.94, 'throughput': 477.42}
+[INFO|callbacks.py:310] 2024-07-16 16:18:27,351 >> {'loss': 0.0704, 'learning_rate': 3.5168e-06, 'epoch': 1.96, 'throughput': 477.51}
+[INFO|callbacks.py:310] 2024-07-16 16:18:40,532 >> {'loss': 0.0666, 'learning_rate': 3.4768e-06, 'epoch': 1.99, 'throughput': 477.44}
+[INFO|callbacks.py:310] 2024-07-16 16:18:53,697 >> {'loss': 0.0275, 'learning_rate': 3.4365e-06, 'epoch': 2.01, 'throughput': 477.39}
+[INFO|callbacks.py:310] 2024-07-16 16:19:06,863 >> {'loss': 0.0169, 'learning_rate': 3.3959e-06, 'epoch': 2.04, 'throughput': 477.49}
+[INFO|callbacks.py:310] 2024-07-16 16:19:20,024 >> {'loss': 0.0056, 'learning_rate': 3.3551e-06, 'epoch': 2.06, 'throughput': 477.79}
+[INFO|callbacks.py:310] 2024-07-16 16:19:33,190 >> {'loss': 0.0139, 'learning_rate': 3.3139e-06, 'epoch': 2.09, 'throughput': 477.73}
+[INFO|callbacks.py:310] 2024-07-16 16:19:46,365 >> {'loss': 0.0561, 'learning_rate': 3.2725e-06, 'epoch': 2.12, 'throughput': 477.99}
+[INFO|callbacks.py:310] 2024-07-16 16:19:59,530 >> {'loss': 0.0098, 'learning_rate': 3.2309e-06, 'epoch': 2.14, 'throughput': 478.07}
+[INFO|callbacks.py:310] 2024-07-16 16:20:12,693 >> {'loss': 0.0037, 'learning_rate': 3.1891e-06, 'epoch': 2.17, 'throughput': 478.10}
+[INFO|callbacks.py:310] 2024-07-16 16:20:25,850 >> {'loss': 0.0194, 'learning_rate': 3.1470e-06, 'epoch': 2.19, 'throughput': 478.31}
+[INFO|callbacks.py:310] 2024-07-16 16:20:39,012 >> {'loss': 0.0004, 'learning_rate': 3.1048e-06, 'epoch': 2.22, 'throughput': 478.31}
+[INFO|callbacks.py:310] 2024-07-16 16:20:52,174 >> {'loss': 0.0003, 'learning_rate': 3.0624e-06, 'epoch': 2.25, 'throughput': 478.43}
+[INFO|callbacks.py:310] 2024-07-16 16:21:05,338 >> {'loss': 0.0511, 'learning_rate': 3.0198e-06, 'epoch': 2.27, 'throughput': 478.42}
+[INFO|callbacks.py:310] 2024-07-16 16:21:18,503 >> {'loss': 0.0974, 'learning_rate': 2.9770e-06, 'epoch': 2.30, 'throughput': 478.66}
+[INFO|callbacks.py:310] 2024-07-16 16:21:31,670 >> {'loss': 0.0442, 'learning_rate': 2.9341e-06, 'epoch': 2.32, 'throughput': 478.60}
+[INFO|callbacks.py:310] 2024-07-16 16:21:44,838 >> {'loss': 0.0802, 'learning_rate': 2.8911e-06, 'epoch': 2.35, 'throughput': 478.49}
+[INFO|callbacks.py:310] 2024-07-16 16:21:58,015 >> {'loss': 0.0195, 'learning_rate': 2.8479e-06, 'epoch': 2.37, 'throughput': 478.66}
+[INFO|callbacks.py:310] 2024-07-16 16:22:11,180 >> {'loss': 0.0550, 'learning_rate': 2.8047e-06, 'epoch': 2.40, 'throughput': 478.62}
+[INFO|callbacks.py:310] 2024-07-16 16:22:24,345 >> {'loss': 0.0268, 'learning_rate': 2.7613e-06, 'epoch': 2.43, 'throughput': 478.66}
+[INFO|callbacks.py:310] 2024-07-16 16:22:37,492 >> {'loss': 0.0196, 'learning_rate': 2.7179e-06, 'epoch': 2.45, 'throughput': 478.71}
+[INFO|callbacks.py:310] 2024-07-16 16:22:50,668 >> {'loss': 0.0363, 'learning_rate': 2.6744e-06, 'epoch': 2.48, 'throughput': 478.69}
+[INFO|callbacks.py:310] 2024-07-16 16:23:03,834 >> {'loss': 0.0046, 'learning_rate': 2.6308e-06, 'epoch': 2.50, 'throughput': 478.64}
+[INFO|callbacks.py:310] 2024-07-16 16:23:16,992 >> {'loss': 0.0366, 'learning_rate': 2.5872e-06, 'epoch': 2.53, 'throughput': 478.64}
+[INFO|callbacks.py:310] 2024-07-16 16:23:30,144 >> {'loss': 0.0051, 'learning_rate': 2.5436e-06, 'epoch': 2.55, 'throughput': 478.64}
+[INFO|callbacks.py:310] 2024-07-16 16:23:43,301 >> {'loss': 0.0226, 'learning_rate': 2.5000e-06, 'epoch': 2.58, 'throughput': 478.82}
+[INFO|callbacks.py:310] 2024-07-16 16:23:56,469 >> {'loss': 0.0818, 'learning_rate': 2.4564e-06, 'epoch': 2.61, 'throughput': 478.85}
+[INFO|callbacks.py:310] 2024-07-16 16:24:09,632 >> {'loss': 0.0247, 'learning_rate': 2.4128e-06, 'epoch': 2.63, 'throughput': 478.93}
+[INFO|callbacks.py:310] 2024-07-16 16:24:22,814 >> {'loss': 0.0593, 'learning_rate': 2.3692e-06, 'epoch': 2.66, 'throughput': 478.83}
+[INFO|callbacks.py:310] 2024-07-16 16:24:35,972 >> {'loss': 0.0073, 'learning_rate': 2.3256e-06, 'epoch': 2.68, 'throughput': 479.05}
+[INFO|callbacks.py:310] 2024-07-16 16:24:49,129 >> {'loss': 0.0295, 'learning_rate': 2.2821e-06, 'epoch': 2.71, 'throughput': 479.07}
+[INFO|callbacks.py:310] 2024-07-16 16:25:02,310 >> {'loss': 0.0115, 'learning_rate': 2.2387e-06, 'epoch': 2.74, 'throughput': 478.96}
+[INFO|callbacks.py:310] 2024-07-16 16:25:15,470 >> {'loss': 0.0064, 'learning_rate': 2.1953e-06, 'epoch': 2.76, 'throughput': 478.95}
+[INFO|callbacks.py:310] 2024-07-16 16:25:28,641 >> {'loss': 0.0229, 'learning_rate': 2.1521e-06, 'epoch': 2.79, 'throughput': 478.89}
+[INFO|callbacks.py:310] 2024-07-16 16:25:41,814 >> {'loss': 0.0605, 'learning_rate': 2.1089e-06, 'epoch': 2.81, 'throughput': 478.89}
+[INFO|callbacks.py:310] 2024-07-16 16:25:54,992 >> {'loss': 0.0500, 'learning_rate': 2.0659e-06, 'epoch': 2.84, 'throughput': 478.95}
+[INFO|callbacks.py:310] 2024-07-16 16:26:08,163 >> {'loss': 0.0544, 'learning_rate': 2.0230e-06, 'epoch': 2.86, 'throughput': 478.93}
+[INFO|callbacks.py:310] 2024-07-16 16:26:21,350 >> {'loss': 0.0109, 'learning_rate': 1.9802e-06, 'epoch': 2.89, 'throughput': 478.90}
+[INFO|callbacks.py:310] 2024-07-16 16:26:34,506 >> {'loss': 0.0242, 'learning_rate': 1.9376e-06, 'epoch': 2.92, 'throughput': 478.86}
+[INFO|callbacks.py:310] 2024-07-16 16:26:47,673 >> {'loss': 0.0223, 'learning_rate': 1.8952e-06, 'epoch': 2.94, 'throughput': 479.09}
+[INFO|callbacks.py:310] 2024-07-16 16:27:00,837 >> {'loss': 0.0263, 'learning_rate': 1.8530e-06, 'epoch': 2.97, 'throughput': 479.20}
+[INFO|callbacks.py:310] 2024-07-16 16:27:13,992 >> {'loss': 0.0014, 'learning_rate': 1.8109e-06, 'epoch': 2.99, 'throughput': 479.12}
+[INFO|callbacks.py:310] 2024-07-16 16:27:27,158 >> {'loss': 0.0061, 'learning_rate': 1.7691e-06, 'epoch': 3.02, 'throughput': 479.09}
+[INFO|callbacks.py:310] 2024-07-16 16:27:40,327 >> {'loss': 0.0296, 'learning_rate': 1.7275e-06, 'epoch': 3.05, 'throughput': 479.08}
+[INFO|callbacks.py:310] 2024-07-16 16:27:53,500 >> {'loss': 0.0186, 'learning_rate': 1.6861e-06, 'epoch': 3.07, 'throughput': 479.11}
+[INFO|callbacks.py:310] 2024-07-16 16:28:06,669 >> {'loss': 0.0038, 'learning_rate': 1.6449e-06, 'epoch': 3.10, 'throughput': 478.93}
+[INFO|callbacks.py:310] 2024-07-16 16:28:19,843 >> {'loss': 0.0033, 'learning_rate': 1.6041e-06, 'epoch': 3.12, 'throughput': 478.90}
+[INFO|callbacks.py:310] 2024-07-16 16:28:33,006 >> {'loss': 0.0091, 'learning_rate': 1.5635e-06, 'epoch': 3.15, 'throughput': 478.92}
+[INFO|callbacks.py:310] 2024-07-16 16:28:46,166 >> {'loss': 0.0012, 'learning_rate': 1.5232e-06, 'epoch': 3.17, 'throughput': 478.94}
+[INFO|callbacks.py:310] 2024-07-16 16:28:59,319 >> {'loss': 0.0223, 'learning_rate': 1.4832e-06, 'epoch': 3.20, 'throughput': 479.08}
+[INFO|callbacks.py:310] 2024-07-16 16:29:12,500 >> {'loss': 0.0131, 'learning_rate': 1.4435e-06, 'epoch': 3.23, 'throughput': 479.02}
+[INFO|callbacks.py:310] 2024-07-16 16:29:25,669 >> {'loss': 0.0008, 'learning_rate': 1.4041e-06, 'epoch': 3.25, 'throughput': 479.00}
+[INFO|callbacks.py:310] 2024-07-16 16:29:38,814 >> {'loss': 0.0058, 'learning_rate': 1.3650e-06, 'epoch': 3.28, 'throughput': 479.10}
+[INFO|callbacks.py:310] 2024-07-16 16:29:51,974 >> {'loss': 0.0065, 'learning_rate': 1.3263e-06, 'epoch': 3.30, 'throughput': 479.09}
+[INFO|callbacks.py:310] 2024-07-16 16:30:05,138 >> {'loss': 0.0398, 'learning_rate': 1.2880e-06, 'epoch': 3.33, 'throughput': 479.13}
+[INFO|callbacks.py:310] 2024-07-16 16:30:18,301 >> {'loss': 0.0005, 'learning_rate': 1.2500e-06, 'epoch': 3.35, 'throughput': 479.20}
+[INFO|callbacks.py:310] 2024-07-16 16:30:31,457 >> {'loss': 0.0049, 'learning_rate': 1.2124e-06, 'epoch': 3.38, 'throughput': 479.35}
+[INFO|callbacks.py:310] 2024-07-16 16:30:44,626 >> {'loss': 0.0061, 'learning_rate': 1.1752e-06, 'epoch': 3.41, 'throughput': 479.38}
+[INFO|callbacks.py:310] 2024-07-16 16:30:57,792 >> {'loss': 0.0111, 'learning_rate': 1.1384e-06, 'epoch': 3.43, 'throughput': 479.56}
+[INFO|callbacks.py:310] 2024-07-16 16:31:10,962 >> {'loss': 0.0049, 'learning_rate': 1.1020e-06, 'epoch': 3.46, 'throughput': 479.60}
+[INFO|callbacks.py:310] 2024-07-16 16:31:24,131 >> {'loss': 0.0012, 'learning_rate': 1.0661e-06, 'epoch': 3.48, 'throughput': 479.57}
+[INFO|callbacks.py:310] 2024-07-16 16:31:37,297 >> {'loss': 0.0004, 'learning_rate': 1.0305e-06, 'epoch': 3.51, 'throughput': 479.59}
+[INFO|callbacks.py:310] 2024-07-16 16:31:50,469 >> {'loss': 0.0006, 'learning_rate': 9.9546e-07, 'epoch': 3.54, 'throughput': 479.51}
+[INFO|callbacks.py:310] 2024-07-16 16:32:03,645 >> {'loss': 0.0003, 'learning_rate': 9.6085e-07, 'epoch': 3.56, 'throughput': 479.49}
+[INFO|callbacks.py:310] 2024-07-16 16:32:16,814 >> {'loss': 0.0004, 'learning_rate': 9.2670e-07, 'epoch': 3.59, 'throughput': 479.61}
+[INFO|callbacks.py:310] 2024-07-16 16:32:29,980 >> {'loss': 0.0016, 'learning_rate': 8.9303e-07, 'epoch': 3.61, 'throughput': 479.62}
+[INFO|callbacks.py:310] 2024-07-16 16:32:43,150 >> {'loss': 0.0268, 'learning_rate': 8.5985e-07, 'epoch': 3.64, 'throughput': 479.64}
+[INFO|callbacks.py:310] 2024-07-16 16:32:56,321 >> {'loss': 0.0018, 'learning_rate': 8.2717e-07, 'epoch': 3.66, 'throughput': 479.52}
+[INFO|callbacks.py:310] 2024-07-16 16:33:09,497 >> {'loss': 0.0100, 'learning_rate': 7.9500e-07, 'epoch': 3.69, 'throughput': 479.48}
+[INFO|callbacks.py:310] 2024-07-16 16:33:22,661 >> {'loss': 0.0209, 'learning_rate': 7.6335e-07, 'epoch': 3.72, 'throughput': 479.66}
+[INFO|callbacks.py:310] 2024-07-16 16:33:35,822 >> {'loss': 0.0076, 'learning_rate': 7.3223e-07, 'epoch': 3.74, 'throughput': 479.70}
+[INFO|callbacks.py:310] 2024-07-16 16:33:48,985 >> {'loss': 0.0227, 'learning_rate': 7.0165e-07, 'epoch': 3.77, 'throughput': 479.79}
+[INFO|callbacks.py:310] 2024-07-16 16:34:02,148 >> {'loss': 0.0002, 'learning_rate': 6.7162e-07, 'epoch': 3.79, 'throughput': 479.87}
+[INFO|callbacks.py:310] 2024-07-16 16:34:15,317 >> {'loss': 0.0296, 'learning_rate': 6.4214e-07, 'epoch': 3.82, 'throughput': 479.86}
+[INFO|callbacks.py:310] 2024-07-16 16:34:28,475 >> {'loss': 0.0006, 'learning_rate': 6.1323e-07, 'epoch': 3.85, 'throughput': 479.79}
+[INFO|callbacks.py:310] 2024-07-16 16:34:41,637 >> {'loss': 0.0012, 'learning_rate': 5.8489e-07, 'epoch': 3.87, 'throughput': 479.85}
+[INFO|callbacks.py:310] 2024-07-16 16:34:54,805 >> {'loss': 0.0007, 'learning_rate': 5.5714e-07, 'epoch': 3.90, 'throughput': 479.79}
+[INFO|callbacks.py:310] 2024-07-16 16:35:07,976 >> {'loss': 0.0003, 'learning_rate': 5.2997e-07, 'epoch': 3.92, 'throughput': 479.87}
+[INFO|callbacks.py:310] 2024-07-16 16:35:21,144 >> {'loss': 0.0005, 'learning_rate': 5.0341e-07, 'epoch': 3.95, 'throughput': 479.85}
+[INFO|callbacks.py:310] 2024-07-16 16:35:34,309 >> {'loss': 0.0008, 'learning_rate': 4.7746e-07, 'epoch': 3.97, 'throughput': 479.92}
+[INFO|callbacks.py:310] 2024-07-16 16:35:47,468 >> {'loss': 0.0003, 'learning_rate': 4.5212e-07, 'epoch': 4.00, 'throughput': 480.10}
+[INFO|callbacks.py:310] 2024-07-16 16:36:00,628 >> {'loss': 0.0015, 'learning_rate': 4.2741e-07, 'epoch': 4.03, 'throughput': 480.13}
+[INFO|callbacks.py:310] 2024-07-16 16:36:13,783 >> {'loss': 0.0007, 'learning_rate': 4.0332e-07, 'epoch': 4.05, 'throughput': 480.16}
+[INFO|callbacks.py:310] 2024-07-16 16:36:26,955 >> {'loss': 0.0002, 'learning_rate': 3.7988e-07, 'epoch': 4.08, 'throughput': 480.08}
+[INFO|callbacks.py:310] 2024-07-16 16:36:40,127 >> {'loss': 0.0052, 'learning_rate': 3.5708e-07, 'epoch': 4.10, 'throughput': 480.01}
+[INFO|callbacks.py:310] 2024-07-16 16:36:53,283 >> {'loss': 0.0040, 'learning_rate': 3.3494e-07, 'epoch': 4.13, 'throughput': 479.97}
+[INFO|callbacks.py:310] 2024-07-16 16:37:06,436 >> {'loss': 0.0004, 'learning_rate': 3.1345e-07, 'epoch': 4.15, 'throughput': 480.06}
+[INFO|callbacks.py:310] 2024-07-16 16:37:19,608 >> {'loss': 0.0020, 'learning_rate': 2.9263e-07, 'epoch': 4.18, 'throughput': 480.12}
+[INFO|callbacks.py:310] 2024-07-16 16:37:32,769 >> {'loss': 0.0001, 'learning_rate': 2.7248e-07, 'epoch': 4.21, 'throughput': 480.10}
+[INFO|callbacks.py:310] 2024-07-16 16:37:45,932 >> {'loss': 0.0001, 'learning_rate': 2.5301e-07, 'epoch': 4.23, 'throughput': 480.03}
+[INFO|callbacks.py:310] 2024-07-16 16:37:59,104 >> {'loss': 0.0002, 'learning_rate': 2.3423e-07, 'epoch': 4.26, 'throughput': 480.08}
+[INFO|callbacks.py:310] 2024-07-16 16:38:12,270 >> {'loss': 0.0076, 'learning_rate': 2.1614e-07, 'epoch': 4.28, 'throughput': 480.00}
+[INFO|callbacks.py:310] 2024-07-16 16:38:25,424 >> {'loss': 0.0001, 'learning_rate': 1.9874e-07, 'epoch': 4.31, 'throughput': 480.08}
+[INFO|callbacks.py:310] 2024-07-16 16:38:38,584 >> {'loss': 0.0002, 'learning_rate': 1.8204e-07, 'epoch': 4.34, 'throughput': 480.02}
+[INFO|callbacks.py:310] 2024-07-16 16:38:51,770 >> {'loss': 0.0001, 'learning_rate': 1.6605e-07, 'epoch': 4.36, 'throughput': 479.94}
+[INFO|callbacks.py:310] 2024-07-16 16:39:04,932 >> {'loss': 0.0001, 'learning_rate': 1.5077e-07, 'epoch': 4.39, 'throughput': 480.03}
+[INFO|callbacks.py:310] 2024-07-16 16:39:18,090 >> {'loss': 0.0002, 'learning_rate': 1.3620e-07, 'epoch': 4.41, 'throughput': 480.18}
+[INFO|callbacks.py:310] 2024-07-16 16:39:31,264 >> {'loss': 0.0001, 'learning_rate': 1.2236e-07, 'epoch': 4.44, 'throughput': 480.20}
+[INFO|callbacks.py:310] 2024-07-16 16:39:44,432 >> {'loss': 0.0005, 'learning_rate': 1.0924e-07, 'epoch': 4.46, 'throughput': 480.29}
+[INFO|callbacks.py:310] 2024-07-16 16:39:57,582 >> {'loss': 0.0001, 'learning_rate': 9.6846e-08, 'epoch': 4.49, 'throughput': 480.29}
+[INFO|callbacks.py:310] 2024-07-16 16:40:10,744 >> {'loss': 0.0001, 'learning_rate': 8.5185e-08, 'epoch': 4.52, 'throughput': 480.35}
+[INFO|callbacks.py:310] 2024-07-16 16:40:23,896 >> {'loss': 0.0081, 'learning_rate': 7.4261e-08, 'epoch': 4.54, 'throughput': 480.49}
+[INFO|callbacks.py:310] 2024-07-16 16:40:37,074 >> {'loss': 0.0002, 'learning_rate': 6.4075e-08, 'epoch': 4.57, 'throughput': 480.44}
+[INFO|callbacks.py:310] 2024-07-16 16:40:50,235 >> {'loss': 0.0003, 'learning_rate': 5.4631e-08, 'epoch': 4.59, 'throughput': 480.50}
+[INFO|callbacks.py:310] 2024-07-16 16:41:03,386 >> {'loss': 0.0001, 'learning_rate': 4.5932e-08, 'epoch': 4.62, 'throughput': 480.53}
+[INFO|callbacks.py:310] 2024-07-16 16:41:16,551 >> {'loss': 0.0005, 'learning_rate': 3.7981e-08, 'epoch': 4.65, 'throughput': 480.53}
+[INFO|callbacks.py:310] 2024-07-16 16:41:29,712 >> {'loss': 0.0001, 'learning_rate': 3.0779e-08, 'epoch': 4.67, 'throughput': 480.54}
+[INFO|callbacks.py:310] 2024-07-16 16:41:42,867 >> {'loss': 0.0002, 'learning_rate': 2.4330e-08, 'epoch': 4.70, 'throughput': 480.53}
+[INFO|callbacks.py:310] 2024-07-16 16:41:56,020 >> {'loss': 0.0001, 'learning_rate': 1.8635e-08, 'epoch': 4.72, 'throughput': 480.54}
+[INFO|callbacks.py:310] 2024-07-16 16:42:09,197 >> {'loss': 0.0002, 'learning_rate': 1.3695e-08, 'epoch': 4.75, 'throughput': 480.55}
+[INFO|callbacks.py:310] 2024-07-16 16:42:22,355 >> {'loss': 0.0002, 'learning_rate': 9.5133e-09, 'epoch': 4.77, 'throughput': 480.63}
+[INFO|callbacks.py:310] 2024-07-16 16:42:35,516 >> {'loss': 0.0002, 'learning_rate': 6.0899e-09, 'epoch': 4.80, 'throughput': 480.58}
+[INFO|callbacks.py:310] 2024-07-16 16:42:48,681 >> {'loss': 0.0001, 'learning_rate': 3.4262e-09, 'epoch': 4.83, 'throughput': 480.61}
+[INFO|callbacks.py:310] 2024-07-16 16:43:01,838 >> {'loss': 0.0004, 'learning_rate': 1.5229e-09, 'epoch': 4.85, 'throughput': 480.59}
+[INFO|callbacks.py:310] 2024-07-16 16:43:15,009 >> {'loss': 0.0013, 'learning_rate': 3.8076e-10, 'epoch': 4.88, 'throughput': 480.53}
+[INFO|callbacks.py:310] 2024-07-16 16:43:28,160 >> {'loss': 0.0008, 'learning_rate': 0.0000e+00, 'epoch': 4.90, 'throughput': 480.52}
+[INFO|trainer.py:3478] 2024-07-16 16:43:36,298 >> Saving model checkpoint to saves/LLaMA3-8B-Chat/full/train_2024-07-16-15-59-42_llama3_2/checkpoint-190
+[INFO|configuration_utils.py:472] 2024-07-16 16:43:36,301 >> Configuration saved in saves/LLaMA3-8B-Chat/full/train_2024-07-16-15-59-42_llama3_2/checkpoint-190/config.json
+[INFO|configuration_utils.py:769] 2024-07-16 16:43:36,302 >> Configuration saved in saves/LLaMA3-8B-Chat/full/train_2024-07-16-15-59-42_llama3_2/checkpoint-190/generation_config.json
+[INFO|modeling_utils.py:2698] 2024-07-16 16:43:52,783 >> The model is bigger than the maximum size per checkpoint (5GB) and is going to be split in 4 checkpoint shards. You can find where each parameters has been saved in the index located at saves/LLaMA3-8B-Chat/full/train_2024-07-16-15-59-42_llama3_2/checkpoint-190/model.safetensors.index.json.
+[INFO|tokenization_utils_base.py:2574] 2024-07-16 16:43:52,786 >> tokenizer config file saved in saves/LLaMA3-8B-Chat/full/train_2024-07-16-15-59-42_llama3_2/checkpoint-190/tokenizer_config.json
+[INFO|tokenization_utils_base.py:2583] 2024-07-16 16:43:52,787 >> Special tokens file saved in saves/LLaMA3-8B-Chat/full/train_2024-07-16-15-59-42_llama3_2/checkpoint-190/special_tokens_map.json
+[INFO|trainer.py:2383] 2024-07-16 16:44:29,948 >>
+Training completed. Do not forget to share your model on huggingface.co/models =)
+[INFO|trainer.py:3478] 2024-07-16 16:44:37,828 >> Saving model checkpoint to saves/LLaMA3-8B-Chat/full/train_2024-07-16-15-59-42_llama3_2
+[INFO|configuration_utils.py:472] 2024-07-16 16:44:37,830 >> Configuration saved in saves/LLaMA3-8B-Chat/full/train_2024-07-16-15-59-42_llama3_2/config.json
+[INFO|configuration_utils.py:769] 2024-07-16 16:44:37,831 >> Configuration saved in saves/LLaMA3-8B-Chat/full/train_2024-07-16-15-59-42_llama3_2/generation_config.json
+[INFO|modeling_utils.py:2698] 2024-07-16 16:44:54,696 >> The model is bigger than the maximum size per checkpoint (5GB) and is going to be split in 4 checkpoint shards. You can find where each parameters has been saved in the index located at saves/LLaMA3-8B-Chat/full/train_2024-07-16-15-59-42_llama3_2/model.safetensors.index.json.
+[INFO|tokenization_utils_base.py:2574] 2024-07-16 16:44:54,699 >> tokenizer config file saved in saves/LLaMA3-8B-Chat/full/train_2024-07-16-15-59-42_llama3_2/tokenizer_config.json
+[INFO|tokenization_utils_base.py:2583] 2024-07-16 16:44:54,699 >> Special tokens file saved in saves/LLaMA3-8B-Chat/full/train_2024-07-16-15-59-42_llama3_2/special_tokens_map.json
+[WARNING|ploting.py:89] 2024-07-16 16:44:56,064 >> No metric eval_loss to plot.
+[WARNING|ploting.py:89] 2024-07-16 16:44:56,065 >> No metric eval_accuracy to plot.
+[INFO|modelcard.py:449] 2024-07-16 16:44:56,065 >> Dropping the following result as it does not have all the necessary fields:
+{'task': {'name': 'Causal Language Modeling', 'type': 'text-generation'}}

special_tokens_map.json ADDED Viewed

	@@ -0,0 +1,17 @@

+{
+  "bos_token": {
+    "content": "<|begin_of_text|>",
+    "lstrip": false,
+    "normalized": false,
+    "rstrip": false,
+    "single_word": false
+  },
+  "eos_token": {
+    "content": "<|eot_id|>",
+    "lstrip": false,
+    "normalized": false,
+    "rstrip": false,
+    "single_word": false
+  },
+  "pad_token": "<|eot_id|>"
+}

tokenizer.json ADDED Viewed

The diff for this file is too large to render. See raw diff

tokenizer_config.json ADDED Viewed

	@@ -0,0 +1,2065 @@

+{
+  "added_tokens_decoder": {
+    "128000": {
+      "content": "<|begin_of_text|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128001": {
+      "content": "<|end_of_text|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128002": {
+      "content": "<|reserved_special_token_0|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128003": {
+      "content": "<|reserved_special_token_1|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128004": {
+      "content": "<|reserved_special_token_2|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128005": {
+      "content": "<|reserved_special_token_3|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128006": {
+      "content": "<|start_header_id|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128007": {
+      "content": "<|end_header_id|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128008": {
+      "content": "<|reserved_special_token_4|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128009": {
+      "content": "<|eot_id|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128010": {
+      "content": "<|reserved_special_token_5|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128011": {
+      "content": "<|reserved_special_token_6|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128012": {
+      "content": "<|reserved_special_token_7|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128013": {
+      "content": "<|reserved_special_token_8|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128014": {
+      "content": "<|reserved_special_token_9|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128015": {
+      "content": "<|reserved_special_token_10|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128016": {
+      "content": "<|reserved_special_token_11|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128017": {
+      "content": "<|reserved_special_token_12|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128018": {
+      "content": "<|reserved_special_token_13|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128019": {
+      "content": "<|reserved_special_token_14|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128020": {
+      "content": "<|reserved_special_token_15|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128021": {
+      "content": "<|reserved_special_token_16|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128022": {
+      "content": "<|reserved_special_token_17|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128023": {
+      "content": "<|reserved_special_token_18|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128024": {
+      "content": "<|reserved_special_token_19|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128025": {
+      "content": "<|reserved_special_token_20|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128026": {
+      "content": "<|reserved_special_token_21|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128027": {
+      "content": "<|reserved_special_token_22|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128028": {
+      "content": "<|reserved_special_token_23|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128029": {
+      "content": "<|reserved_special_token_24|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128030": {
+      "content": "<|reserved_special_token_25|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128031": {
+      "content": "<|reserved_special_token_26|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128032": {
+      "content": "<|reserved_special_token_27|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128033": {
+      "content": "<|reserved_special_token_28|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128034": {
+      "content": "<|reserved_special_token_29|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128035": {
+      "content": "<|reserved_special_token_30|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128036": {
+      "content": "<|reserved_special_token_31|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128037": {
+      "content": "<|reserved_special_token_32|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128038": {
+      "content": "<|reserved_special_token_33|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128039": {
+      "content": "<|reserved_special_token_34|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128040": {
+      "content": "<|reserved_special_token_35|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128041": {
+      "content": "<|reserved_special_token_36|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128042": {
+      "content": "<|reserved_special_token_37|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128043": {
+      "content": "<|reserved_special_token_38|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128044": {
+      "content": "<|reserved_special_token_39|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128045": {
+      "content": "<|reserved_special_token_40|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128046": {
+      "content": "<|reserved_special_token_41|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128047": {
+      "content": "<|reserved_special_token_42|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128048": {
+      "content": "<|reserved_special_token_43|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128049": {
+      "content": "<|reserved_special_token_44|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128050": {
+      "content": "<|reserved_special_token_45|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128051": {
+      "content": "<|reserved_special_token_46|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128052": {
+      "content": "<|reserved_special_token_47|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128053": {
+      "content": "<|reserved_special_token_48|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128054": {
+      "content": "<|reserved_special_token_49|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128055": {
+      "content": "<|reserved_special_token_50|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128056": {
+      "content": "<|reserved_special_token_51|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128057": {
+      "content": "<|reserved_special_token_52|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128058": {
+      "content": "<|reserved_special_token_53|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128059": {
+      "content": "<|reserved_special_token_54|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128060": {
+      "content": "<|reserved_special_token_55|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128061": {
+      "content": "<|reserved_special_token_56|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128062": {
+      "content": "<|reserved_special_token_57|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128063": {
+      "content": "<|reserved_special_token_58|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128064": {
+      "content": "<|reserved_special_token_59|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128065": {
+      "content": "<|reserved_special_token_60|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128066": {
+      "content": "<|reserved_special_token_61|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128067": {
+      "content": "<|reserved_special_token_62|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128068": {
+      "content": "<|reserved_special_token_63|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128069": {
+      "content": "<|reserved_special_token_64|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128070": {
+      "content": "<|reserved_special_token_65|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128071": {
+      "content": "<|reserved_special_token_66|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128072": {
+      "content": "<|reserved_special_token_67|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128073": {
+      "content": "<|reserved_special_token_68|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128074": {
+      "content": "<|reserved_special_token_69|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128075": {
+      "content": "<|reserved_special_token_70|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128076": {
+      "content": "<|reserved_special_token_71|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128077": {
+      "content": "<|reserved_special_token_72|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128078": {
+      "content": "<|reserved_special_token_73|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128079": {
+      "content": "<|reserved_special_token_74|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128080": {
+      "content": "<|reserved_special_token_75|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128081": {
+      "content": "<|reserved_special_token_76|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128082": {
+      "content": "<|reserved_special_token_77|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128083": {
+      "content": "<|reserved_special_token_78|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128084": {
+      "content": "<|reserved_special_token_79|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128085": {
+      "content": "<|reserved_special_token_80|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128086": {
+      "content": "<|reserved_special_token_81|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128087": {
+      "content": "<|reserved_special_token_82|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128088": {
+      "content": "<|reserved_special_token_83|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128089": {
+      "content": "<|reserved_special_token_84|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128090": {
+      "content": "<|reserved_special_token_85|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128091": {
+      "content": "<|reserved_special_token_86|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128092": {
+      "content": "<|reserved_special_token_87|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128093": {
+      "content": "<|reserved_special_token_88|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128094": {
+      "content": "<|reserved_special_token_89|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128095": {
+      "content": "<|reserved_special_token_90|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128096": {
+      "content": "<|reserved_special_token_91|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128097": {
+      "content": "<|reserved_special_token_92|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128098": {
+      "content": "<|reserved_special_token_93|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128099": {
+      "content": "<|reserved_special_token_94|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128100": {
+      "content": "<|reserved_special_token_95|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128101": {
+      "content": "<|reserved_special_token_96|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128102": {
+      "content": "<|reserved_special_token_97|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128103": {
+      "content": "<|reserved_special_token_98|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128104": {
+      "content": "<|reserved_special_token_99|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128105": {
+      "content": "<|reserved_special_token_100|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128106": {
+      "content": "<|reserved_special_token_101|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128107": {
+      "content": "<|reserved_special_token_102|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128108": {
+      "content": "<|reserved_special_token_103|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128109": {
+      "content": "<|reserved_special_token_104|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128110": {
+      "content": "<|reserved_special_token_105|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128111": {
+      "content": "<|reserved_special_token_106|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128112": {
+      "content": "<|reserved_special_token_107|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128113": {
+      "content": "<|reserved_special_token_108|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128114": {
+      "content": "<|reserved_special_token_109|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128115": {
+      "content": "<|reserved_special_token_110|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128116": {
+      "content": "<|reserved_special_token_111|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128117": {
+      "content": "<|reserved_special_token_112|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128118": {
+      "content": "<|reserved_special_token_113|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128119": {
+      "content": "<|reserved_special_token_114|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128120": {
+      "content": "<|reserved_special_token_115|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128121": {
+      "content": "<|reserved_special_token_116|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128122": {
+      "content": "<|reserved_special_token_117|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128123": {
+      "content": "<|reserved_special_token_118|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128124": {
+      "content": "<|reserved_special_token_119|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128125": {
+      "content": "<|reserved_special_token_120|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128126": {
+      "content": "<|reserved_special_token_121|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128127": {
+      "content": "<|reserved_special_token_122|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128128": {
+      "content": "<|reserved_special_token_123|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128129": {
+      "content": "<|reserved_special_token_124|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128130": {
+      "content": "<|reserved_special_token_125|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128131": {
+      "content": "<|reserved_special_token_126|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128132": {
+      "content": "<|reserved_special_token_127|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128133": {
+      "content": "<|reserved_special_token_128|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128134": {
+      "content": "<|reserved_special_token_129|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128135": {
+      "content": "<|reserved_special_token_130|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128136": {
+      "content": "<|reserved_special_token_131|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128137": {
+      "content": "<|reserved_special_token_132|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128138": {
+      "content": "<|reserved_special_token_133|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128139": {
+      "content": "<|reserved_special_token_134|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128140": {
+      "content": "<|reserved_special_token_135|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128141": {
+      "content": "<|reserved_special_token_136|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128142": {
+      "content": "<|reserved_special_token_137|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128143": {
+      "content": "<|reserved_special_token_138|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128144": {
+      "content": "<|reserved_special_token_139|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128145": {
+      "content": "<|reserved_special_token_140|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128146": {
+      "content": "<|reserved_special_token_141|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128147": {
+      "content": "<|reserved_special_token_142|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128148": {
+      "content": "<|reserved_special_token_143|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128149": {
+      "content": "<|reserved_special_token_144|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128150": {
+      "content": "<|reserved_special_token_145|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128151": {
+      "content": "<|reserved_special_token_146|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128152": {
+      "content": "<|reserved_special_token_147|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128153": {
+      "content": "<|reserved_special_token_148|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128154": {
+      "content": "<|reserved_special_token_149|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128155": {
+      "content": "<|reserved_special_token_150|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128156": {
+      "content": "<|reserved_special_token_151|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128157": {
+      "content": "<|reserved_special_token_152|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128158": {
+      "content": "<|reserved_special_token_153|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128159": {
+      "content": "<|reserved_special_token_154|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128160": {
+      "content": "<|reserved_special_token_155|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128161": {
+      "content": "<|reserved_special_token_156|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128162": {
+      "content": "<|reserved_special_token_157|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128163": {
+      "content": "<|reserved_special_token_158|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128164": {
+      "content": "<|reserved_special_token_159|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128165": {
+      "content": "<|reserved_special_token_160|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128166": {
+      "content": "<|reserved_special_token_161|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128167": {
+      "content": "<|reserved_special_token_162|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128168": {
+      "content": "<|reserved_special_token_163|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128169": {
+      "content": "<|reserved_special_token_164|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128170": {
+      "content": "<|reserved_special_token_165|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128171": {
+      "content": "<|reserved_special_token_166|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128172": {
+      "content": "<|reserved_special_token_167|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128173": {
+      "content": "<|reserved_special_token_168|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128174": {
+      "content": "<|reserved_special_token_169|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128175": {
+      "content": "<|reserved_special_token_170|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128176": {
+      "content": "<|reserved_special_token_171|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128177": {
+      "content": "<|reserved_special_token_172|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128178": {
+      "content": "<|reserved_special_token_173|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128179": {
+      "content": "<|reserved_special_token_174|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128180": {
+      "content": "<|reserved_special_token_175|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128181": {
+      "content": "<|reserved_special_token_176|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128182": {
+      "content": "<|reserved_special_token_177|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128183": {
+      "content": "<|reserved_special_token_178|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128184": {
+      "content": "<|reserved_special_token_179|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128185": {
+      "content": "<|reserved_special_token_180|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128186": {
+      "content": "<|reserved_special_token_181|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128187": {
+      "content": "<|reserved_special_token_182|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128188": {
+      "content": "<|reserved_special_token_183|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128189": {
+      "content": "<|reserved_special_token_184|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128190": {
+      "content": "<|reserved_special_token_185|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128191": {
+      "content": "<|reserved_special_token_186|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128192": {
+      "content": "<|reserved_special_token_187|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128193": {
+      "content": "<|reserved_special_token_188|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128194": {
+      "content": "<|reserved_special_token_189|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128195": {
+      "content": "<|reserved_special_token_190|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128196": {
+      "content": "<|reserved_special_token_191|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128197": {
+      "content": "<|reserved_special_token_192|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128198": {
+      "content": "<|reserved_special_token_193|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128199": {
+      "content": "<|reserved_special_token_194|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128200": {
+      "content": "<|reserved_special_token_195|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128201": {
+      "content": "<|reserved_special_token_196|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128202": {
+      "content": "<|reserved_special_token_197|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128203": {
+      "content": "<|reserved_special_token_198|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128204": {
+      "content": "<|reserved_special_token_199|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128205": {
+      "content": "<|reserved_special_token_200|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128206": {
+      "content": "<|reserved_special_token_201|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128207": {
+      "content": "<|reserved_special_token_202|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128208": {
+      "content": "<|reserved_special_token_203|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128209": {
+      "content": "<|reserved_special_token_204|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128210": {
+      "content": "<|reserved_special_token_205|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128211": {
+      "content": "<|reserved_special_token_206|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128212": {
+      "content": "<|reserved_special_token_207|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128213": {
+      "content": "<|reserved_special_token_208|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128214": {
+      "content": "<|reserved_special_token_209|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128215": {
+      "content": "<|reserved_special_token_210|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128216": {
+      "content": "<|reserved_special_token_211|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128217": {
+      "content": "<|reserved_special_token_212|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128218": {
+      "content": "<|reserved_special_token_213|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128219": {
+      "content": "<|reserved_special_token_214|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128220": {
+      "content": "<|reserved_special_token_215|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128221": {
+      "content": "<|reserved_special_token_216|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128222": {
+      "content": "<|reserved_special_token_217|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128223": {
+      "content": "<|reserved_special_token_218|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128224": {
+      "content": "<|reserved_special_token_219|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128225": {
+      "content": "<|reserved_special_token_220|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128226": {
+      "content": "<|reserved_special_token_221|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128227": {
+      "content": "<|reserved_special_token_222|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128228": {
+      "content": "<|reserved_special_token_223|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128229": {
+      "content": "<|reserved_special_token_224|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128230": {
+      "content": "<|reserved_special_token_225|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128231": {
+      "content": "<|reserved_special_token_226|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128232": {
+      "content": "<|reserved_special_token_227|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128233": {
+      "content": "<|reserved_special_token_228|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128234": {
+      "content": "<|reserved_special_token_229|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128235": {
+      "content": "<|reserved_special_token_230|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128236": {
+      "content": "<|reserved_special_token_231|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128237": {
+      "content": "<|reserved_special_token_232|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128238": {
+      "content": "<|reserved_special_token_233|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128239": {
+      "content": "<|reserved_special_token_234|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128240": {
+      "content": "<|reserved_special_token_235|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128241": {
+      "content": "<|reserved_special_token_236|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128242": {
+      "content": "<|reserved_special_token_237|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128243": {
+      "content": "<|reserved_special_token_238|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128244": {
+      "content": "<|reserved_special_token_239|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128245": {
+      "content": "<|reserved_special_token_240|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128246": {
+      "content": "<|reserved_special_token_241|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128247": {
+      "content": "<|reserved_special_token_242|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128248": {
+      "content": "<|reserved_special_token_243|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128249": {
+      "content": "<|reserved_special_token_244|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128250": {
+      "content": "<|reserved_special_token_245|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128251": {
+      "content": "<|reserved_special_token_246|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128252": {
+      "content": "<|reserved_special_token_247|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128253": {
+      "content": "<|reserved_special_token_248|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128254": {
+      "content": "<|reserved_special_token_249|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "128255": {
+      "content": "<|reserved_special_token_250|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    }
+  },
+  "bos_token": "<|begin_of_text|>",
+  "chat_template": "{{ '<|begin_of_text|>' }}{% if messages[0]['role'] == 'system' %}{% set system_message = messages[0]['content'] %}{% endif %}{% if system_message is defined %}{{ '<|start_header_id|>system<|end_header_id|>\n\n' + system_message + '<|eot_id|>' }}{% endif %}{% for message in messages %}{% set content = message['content'] %}{% if message['role'] == 'user' %}{{ '<|start_header_id|>user<|end_header_id|>\n\n' + content + '<|eot_id|><|start_header_id|>assistant<|end_header_id|>\n\n' }}{% elif message['role'] == 'assistant' %}{{ content + '<|eot_id|>' }}{% endif %}{% endfor %}",
+  "clean_up_tokenization_spaces": true,
+  "eos_token": "<|eot_id|>",
+  "model_input_names": [
+    "input_ids",
+    "attention_mask"
+  ],
+  "model_max_length": 1000000000000000019884624838656,
+  "pad_token": "<|eot_id|>",
+  "padding_side": "right",
+  "split_special_tokens": false,
+  "tokenizer_class": "PreTrainedTokenizerFast"
+}

train_results.json ADDED Viewed

	@@ -0,0 +1,9 @@

+{
+    "epoch": 4.903225806451613,
+    "num_input_tokens_seen": 1207760,
+    "total_flos": 5.438488809413018e+16,
+    "train_loss": 0.49016160156086125,
+    "train_runtime": 2575.226,
+    "train_samples_per_second": 9.626,
+    "train_steps_per_second": 0.074
+}

trainer_log.jsonl ADDED Viewed

	@@ -0,0 +1,191 @@

+{"current_steps": 1, "total_steps": 190, "loss": 13.7821, "learning_rate": 5.000000000000001e-07, "epoch": 0.025806451612903226, "percentage": 0.53, "elapsed_time": "0:00:24", "remaining_time": "1:17:28", "throughput": "260.88", "total_tokens": 6416}
+{"current_steps": 2, "total_steps": 190, "loss": 13.6363, "learning_rate": 1.0000000000000002e-06, "epoch": 0.05161290322580645, "percentage": 1.05, "elapsed_time": "0:00:37", "remaining_time": "0:59:09", "throughput": "344.08", "total_tokens": 12992}
+{"current_steps": 3, "total_steps": 190, "loss": 13.6033, "learning_rate": 1.5e-06, "epoch": 0.07741935483870968, "percentage": 1.58, "elapsed_time": "0:00:50", "remaining_time": "0:52:55", "throughput": "382.21", "total_tokens": 19472}
+{"current_steps": 4, "total_steps": 190, "loss": 12.5696, "learning_rate": 2.0000000000000003e-06, "epoch": 0.1032258064516129, "percentage": 2.11, "elapsed_time": "0:01:04", "remaining_time": "0:49:41", "throughput": "404.48", "total_tokens": 25936}
+{"current_steps": 5, "total_steps": 190, "loss": 9.3589, "learning_rate": 2.5e-06, "epoch": 0.12903225806451613, "percentage": 2.63, "elapsed_time": "0:01:17", "remaining_time": "0:47:40", "throughput": "417.45", "total_tokens": 32272}
+{"current_steps": 6, "total_steps": 190, "loss": 6.7715, "learning_rate": 3e-06, "epoch": 0.15483870967741936, "percentage": 3.16, "elapsed_time": "0:01:30", "remaining_time": "0:46:14", "throughput": "427.06", "total_tokens": 38640}
+{"current_steps": 7, "total_steps": 190, "loss": 5.3541, "learning_rate": 3.5e-06, "epoch": 0.18064516129032257, "percentage": 3.68, "elapsed_time": "0:01:43", "remaining_time": "0:45:09", "throughput": "434.07", "total_tokens": 44992}
+{"current_steps": 8, "total_steps": 190, "loss": 1.9295, "learning_rate": 4.000000000000001e-06, "epoch": 0.2064516129032258, "percentage": 4.21, "elapsed_time": "0:01:56", "remaining_time": "0:44:18", "throughput": "439.30", "total_tokens": 51328}
+{"current_steps": 9, "total_steps": 190, "loss": 0.6328, "learning_rate": 4.5e-06, "epoch": 0.23225806451612904, "percentage": 4.74, "elapsed_time": "0:02:10", "remaining_time": "0:43:35", "throughput": "441.47", "total_tokens": 57408}
+{"current_steps": 10, "total_steps": 190, "loss": 3.3225, "learning_rate": 5e-06, "epoch": 0.25806451612903225, "percentage": 5.26, "elapsed_time": "0:02:23", "remaining_time": "0:42:57", "throughput": "444.77", "total_tokens": 63696}
+{"current_steps": 11, "total_steps": 190, "loss": 0.2598, "learning_rate": 4.9996192378909785e-06, "epoch": 0.2838709677419355, "percentage": 5.79, "elapsed_time": "0:02:36", "remaining_time": "0:42:25", "throughput": "447.47", "total_tokens": 69984}
+{"current_steps": 12, "total_steps": 190, "loss": 0.6874, "learning_rate": 4.99847706754774e-06, "epoch": 0.3096774193548387, "percentage": 6.32, "elapsed_time": "0:02:49", "remaining_time": "0:41:55", "throughput": "450.46", "total_tokens": 76384}
+{"current_steps": 13, "total_steps": 190, "loss": 2.0329, "learning_rate": 4.9965738368864345e-06, "epoch": 0.33548387096774196, "percentage": 6.84, "elapsed_time": "0:03:02", "remaining_time": "0:41:28", "throughput": "452.54", "total_tokens": 82704}
+{"current_steps": 14, "total_steps": 190, "loss": 0.4942, "learning_rate": 4.993910125649561e-06, "epoch": 0.36129032258064514, "percentage": 7.37, "elapsed_time": "0:03:15", "remaining_time": "0:41:02", "throughput": "454.14", "total_tokens": 88976}
+{"current_steps": 15, "total_steps": 190, "loss": 1.1786, "learning_rate": 4.990486745229364e-06, "epoch": 0.3870967741935484, "percentage": 7.89, "elapsed_time": "0:03:29", "remaining_time": "0:40:39", "throughput": "456.59", "total_tokens": 95472}
+{"current_steps": 16, "total_steps": 190, "loss": 0.4424, "learning_rate": 4.986304738420684e-06, "epoch": 0.4129032258064516, "percentage": 8.42, "elapsed_time": "0:03:42", "remaining_time": "0:40:17", "throughput": "458.45", "total_tokens": 101904}
+{"current_steps": 17, "total_steps": 190, "loss": 0.3336, "learning_rate": 4.981365379103306e-06, "epoch": 0.43870967741935485, "percentage": 8.95, "elapsed_time": "0:03:55", "remaining_time": "0:39:56", "throughput": "459.83", "total_tokens": 108272}
+{"current_steps": 18, "total_steps": 190, "loss": 0.2568, "learning_rate": 4.975670171853926e-06, "epoch": 0.4645161290322581, "percentage": 9.47, "elapsed_time": "0:04:08", "remaining_time": "0:39:35", "throughput": "460.35", "total_tokens": 114464}
+{"current_steps": 19, "total_steps": 190, "loss": 0.1889, "learning_rate": 4.9692208514878445e-06, "epoch": 0.49032258064516127, "percentage": 10.0, "elapsed_time": "0:04:21", "remaining_time": "0:39:16", "throughput": "461.44", "total_tokens": 120816}
+{"current_steps": 20, "total_steps": 190, "loss": 0.1974, "learning_rate": 4.962019382530521e-06, "epoch": 0.5161290322580645, "percentage": 10.53, "elapsed_time": "0:04:34", "remaining_time": "0:38:57", "throughput": "462.27", "total_tokens": 127120}
+{"current_steps": 21, "total_steps": 190, "loss": 0.1766, "learning_rate": 4.9540679586191605e-06, "epoch": 0.5419354838709678, "percentage": 11.05, "elapsed_time": "0:04:48", "remaining_time": "0:38:39", "throughput": "463.99", "total_tokens": 133712}
+{"current_steps": 22, "total_steps": 190, "loss": 0.1694, "learning_rate": 4.9453690018345144e-06, "epoch": 0.567741935483871, "percentage": 11.58, "elapsed_time": "0:05:01", "remaining_time": "0:38:21", "throughput": "464.28", "total_tokens": 139904}
+{"current_steps": 23, "total_steps": 190, "loss": 0.1374, "learning_rate": 4.935925161963089e-06, "epoch": 0.5935483870967742, "percentage": 12.11, "elapsed_time": "0:05:14", "remaining_time": "0:38:03", "throughput": "465.03", "total_tokens": 146256}
+{"current_steps": 24, "total_steps": 190, "loss": 0.1496, "learning_rate": 4.925739315689991e-06, "epoch": 0.6193548387096774, "percentage": 12.63, "elapsed_time": "0:05:27", "remaining_time": "0:37:46", "throughput": "466.25", "total_tokens": 152784}
+{"current_steps": 25, "total_steps": 190, "loss": 0.1554, "learning_rate": 4.914814565722671e-06, "epoch": 0.6451612903225806, "percentage": 13.16, "elapsed_time": "0:05:40", "remaining_time": "0:37:29", "throughput": "466.38", "total_tokens": 158976}
+{"current_steps": 26, "total_steps": 190, "loss": 0.0918, "learning_rate": 4.903154239845798e-06, "epoch": 0.6709677419354839, "percentage": 13.68, "elapsed_time": "0:05:54", "remaining_time": "0:37:13", "throughput": "466.86", "total_tokens": 165280}
+{"current_steps": 27, "total_steps": 190, "loss": 0.1062, "learning_rate": 4.890761889907589e-06, "epoch": 0.6967741935483871, "percentage": 14.21, "elapsed_time": "0:06:07", "remaining_time": "0:36:56", "throughput": "467.90", "total_tokens": 171808}
+{"current_steps": 28, "total_steps": 190, "loss": 0.1975, "learning_rate": 4.8776412907378845e-06, "epoch": 0.7225806451612903, "percentage": 14.74, "elapsed_time": "0:06:20", "remaining_time": "0:36:40", "throughput": "468.27", "total_tokens": 178112}
+{"current_steps": 29, "total_steps": 190, "loss": 0.1389, "learning_rate": 4.863796438998293e-06, "epoch": 0.7483870967741936, "percentage": 15.26, "elapsed_time": "0:06:33", "remaining_time": "0:36:24", "throughput": "468.71", "total_tokens": 184448}
+{"current_steps": 30, "total_steps": 190, "loss": 0.1382, "learning_rate": 4.849231551964771e-06, "epoch": 0.7741935483870968, "percentage": 15.79, "elapsed_time": "0:06:46", "remaining_time": "0:36:09", "throughput": "469.38", "total_tokens": 190896}
+{"current_steps": 31, "total_steps": 190, "loss": 0.1982, "learning_rate": 4.833951066243004e-06, "epoch": 0.8, "percentage": 16.32, "elapsed_time": "0:06:59", "remaining_time": "0:35:53", "throughput": "469.24", "total_tokens": 197024}
+{"current_steps": 32, "total_steps": 190, "loss": 0.1072, "learning_rate": 4.817959636416969e-06, "epoch": 0.8258064516129032, "percentage": 16.84, "elapsed_time": "0:07:13", "remaining_time": "0:35:38", "throughput": "469.35", "total_tokens": 203248}
+{"current_steps": 33, "total_steps": 190, "loss": 0.0757, "learning_rate": 4.801262133631101e-06, "epoch": 0.8516129032258064, "percentage": 17.37, "elapsed_time": "0:07:26", "remaining_time": "0:35:22", "throughput": "470.10", "total_tokens": 209760}
+{"current_steps": 34, "total_steps": 190, "loss": 0.0829, "learning_rate": 4.783863644106502e-06, "epoch": 0.8774193548387097, "percentage": 17.89, "elapsed_time": "0:07:39", "remaining_time": "0:35:07", "throughput": "470.13", "total_tokens": 215968}
+{"current_steps": 35, "total_steps": 190, "loss": 0.1017, "learning_rate": 4.765769467591626e-06, "epoch": 0.9032258064516129, "percentage": 18.42, "elapsed_time": "0:07:52", "remaining_time": "0:34:52", "throughput": "470.20", "total_tokens": 222192}
+{"current_steps": 36, "total_steps": 190, "loss": 0.0957, "learning_rate": 4.746985115747918e-06, "epoch": 0.9290322580645162, "percentage": 18.95, "elapsed_time": "0:08:05", "remaining_time": "0:34:37", "throughput": "470.47", "total_tokens": 228512}
+{"current_steps": 37, "total_steps": 190, "loss": 0.0999, "learning_rate": 4.72751631047092e-06, "epoch": 0.9548387096774194, "percentage": 19.47, "elapsed_time": "0:08:18", "remaining_time": "0:34:22", "throughput": "471.30", "total_tokens": 235120}
+{"current_steps": 38, "total_steps": 190, "loss": 0.0581, "learning_rate": 4.707368982147318e-06, "epoch": 0.9806451612903225, "percentage": 20.0, "elapsed_time": "0:08:32", "remaining_time": "0:34:08", "throughput": "471.80", "total_tokens": 241584}
+{"current_steps": 39, "total_steps": 190, "loss": 0.0923, "learning_rate": 4.68654926784849e-06, "epoch": 1.0064516129032257, "percentage": 20.53, "elapsed_time": "0:08:45", "remaining_time": "0:33:53", "throughput": "472.34", "total_tokens": 248080}
+{"current_steps": 40, "total_steps": 190, "loss": 0.0506, "learning_rate": 4.665063509461098e-06, "epoch": 1.032258064516129, "percentage": 21.05, "elapsed_time": "0:08:58", "remaining_time": "0:33:38", "throughput": "472.58", "total_tokens": 254416}
+{"current_steps": 41, "total_steps": 190, "loss": 0.0333, "learning_rate": 4.642918251755281e-06, "epoch": 1.0580645161290323, "percentage": 21.58, "elapsed_time": "0:09:11", "remaining_time": "0:33:24", "throughput": "472.58", "total_tokens": 260640}
+{"current_steps": 42, "total_steps": 190, "loss": 0.038, "learning_rate": 4.620120240391065e-06, "epoch": 1.0838709677419356, "percentage": 22.11, "elapsed_time": "0:09:24", "remaining_time": "0:33:09", "throughput": "472.96", "total_tokens": 267072}
+{"current_steps": 43, "total_steps": 190, "loss": 0.0416, "learning_rate": 4.596676419863561e-06, "epoch": 1.1096774193548387, "percentage": 22.63, "elapsed_time": "0:09:37", "remaining_time": "0:32:55", "throughput": "473.13", "total_tokens": 273392}
+{"current_steps": 44, "total_steps": 190, "loss": 0.1068, "learning_rate": 4.572593931387604e-06, "epoch": 1.135483870967742, "percentage": 23.16, "elapsed_time": "0:09:51", "remaining_time": "0:32:41", "throughput": "473.22", "total_tokens": 279680}
+{"current_steps": 45, "total_steps": 190, "loss": 0.0369, "learning_rate": 4.54788011072248e-06, "epoch": 1.1612903225806452, "percentage": 23.68, "elapsed_time": "0:10:04", "remaining_time": "0:32:26", "throughput": "473.32", "total_tokens": 285968}
+{"current_steps": 46, "total_steps": 190, "loss": 0.1703, "learning_rate": 4.522542485937369e-06, "epoch": 1.1870967741935483, "percentage": 24.21, "elapsed_time": "0:10:17", "remaining_time": "0:32:12", "throughput": "473.49", "total_tokens": 292304}
+{"current_steps": 47, "total_steps": 190, "loss": 0.1102, "learning_rate": 4.496588775118232e-06, "epoch": 1.2129032258064516, "percentage": 24.74, "elapsed_time": "0:10:30", "remaining_time": "0:31:58", "throughput": "473.60", "total_tokens": 298608}
+{"current_steps": 48, "total_steps": 190, "loss": 0.0595, "learning_rate": 4.470026884016805e-06, "epoch": 1.238709677419355, "percentage": 25.26, "elapsed_time": "0:10:43", "remaining_time": "0:31:44", "throughput": "473.71", "total_tokens": 304912}
+{"current_steps": 49, "total_steps": 190, "loss": 0.1009, "learning_rate": 4.442864903642428e-06, "epoch": 1.2645161290322582, "percentage": 25.79, "elapsed_time": "0:10:56", "remaining_time": "0:31:30", "throughput": "473.98", "total_tokens": 311328}
+{"current_steps": 50, "total_steps": 190, "loss": 0.0434, "learning_rate": 4.415111107797445e-06, "epoch": 1.2903225806451613, "percentage": 26.32, "elapsed_time": "0:11:10", "remaining_time": "0:31:16", "throughput": "474.12", "total_tokens": 317664}
+{"current_steps": 51, "total_steps": 190, "loss": 0.0281, "learning_rate": 4.386773950556931e-06, "epoch": 1.3161290322580645, "percentage": 26.84, "elapsed_time": "0:11:23", "remaining_time": "0:31:01", "throughput": "474.46", "total_tokens": 324128}
+{"current_steps": 52, "total_steps": 190, "loss": 0.0513, "learning_rate": 4.357862063693486e-06, "epoch": 1.3419354838709676, "percentage": 27.37, "elapsed_time": "0:11:36", "remaining_time": "0:30:47", "throughput": "474.35", "total_tokens": 330304}
+{"current_steps": 53, "total_steps": 190, "loss": 0.0902, "learning_rate": 4.328384254047927e-06, "epoch": 1.367741935483871, "percentage": 27.89, "elapsed_time": "0:11:49", "remaining_time": "0:30:34", "throughput": "474.43", "total_tokens": 336608}
+{"current_steps": 54, "total_steps": 190, "loss": 0.0448, "learning_rate": 4.2983495008466285e-06, "epoch": 1.3935483870967742, "percentage": 28.42, "elapsed_time": "0:12:02", "remaining_time": "0:30:20", "throughput": "474.55", "total_tokens": 342944}
+{"current_steps": 55, "total_steps": 190, "loss": 0.036, "learning_rate": 4.267766952966369e-06, "epoch": 1.4193548387096775, "percentage": 28.95, "elapsed_time": "0:12:15", "remaining_time": "0:30:06", "throughput": "474.98", "total_tokens": 349504}
+{"current_steps": 56, "total_steps": 190, "loss": 0.0279, "learning_rate": 4.236645926147493e-06, "epoch": 1.4451612903225808, "percentage": 29.47, "elapsed_time": "0:12:29", "remaining_time": "0:29:52", "throughput": "475.04", "total_tokens": 355808}
+{"current_steps": 57, "total_steps": 190, "loss": 0.0527, "learning_rate": 4.204995900156247e-06, "epoch": 1.4709677419354839, "percentage": 30.0, "elapsed_time": "0:12:42", "remaining_time": "0:29:38", "throughput": "475.14", "total_tokens": 362144}
+{"current_steps": 58, "total_steps": 190, "loss": 0.0466, "learning_rate": 4.172826515897146e-06, "epoch": 1.4967741935483871, "percentage": 30.53, "elapsed_time": "0:12:55", "remaining_time": "0:29:24", "throughput": "475.66", "total_tokens": 368800}
+{"current_steps": 59, "total_steps": 190, "loss": 0.0203, "learning_rate": 4.140147572476269e-06, "epoch": 1.5225806451612902, "percentage": 31.05, "elapsed_time": "0:13:08", "remaining_time": "0:29:10", "throughput": "475.90", "total_tokens": 375264}
+{"current_steps": 60, "total_steps": 190, "loss": 0.0693, "learning_rate": 4.106969024216348e-06, "epoch": 1.5483870967741935, "percentage": 31.58, "elapsed_time": "0:13:21", "remaining_time": "0:28:57", "throughput": "475.74", "total_tokens": 381408}
+{"current_steps": 61, "total_steps": 190, "loss": 0.0193, "learning_rate": 4.073300977624594e-06, "epoch": 1.5741935483870968, "percentage": 32.11, "elapsed_time": "0:13:34", "remaining_time": "0:28:43", "throughput": "475.58", "total_tokens": 387552}
+{"current_steps": 62, "total_steps": 190, "loss": 0.1155, "learning_rate": 4.039153688314146e-06, "epoch": 1.6, "percentage": 32.63, "elapsed_time": "0:13:48", "remaining_time": "0:28:29", "throughput": "475.95", "total_tokens": 394128}
+{"current_steps": 63, "total_steps": 190, "loss": 0.0594, "learning_rate": 4.0045375578801216e-06, "epoch": 1.6258064516129034, "percentage": 33.16, "elapsed_time": "0:14:01", "remaining_time": "0:28:15", "throughput": "476.06", "total_tokens": 400512}
+{"current_steps": 64, "total_steps": 190, "loss": 0.0391, "learning_rate": 3.969463130731183e-06, "epoch": 1.6516129032258065, "percentage": 33.68, "elapsed_time": "0:14:14", "remaining_time": "0:28:02", "throughput": "476.02", "total_tokens": 406752}
+{"current_steps": 65, "total_steps": 190, "loss": 0.0552, "learning_rate": 3.933941090877615e-06, "epoch": 1.6774193548387095, "percentage": 34.21, "elapsed_time": "0:14:27", "remaining_time": "0:27:48", "throughput": "476.02", "total_tokens": 413040}
+{"current_steps": 66, "total_steps": 190, "loss": 0.03, "learning_rate": 3.897982258676867e-06, "epoch": 1.7032258064516128, "percentage": 34.74, "elapsed_time": "0:14:40", "remaining_time": "0:27:35", "throughput": "476.12", "total_tokens": 419408}
+{"current_steps": 67, "total_steps": 190, "loss": 0.0458, "learning_rate": 3.861597587537568e-06, "epoch": 1.729032258064516, "percentage": 35.26, "elapsed_time": "0:14:54", "remaining_time": "0:27:21", "throughput": "476.36", "total_tokens": 425920}
+{"current_steps": 68, "total_steps": 190, "loss": 0.0502, "learning_rate": 3.824798160583012e-06, "epoch": 1.7548387096774194, "percentage": 35.79, "elapsed_time": "0:15:07", "remaining_time": "0:27:07", "throughput": "476.58", "total_tokens": 432400}
+{"current_steps": 69, "total_steps": 190, "loss": 0.0513, "learning_rate": 3.787595187275136e-06, "epoch": 1.7806451612903227, "percentage": 36.32, "elapsed_time": "0:15:20", "remaining_time": "0:26:54", "throughput": "476.59", "total_tokens": 438688}
+{"current_steps": 70, "total_steps": 190, "loss": 0.0309, "learning_rate": 3.7500000000000005e-06, "epoch": 1.8064516129032258, "percentage": 36.84, "elapsed_time": "0:15:33", "remaining_time": "0:26:40", "throughput": "476.93", "total_tokens": 445280}
+{"current_steps": 71, "total_steps": 190, "loss": 0.0889, "learning_rate": 3.7120240506158433e-06, "epoch": 1.832258064516129, "percentage": 37.37, "elapsed_time": "0:15:46", "remaining_time": "0:26:26", "throughput": "476.99", "total_tokens": 451616}
+{"current_steps": 72, "total_steps": 190, "loss": 0.0868, "learning_rate": 3.6736789069647273e-06, "epoch": 1.8580645161290321, "percentage": 37.89, "elapsed_time": "0:15:59", "remaining_time": "0:26:13", "throughput": "476.95", "total_tokens": 457856}
+{"current_steps": 73, "total_steps": 190, "loss": 0.0516, "learning_rate": 3.634976249348867e-06, "epoch": 1.8838709677419354, "percentage": 38.42, "elapsed_time": "0:16:13", "remaining_time": "0:25:59", "throughput": "476.96", "total_tokens": 464144}
+{"current_steps": 74, "total_steps": 190, "loss": 0.059, "learning_rate": 3.595927866972694e-06, "epoch": 1.9096774193548387, "percentage": 38.95, "elapsed_time": "0:16:26", "remaining_time": "0:25:46", "throughput": "477.28", "total_tokens": 470736}
+{"current_steps": 75, "total_steps": 190, "loss": 0.0475, "learning_rate": 3.556545654351749e-06, "epoch": 1.935483870967742, "percentage": 39.47, "elapsed_time": "0:16:39", "remaining_time": "0:25:32", "throughput": "477.42", "total_tokens": 477168}
+{"current_steps": 76, "total_steps": 190, "loss": 0.0704, "learning_rate": 3.516841607689501e-06, "epoch": 1.9612903225806453, "percentage": 40.0, "elapsed_time": "0:16:52", "remaining_time": "0:25:18", "throughput": "477.51", "total_tokens": 483536}
+{"current_steps": 77, "total_steps": 190, "loss": 0.0666, "learning_rate": 3.476827821223184e-06, "epoch": 1.9870967741935484, "percentage": 40.53, "elapsed_time": "0:17:05", "remaining_time": "0:25:05", "throughput": "477.44", "total_tokens": 489760}
+{"current_steps": 78, "total_steps": 190, "loss": 0.0275, "learning_rate": 3.436516483539781e-06, "epoch": 2.0129032258064514, "percentage": 41.05, "elapsed_time": "0:17:18", "remaining_time": "0:24:51", "throughput": "477.39", "total_tokens": 496000}
+{"current_steps": 79, "total_steps": 190, "loss": 0.0169, "learning_rate": 3.39591987386325e-06, "epoch": 2.0387096774193547, "percentage": 41.58, "elapsed_time": "0:17:32", "remaining_time": "0:24:38", "throughput": "477.49", "total_tokens": 502384}
+{"current_steps": 80, "total_steps": 190, "loss": 0.0056, "learning_rate": 3.3550503583141726e-06, "epoch": 2.064516129032258, "percentage": 42.11, "elapsed_time": "0:17:45", "remaining_time": "0:24:24", "throughput": "477.79", "total_tokens": 508992}
+{"current_steps": 81, "total_steps": 190, "loss": 0.0139, "learning_rate": 3.313920386142892e-06, "epoch": 2.0903225806451613, "percentage": 42.63, "elapsed_time": "0:17:58", "remaining_time": "0:24:11", "throughput": "477.73", "total_tokens": 515216}
+{"current_steps": 82, "total_steps": 190, "loss": 0.0561, "learning_rate": 3.272542485937369e-06, "epoch": 2.1161290322580646, "percentage": 43.16, "elapsed_time": "0:18:11", "remaining_time": "0:23:57", "throughput": "477.99", "total_tokens": 521792}
+{"current_steps": 83, "total_steps": 190, "loss": 0.0098, "learning_rate": 3.230929261806842e-06, "epoch": 2.141935483870968, "percentage": 43.68, "elapsed_time": "0:18:24", "remaining_time": "0:23:44", "throughput": "478.07", "total_tokens": 528176}
+{"current_steps": 84, "total_steps": 190, "loss": 0.0037, "learning_rate": 3.189093389542498e-06, "epoch": 2.167741935483871, "percentage": 44.21, "elapsed_time": "0:18:37", "remaining_time": "0:23:30", "throughput": "478.10", "total_tokens": 534496}
+{"current_steps": 85, "total_steps": 190, "loss": 0.0194, "learning_rate": 3.147047612756302e-06, "epoch": 2.193548387096774, "percentage": 44.74, "elapsed_time": "0:18:51", "remaining_time": "0:23:17", "throughput": "478.31", "total_tokens": 541024}
+{"current_steps": 86, "total_steps": 190, "loss": 0.0004, "learning_rate": 3.1048047389991693e-06, "epoch": 2.2193548387096773, "percentage": 45.26, "elapsed_time": "0:19:04", "remaining_time": "0:23:03", "throughput": "478.31", "total_tokens": 547328}
+{"current_steps": 87, "total_steps": 190, "loss": 0.0003, "learning_rate": 3.062377635859663e-06, "epoch": 2.2451612903225806, "percentage": 45.79, "elapsed_time": "0:19:17", "remaining_time": "0:22:50", "throughput": "478.43", "total_tokens": 553760}
+{"current_steps": 88, "total_steps": 190, "loss": 0.0511, "learning_rate": 3.019779227044398e-06, "epoch": 2.270967741935484, "percentage": 46.32, "elapsed_time": "0:19:30", "remaining_time": "0:22:36", "throughput": "478.42", "total_tokens": 560048}
+{"current_steps": 89, "total_steps": 190, "loss": 0.0974, "learning_rate": 2.9770224884413625e-06, "epoch": 2.296774193548387, "percentage": 46.84, "elapsed_time": "0:19:43", "remaining_time": "0:22:23", "throughput": "478.66", "total_tokens": 566624}
+{"current_steps": 90, "total_steps": 190, "loss": 0.0442, "learning_rate": 2.9341204441673267e-06, "epoch": 2.3225806451612905, "percentage": 47.37, "elapsed_time": "0:19:56", "remaining_time": "0:22:09", "throughput": "478.60", "total_tokens": 572864}
+{"current_steps": 91, "total_steps": 190, "loss": 0.0802, "learning_rate": 2.8910861626005774e-06, "epoch": 2.3483870967741938, "percentage": 47.89, "elapsed_time": "0:20:10", "remaining_time": "0:21:56", "throughput": "478.49", "total_tokens": 579024}
+{"current_steps": 92, "total_steps": 190, "loss": 0.0195, "learning_rate": 2.847932752400164e-06, "epoch": 2.3741935483870966, "percentage": 48.42, "elapsed_time": "0:20:23", "remaining_time": "0:21:43", "throughput": "478.66", "total_tokens": 585536}
+{"current_steps": 93, "total_steps": 190, "loss": 0.055, "learning_rate": 2.804673358512869e-06, "epoch": 2.4, "percentage": 48.95, "elapsed_time": "0:20:36", "remaining_time": "0:21:29", "throughput": "478.62", "total_tokens": 591792}
+{"current_steps": 94, "total_steps": 190, "loss": 0.0268, "learning_rate": 2.761321158169134e-06, "epoch": 2.425806451612903, "percentage": 49.47, "elapsed_time": "0:20:49", "remaining_time": "0:21:16", "throughput": "478.66", "total_tokens": 598144}
+{"current_steps": 95, "total_steps": 190, "loss": 0.0196, "learning_rate": 2.717889356869146e-06, "epoch": 2.4516129032258065, "percentage": 50.0, "elapsed_time": "0:21:02", "remaining_time": "0:21:02", "throughput": "478.71", "total_tokens": 604496}
+{"current_steps": 96, "total_steps": 190, "loss": 0.0363, "learning_rate": 2.6743911843603134e-06, "epoch": 2.47741935483871, "percentage": 50.53, "elapsed_time": "0:21:15", "remaining_time": "0:20:49", "throughput": "478.69", "total_tokens": 610784}
+{"current_steps": 97, "total_steps": 190, "loss": 0.0046, "learning_rate": 2.6308398906073603e-06, "epoch": 2.5032258064516126, "percentage": 51.05, "elapsed_time": "0:21:29", "remaining_time": "0:20:35", "throughput": "478.64", "total_tokens": 617024}
+{"current_steps": 98, "total_steps": 190, "loss": 0.0366, "learning_rate": 2.587248741756253e-06, "epoch": 2.5290322580645164, "percentage": 51.58, "elapsed_time": "0:21:42", "remaining_time": "0:20:22", "throughput": "478.64", "total_tokens": 623312}
+{"current_steps": 99, "total_steps": 190, "loss": 0.0051, "learning_rate": 2.543631016093209e-06, "epoch": 2.554838709677419, "percentage": 52.11, "elapsed_time": "0:21:55", "remaining_time": "0:20:09", "throughput": "478.64", "total_tokens": 629616}
+{"current_steps": 100, "total_steps": 190, "loss": 0.0226, "learning_rate": 2.5e-06, "epoch": 2.5806451612903225, "percentage": 52.63, "elapsed_time": "0:22:08", "remaining_time": "0:19:55", "throughput": "478.82", "total_tokens": 636144}
+{"current_steps": 101, "total_steps": 190, "loss": 0.0818, "learning_rate": 2.4563689839067913e-06, "epoch": 2.606451612903226, "percentage": 53.16, "elapsed_time": "0:22:21", "remaining_time": "0:19:42", "throughput": "478.85", "total_tokens": 642496}
+{"current_steps": 102, "total_steps": 190, "loss": 0.0247, "learning_rate": 2.4127512582437486e-06, "epoch": 2.632258064516129, "percentage": 53.68, "elapsed_time": "0:22:34", "remaining_time": "0:19:28", "throughput": "478.93", "total_tokens": 648912}
+{"current_steps": 103, "total_steps": 190, "loss": 0.0593, "learning_rate": 2.3691601093926406e-06, "epoch": 2.6580645161290324, "percentage": 54.21, "elapsed_time": "0:22:48", "remaining_time": "0:19:15", "throughput": "478.83", "total_tokens": 655088}
+{"current_steps": 104, "total_steps": 190, "loss": 0.0073, "learning_rate": 2.325608815639687e-06, "epoch": 2.6838709677419352, "percentage": 54.74, "elapsed_time": "0:23:01", "remaining_time": "0:19:02", "throughput": "479.05", "total_tokens": 661680}
+{"current_steps": 105, "total_steps": 190, "loss": 0.0295, "learning_rate": 2.2821106431308546e-06, "epoch": 2.709677419354839, "percentage": 55.26, "elapsed_time": "0:23:14", "remaining_time": "0:18:48", "throughput": "479.07", "total_tokens": 668016}
+{"current_steps": 106, "total_steps": 190, "loss": 0.0115, "learning_rate": 2.238678841830867e-06, "epoch": 2.735483870967742, "percentage": 55.79, "elapsed_time": "0:23:27", "remaining_time": "0:18:35", "throughput": "478.96", "total_tokens": 674176}
+{"current_steps": 107, "total_steps": 190, "loss": 0.0064, "learning_rate": 2.195326641487132e-06, "epoch": 2.761290322580645, "percentage": 56.32, "elapsed_time": "0:23:40", "remaining_time": "0:18:22", "throughput": "478.95", "total_tokens": 680464}
+{"current_steps": 108, "total_steps": 190, "loss": 0.0229, "learning_rate": 2.1520672475998374e-06, "epoch": 2.7870967741935484, "percentage": 56.84, "elapsed_time": "0:23:53", "remaining_time": "0:18:08", "throughput": "478.89", "total_tokens": 686688}
+{"current_steps": 109, "total_steps": 190, "loss": 0.0605, "learning_rate": 2.1089138373994226e-06, "epoch": 2.8129032258064517, "percentage": 57.37, "elapsed_time": "0:24:07", "remaining_time": "0:17:55", "throughput": "478.89", "total_tokens": 692992}
+{"current_steps": 110, "total_steps": 190, "loss": 0.05, "learning_rate": 2.0658795558326745e-06, "epoch": 2.838709677419355, "percentage": 57.89, "elapsed_time": "0:24:20", "remaining_time": "0:17:42", "throughput": "478.95", "total_tokens": 699392}
+{"current_steps": 111, "total_steps": 190, "loss": 0.0544, "learning_rate": 2.022977511558638e-06, "epoch": 2.864516129032258, "percentage": 58.42, "elapsed_time": "0:24:33", "remaining_time": "0:17:28", "throughput": "478.93", "total_tokens": 705680}
+{"current_steps": 112, "total_steps": 190, "loss": 0.0109, "learning_rate": 1.9802207729556023e-06, "epoch": 2.8903225806451616, "percentage": 58.95, "elapsed_time": "0:24:46", "remaining_time": "0:17:15", "throughput": "478.90", "total_tokens": 711952}
+{"current_steps": 113, "total_steps": 190, "loss": 0.0242, "learning_rate": 1.937622364140338e-06, "epoch": 2.9161290322580644, "percentage": 59.47, "elapsed_time": "0:24:59", "remaining_time": "0:17:01", "throughput": "478.86", "total_tokens": 718192}
+{"current_steps": 114, "total_steps": 190, "loss": 0.0223, "learning_rate": 1.895195261000831e-06, "epoch": 2.9419354838709677, "percentage": 60.0, "elapsed_time": "0:25:12", "remaining_time": "0:16:48", "throughput": "479.09", "total_tokens": 724832}
+{"current_steps": 115, "total_steps": 190, "loss": 0.0263, "learning_rate": 1.852952387243698e-06, "epoch": 2.967741935483871, "percentage": 60.53, "elapsed_time": "0:25:26", "remaining_time": "0:16:35", "throughput": "479.20", "total_tokens": 731312}
+{"current_steps": 116, "total_steps": 190, "loss": 0.0014, "learning_rate": 1.8109066104575023e-06, "epoch": 2.9935483870967743, "percentage": 61.05, "elapsed_time": "0:25:39", "remaining_time": "0:16:21", "throughput": "479.12", "total_tokens": 737488}
+{"current_steps": 117, "total_steps": 190, "loss": 0.0061, "learning_rate": 1.7690707381931585e-06, "epoch": 3.0193548387096776, "percentage": 61.58, "elapsed_time": "0:25:52", "remaining_time": "0:16:08", "throughput": "479.09", "total_tokens": 743760}
+{"current_steps": 118, "total_steps": 190, "loss": 0.0296, "learning_rate": 1.7274575140626318e-06, "epoch": 3.0451612903225804, "percentage": 62.11, "elapsed_time": "0:26:05", "remaining_time": "0:15:55", "throughput": "479.08", "total_tokens": 750048}
+{"current_steps": 119, "total_steps": 190, "loss": 0.0186, "learning_rate": 1.686079613857109e-06, "epoch": 3.0709677419354837, "percentage": 62.63, "elapsed_time": "0:26:18", "remaining_time": "0:15:41", "throughput": "479.11", "total_tokens": 756400}
+{"current_steps": 120, "total_steps": 190, "loss": 0.0038, "learning_rate": 1.6449496416858285e-06, "epoch": 3.096774193548387, "percentage": 63.16, "elapsed_time": "0:26:31", "remaining_time": "0:15:28", "throughput": "478.93", "total_tokens": 762432}
+{"current_steps": 121, "total_steps": 190, "loss": 0.0033, "learning_rate": 1.6040801261367494e-06, "epoch": 3.1225806451612903, "percentage": 63.68, "elapsed_time": "0:26:45", "remaining_time": "0:15:15", "throughput": "478.90", "total_tokens": 768688}
+{"current_steps": 122, "total_steps": 190, "loss": 0.0091, "learning_rate": 1.56348351646022e-06, "epoch": 3.1483870967741936, "percentage": 64.21, "elapsed_time": "0:26:58", "remaining_time": "0:15:01", "throughput": "478.92", "total_tokens": 775024}
+{"current_steps": 123, "total_steps": 190, "loss": 0.0012, "learning_rate": 1.5231721787768162e-06, "epoch": 3.174193548387097, "percentage": 64.74, "elapsed_time": "0:27:11", "remaining_time": "0:14:48", "throughput": "478.94", "total_tokens": 781360}
+{"current_steps": 124, "total_steps": 190, "loss": 0.0223, "learning_rate": 1.4831583923105e-06, "epoch": 3.2, "percentage": 65.26, "elapsed_time": "0:27:24", "remaining_time": "0:14:35", "throughput": "479.08", "total_tokens": 787888}
+{"current_steps": 125, "total_steps": 190, "loss": 0.0131, "learning_rate": 1.443454345648252e-06, "epoch": 3.225806451612903, "percentage": 65.79, "elapsed_time": "0:27:37", "remaining_time": "0:14:22", "throughput": "479.02", "total_tokens": 794112}
+{"current_steps": 126, "total_steps": 190, "loss": 0.0008, "learning_rate": 1.4040721330273063e-06, "epoch": 3.2516129032258063, "percentage": 66.32, "elapsed_time": "0:27:50", "remaining_time": "0:14:08", "throughput": "479.00", "total_tokens": 800384}
+{"current_steps": 127, "total_steps": 190, "loss": 0.0058, "learning_rate": 1.3650237506511333e-06, "epoch": 3.2774193548387096, "percentage": 66.84, "elapsed_time": "0:28:04", "remaining_time": "0:13:55", "throughput": "479.10", "total_tokens": 806848}
+{"current_steps": 128, "total_steps": 190, "loss": 0.0065, "learning_rate": 1.3263210930352737e-06, "epoch": 3.303225806451613, "percentage": 67.37, "elapsed_time": "0:28:17", "remaining_time": "0:13:42", "throughput": "479.09", "total_tokens": 813136}
+{"current_steps": 129, "total_steps": 190, "loss": 0.0398, "learning_rate": 1.2879759493841577e-06, "epoch": 3.329032258064516, "percentage": 67.89, "elapsed_time": "0:28:30", "remaining_time": "0:13:28", "throughput": "479.13", "total_tokens": 819504}
+{"current_steps": 130, "total_steps": 190, "loss": 0.0005, "learning_rate": 1.2500000000000007e-06, "epoch": 3.3548387096774195, "percentage": 68.42, "elapsed_time": "0:28:43", "remaining_time": "0:13:15", "throughput": "479.20", "total_tokens": 825936}
+{"current_steps": 131, "total_steps": 190, "loss": 0.0049, "learning_rate": 1.2124048127248644e-06, "epoch": 3.3806451612903228, "percentage": 68.95, "elapsed_time": "0:28:56", "remaining_time": "0:13:02", "throughput": "479.35", "total_tokens": 832496}
+{"current_steps": 132, "total_steps": 190, "loss": 0.0061, "learning_rate": 1.1752018394169882e-06, "epoch": 3.4064516129032256, "percentage": 69.47, "elapsed_time": "0:29:09", "remaining_time": "0:12:48", "throughput": "479.38", "total_tokens": 838864}
+{"current_steps": 133, "total_steps": 190, "loss": 0.0111, "learning_rate": 1.1384024124624324e-06, "epoch": 3.432258064516129, "percentage": 70.0, "elapsed_time": "0:29:23", "remaining_time": "0:12:35", "throughput": "479.56", "total_tokens": 845504}
+{"current_steps": 134, "total_steps": 190, "loss": 0.0049, "learning_rate": 1.1020177413231334e-06, "epoch": 3.458064516129032, "percentage": 70.53, "elapsed_time": "0:29:36", "remaining_time": "0:12:22", "throughput": "479.60", "total_tokens": 851888}
+{"current_steps": 135, "total_steps": 190, "loss": 0.0012, "learning_rate": 1.0660589091223854e-06, "epoch": 3.4838709677419355, "percentage": 71.05, "elapsed_time": "0:29:49", "remaining_time": "0:12:09", "throughput": "479.57", "total_tokens": 858144}
+{"current_steps": 136, "total_steps": 190, "loss": 0.0004, "learning_rate": 1.0305368692688175e-06, "epoch": 3.509677419354839, "percentage": 71.58, "elapsed_time": "0:30:02", "remaining_time": "0:11:55", "throughput": "479.59", "total_tokens": 864496}
+{"current_steps": 137, "total_steps": 190, "loss": 0.0006, "learning_rate": 9.95462442119879e-07, "epoch": 3.535483870967742, "percentage": 72.11, "elapsed_time": "0:30:15", "remaining_time": "0:11:42", "throughput": "479.51", "total_tokens": 870672}
+{"current_steps": 138, "total_steps": 190, "loss": 0.0003, "learning_rate": 9.608463116858544e-07, "epoch": 3.5612903225806454, "percentage": 72.63, "elapsed_time": "0:30:28", "remaining_time": "0:11:29", "throughput": "479.49", "total_tokens": 876944}
+{"current_steps": 139, "total_steps": 190, "loss": 0.0004, "learning_rate": 9.266990223754069e-07, "epoch": 3.587096774193548, "percentage": 73.16, "elapsed_time": "0:30:42", "remaining_time": "0:11:15", "throughput": "479.61", "total_tokens": 883488}
+{"current_steps": 140, "total_steps": 190, "loss": 0.0016, "learning_rate": 8.930309757836517e-07, "epoch": 3.6129032258064515, "percentage": 73.68, "elapsed_time": "0:30:55", "remaining_time": "0:11:02", "throughput": "479.62", "total_tokens": 889824}
+{"current_steps": 141, "total_steps": 190, "loss": 0.0268, "learning_rate": 8.598524275237321e-07, "epoch": 3.638709677419355, "percentage": 74.21, "elapsed_time": "0:31:08", "remaining_time": "0:10:49", "throughput": "479.64", "total_tokens": 896176}
+{"current_steps": 142, "total_steps": 190, "loss": 0.0018, "learning_rate": 8.271734841028553e-07, "epoch": 3.664516129032258, "percentage": 74.74, "elapsed_time": "0:31:21", "remaining_time": "0:10:36", "throughput": "479.52", "total_tokens": 902272}
+{"current_steps": 143, "total_steps": 190, "loss": 0.01, "learning_rate": 7.950040998437541e-07, "epoch": 3.6903225806451614, "percentage": 75.26, "elapsed_time": "0:31:34", "remaining_time": "0:10:22", "throughput": "479.48", "total_tokens": 908512}
+{"current_steps": 144, "total_steps": 190, "loss": 0.0209, "learning_rate": 7.633540738525066e-07, "epoch": 3.7161290322580647, "percentage": 75.79, "elapsed_time": "0:31:47", "remaining_time": "0:10:09", "throughput": "479.66", "total_tokens": 915152}
+{"current_steps": 145, "total_steps": 190, "loss": 0.0076, "learning_rate": 7.322330470336314e-07, "epoch": 3.741935483870968, "percentage": 76.32, "elapsed_time": "0:32:01", "remaining_time": "0:09:56", "throughput": "479.70", "total_tokens": 921552}
+{"current_steps": 146, "total_steps": 190, "loss": 0.0227, "learning_rate": 7.016504991533727e-07, "epoch": 3.767741935483871, "percentage": 76.84, "elapsed_time": "0:32:14", "remaining_time": "0:09:42", "throughput": "479.79", "total_tokens": 928048}
+{"current_steps": 147, "total_steps": 190, "loss": 0.0002, "learning_rate": 6.716157459520739e-07, "epoch": 3.793548387096774, "percentage": 77.37, "elapsed_time": "0:32:27", "remaining_time": "0:09:29", "throughput": "479.87", "total_tokens": 934512}
+{"current_steps": 148, "total_steps": 190, "loss": 0.0296, "learning_rate": 6.421379363065142e-07, "epoch": 3.8193548387096774, "percentage": 77.89, "elapsed_time": "0:32:40", "remaining_time": "0:09:16", "throughput": "479.86", "total_tokens": 940816}
+{"current_steps": 149, "total_steps": 190, "loss": 0.0006, "learning_rate": 6.1322604944307e-07, "epoch": 3.8451612903225807, "percentage": 78.42, "elapsed_time": "0:32:53", "remaining_time": "0:09:03", "throughput": "479.79", "total_tokens": 946992}
+{"current_steps": 150, "total_steps": 190, "loss": 0.0012, "learning_rate": 5.848888922025553e-07, "epoch": 3.870967741935484, "percentage": 78.95, "elapsed_time": "0:33:06", "remaining_time": "0:08:49", "throughput": "479.85", "total_tokens": 953424}
+{"current_steps": 151, "total_steps": 190, "loss": 0.0007, "learning_rate": 5.571350963575728e-07, "epoch": 3.896774193548387, "percentage": 79.47, "elapsed_time": "0:33:20", "remaining_time": "0:08:36", "throughput": "479.79", "total_tokens": 959616}
+{"current_steps": 152, "total_steps": 190, "loss": 0.0003, "learning_rate": 5.299731159831953e-07, "epoch": 3.9225806451612906, "percentage": 80.0, "elapsed_time": "0:33:33", "remaining_time": "0:08:23", "throughput": "479.87", "total_tokens": 966096}
+{"current_steps": 153, "total_steps": 190, "loss": 0.0005, "learning_rate": 5.034112248817685e-07, "epoch": 3.9483870967741934, "percentage": 80.53, "elapsed_time": "0:33:46", "remaining_time": "0:08:10", "throughput": "479.85", "total_tokens": 972368}
+{"current_steps": 154, "total_steps": 190, "loss": 0.0008, "learning_rate": 4.774575140626317e-07, "epoch": 3.9741935483870967, "percentage": 81.05, "elapsed_time": "0:33:59", "remaining_time": "0:07:56", "throughput": "479.92", "total_tokens": 978848}
+{"current_steps": 155, "total_steps": 190, "loss": 0.0003, "learning_rate": 4.5211988927752026e-07, "epoch": 4.0, "percentage": 81.58, "elapsed_time": "0:34:12", "remaining_time": "0:07:43", "throughput": "480.10", "total_tokens": 985520}
+{"current_steps": 156, "total_steps": 190, "loss": 0.0015, "learning_rate": 4.27406068612396e-07, "epoch": 4.025806451612903, "percentage": 82.11, "elapsed_time": "0:34:25", "remaining_time": "0:07:30", "throughput": "480.13", "total_tokens": 991904}
+{"current_steps": 157, "total_steps": 190, "loss": 0.0007, "learning_rate": 4.033235801364402e-07, "epoch": 4.051612903225807, "percentage": 82.63, "elapsed_time": "0:34:39", "remaining_time": "0:07:16", "throughput": "480.16", "total_tokens": 998288}
+{"current_steps": 158, "total_steps": 190, "loss": 0.0002, "learning_rate": 3.798797596089351e-07, "epoch": 4.077419354838709, "percentage": 83.16, "elapsed_time": "0:34:52", "remaining_time": "0:07:03", "throughput": "480.08", "total_tokens": 1004432}
+{"current_steps": 159, "total_steps": 190, "loss": 0.0052, "learning_rate": 3.5708174824471947e-07, "epoch": 4.103225806451613, "percentage": 83.68, "elapsed_time": "0:35:05", "remaining_time": "0:06:50", "throughput": "480.01", "total_tokens": 1010608}
+{"current_steps": 160, "total_steps": 190, "loss": 0.004, "learning_rate": 3.3493649053890325e-07, "epoch": 4.129032258064516, "percentage": 84.21, "elapsed_time": "0:35:18", "remaining_time": "0:06:37", "throughput": "479.97", "total_tokens": 1016848}
+{"current_steps": 161, "total_steps": 190, "loss": 0.0004, "learning_rate": 3.134507321515107e-07, "epoch": 4.15483870967742, "percentage": 84.74, "elapsed_time": "0:35:31", "remaining_time": "0:06:23", "throughput": "480.06", "total_tokens": 1023360}
+{"current_steps": 162, "total_steps": 190, "loss": 0.002, "learning_rate": 2.9263101785268253e-07, "epoch": 4.180645161290323, "percentage": 85.26, "elapsed_time": "0:35:44", "remaining_time": "0:06:10", "throughput": "480.12", "total_tokens": 1029808}
+{"current_steps": 163, "total_steps": 190, "loss": 0.0001, "learning_rate": 2.7248368952908055e-07, "epoch": 4.2064516129032254, "percentage": 85.79, "elapsed_time": "0:35:58", "remaining_time": "0:05:57", "throughput": "480.10", "total_tokens": 1036080}
+{"current_steps": 164, "total_steps": 190, "loss": 0.0001, "learning_rate": 2.53014884252083e-07, "epoch": 4.232258064516129, "percentage": 86.32, "elapsed_time": "0:36:11", "remaining_time": "0:05:44", "throughput": "480.03", "total_tokens": 1042240}
+{"current_steps": 165, "total_steps": 190, "loss": 0.0002, "learning_rate": 2.3423053240837518e-07, "epoch": 4.258064516129032, "percentage": 86.84, "elapsed_time": "0:36:24", "remaining_time": "0:05:30", "throughput": "480.08", "total_tokens": 1048672}
+{"current_steps": 166, "total_steps": 190, "loss": 0.0076, "learning_rate": 2.1613635589349756e-07, "epoch": 4.283870967741936, "percentage": 87.37, "elapsed_time": "0:36:37", "remaining_time": "0:05:17", "throughput": "480.00", "total_tokens": 1054832}
+{"current_steps": 167, "total_steps": 190, "loss": 0.0001, "learning_rate": 1.9873786636889908e-07, "epoch": 4.309677419354839, "percentage": 87.89, "elapsed_time": "0:36:50", "remaining_time": "0:05:04", "throughput": "480.08", "total_tokens": 1061312}
+{"current_steps": 168, "total_steps": 190, "loss": 0.0002, "learning_rate": 1.8204036358303173e-07, "epoch": 4.335483870967742, "percentage": 88.42, "elapsed_time": "0:37:03", "remaining_time": "0:04:51", "throughput": "480.02", "total_tokens": 1067488}
+{"current_steps": 169, "total_steps": 190, "loss": 0.0001, "learning_rate": 1.6604893375699594e-07, "epoch": 4.361290322580645, "percentage": 88.95, "elapsed_time": "0:37:17", "remaining_time": "0:04:37", "throughput": "479.94", "total_tokens": 1073648}
+{"current_steps": 170, "total_steps": 190, "loss": 0.0001, "learning_rate": 1.507684480352292e-07, "epoch": 4.387096774193548, "percentage": 89.47, "elapsed_time": "0:37:30", "remaining_time": "0:04:24", "throughput": "480.03", "total_tokens": 1080160}
+{"current_steps": 171, "total_steps": 190, "loss": 0.0002, "learning_rate": 1.362035610017079e-07, "epoch": 4.412903225806452, "percentage": 90.0, "elapsed_time": "0:37:43", "remaining_time": "0:04:11", "throughput": "480.18", "total_tokens": 1086832}
+{"current_steps": 172, "total_steps": 190, "loss": 0.0001, "learning_rate": 1.223587092621162e-07, "epoch": 4.438709677419355, "percentage": 90.53, "elapsed_time": "0:37:56", "remaining_time": "0:03:58", "throughput": "480.20", "total_tokens": 1093184}
+{"current_steps": 173, "total_steps": 190, "loss": 0.0005, "learning_rate": 1.0923811009241142e-07, "epoch": 4.464516129032258, "percentage": 91.05, "elapsed_time": "0:38:09", "remaining_time": "0:03:45", "throughput": "480.29", "total_tokens": 1099728}
+{"current_steps": 174, "total_steps": 190, "loss": 0.0001, "learning_rate": 9.684576015420277e-08, "epoch": 4.490322580645161, "percentage": 91.58, "elapsed_time": "0:38:22", "remaining_time": "0:03:31", "throughput": "480.29", "total_tokens": 1106032}
+{"current_steps": 175, "total_steps": 190, "loss": 0.0001, "learning_rate": 8.518543427732951e-08, "epoch": 4.516129032258064, "percentage": 92.11, "elapsed_time": "0:38:36", "remaining_time": "0:03:18", "throughput": "480.35", "total_tokens": 1112496}
+{"current_steps": 176, "total_steps": 190, "loss": 0.0081, "learning_rate": 7.426068431000883e-08, "epoch": 4.541935483870968, "percentage": 92.63, "elapsed_time": "0:38:49", "remaining_time": "0:03:05", "throughput": "480.49", "total_tokens": 1119152}
+{"current_steps": 177, "total_steps": 190, "loss": 0.0002, "learning_rate": 6.407483803691216e-08, "epoch": 4.567741935483871, "percentage": 93.16, "elapsed_time": "0:39:02", "remaining_time": "0:02:52", "throughput": "480.44", "total_tokens": 1125360}
+{"current_steps": 178, "total_steps": 190, "loss": 0.0003, "learning_rate": 5.463099816548578e-08, "epoch": 4.593548387096774, "percentage": 93.68, "elapsed_time": "0:39:15", "remaining_time": "0:02:38", "throughput": "480.50", "total_tokens": 1131824}
+{"current_steps": 179, "total_steps": 190, "loss": 0.0001, "learning_rate": 4.593204138084006e-08, "epoch": 4.619354838709677, "percentage": 94.21, "elapsed_time": "0:39:28", "remaining_time": "0:02:25", "throughput": "480.53", "total_tokens": 1138224}
+{"current_steps": 180, "total_steps": 190, "loss": 0.0005, "learning_rate": 3.798061746947995e-08, "epoch": 4.645161290322581, "percentage": 94.74, "elapsed_time": "0:39:41", "remaining_time": "0:02:12", "throughput": "480.53", "total_tokens": 1144528}
+{"current_steps": 181, "total_steps": 190, "loss": 0.0001, "learning_rate": 3.077914851215585e-08, "epoch": 4.670967741935484, "percentage": 95.26, "elapsed_time": "0:39:54", "remaining_time": "0:01:59", "throughput": "480.54", "total_tokens": 1150880}
+{"current_steps": 182, "total_steps": 190, "loss": 0.0002, "learning_rate": 2.4329828146074096e-08, "epoch": 4.6967741935483875, "percentage": 95.79, "elapsed_time": "0:40:08", "remaining_time": "0:01:45", "throughput": "480.53", "total_tokens": 1157184}
+{"current_steps": 183, "total_steps": 190, "loss": 0.0001, "learning_rate": 1.8634620896695044e-08, "epoch": 4.72258064516129, "percentage": 96.32, "elapsed_time": "0:40:21", "remaining_time": "0:01:32", "throughput": "480.54", "total_tokens": 1163536}
+{"current_steps": 184, "total_steps": 190, "loss": 0.0002, "learning_rate": 1.3695261579316776e-08, "epoch": 4.748387096774193, "percentage": 96.84, "elapsed_time": "0:40:34", "remaining_time": "0:01:19", "throughput": "480.55", "total_tokens": 1169888}
+{"current_steps": 185, "total_steps": 190, "loss": 0.0002, "learning_rate": 9.513254770636138e-09, "epoch": 4.774193548387097, "percentage": 97.37, "elapsed_time": "0:40:47", "remaining_time": "0:01:06", "throughput": "480.63", "total_tokens": 1176400}
+{"current_steps": 186, "total_steps": 190, "loss": 0.0002, "learning_rate": 6.089874350439507e-09, "epoch": 4.8, "percentage": 97.89, "elapsed_time": "0:41:00", "remaining_time": "0:00:52", "throughput": "480.58", "total_tokens": 1182608}
+{"current_steps": 187, "total_steps": 190, "loss": 0.0001, "learning_rate": 3.4261631135654174e-09, "epoch": 4.825806451612904, "percentage": 98.42, "elapsed_time": "0:41:13", "remaining_time": "0:00:39", "throughput": "480.61", "total_tokens": 1189008}
+{"current_steps": 188, "total_steps": 190, "loss": 0.0004, "learning_rate": 1.5229324522605949e-09, "epoch": 4.851612903225806, "percentage": 98.95, "elapsed_time": "0:41:27", "remaining_time": "0:00:26", "throughput": "480.59", "total_tokens": 1195280}
+{"current_steps": 189, "total_steps": 190, "loss": 0.0013, "learning_rate": 3.8076210902182607e-10, "epoch": 4.877419354838709, "percentage": 99.47, "elapsed_time": "0:41:40", "remaining_time": "0:00:13", "throughput": "480.53", "total_tokens": 1201456}
+{"current_steps": 190, "total_steps": 190, "loss": 0.0008, "learning_rate": 0.0, "epoch": 4.903225806451613, "percentage": 100.0, "elapsed_time": "0:41:53", "remaining_time": "0:00:00", "throughput": "480.52", "total_tokens": 1207760}
+{"current_steps": 190, "total_steps": 190, "epoch": 4.903225806451613, "percentage": 100.0, "elapsed_time": "0:42:55", "remaining_time": "0:00:00", "throughput": "468.99", "total_tokens": 1207760}

trainer_state.json ADDED Viewed

	@@ -0,0 +1,1563 @@

+{
+  "best_metric": null,
+  "best_model_checkpoint": null,
+  "epoch": 4.903225806451613,
+  "eval_steps": 500,
+  "global_step": 190,
+  "is_hyper_param_search": false,
+  "is_local_process_zero": true,
+  "is_world_process_zero": true,
+  "log_history": [
+    {
+      "epoch": 0.025806451612903226,
+      "grad_norm": 611.8341064453125,
+      "learning_rate": 5.000000000000001e-07,
+      "loss": 13.7821,
+      "num_input_tokens_seen": 6416,
+      "step": 1
+    },
+    {
+      "epoch": 0.05161290322580645,
+      "grad_norm": 617.9733276367188,
+      "learning_rate": 1.0000000000000002e-06,
+      "loss": 13.6363,
+      "num_input_tokens_seen": 12992,
+      "step": 2
+    },
+    {
+      "epoch": 0.07741935483870968,
+      "grad_norm": 608.6278686523438,
+      "learning_rate": 1.5e-06,
+      "loss": 13.6033,
+      "num_input_tokens_seen": 19472,
+      "step": 3
+    },
+    {
+      "epoch": 0.1032258064516129,
+      "grad_norm": 618.8984985351562,
+      "learning_rate": 2.0000000000000003e-06,
+      "loss": 12.5696,
+      "num_input_tokens_seen": 25936,
+      "step": 4
+    },
+    {
+      "epoch": 0.12903225806451613,
+      "grad_norm": 481.14508056640625,
+      "learning_rate": 2.5e-06,
+      "loss": 9.3589,
+      "num_input_tokens_seen": 32272,
+      "step": 5
+    },
+    {
+      "epoch": 0.15483870967741936,
+      "grad_norm": 592.4844970703125,
+      "learning_rate": 3e-06,
+      "loss": 6.7715,
+      "num_input_tokens_seen": 38640,
+      "step": 6
+    },
+    {
+      "epoch": 0.18064516129032257,
+      "grad_norm": 468.1033935546875,
+      "learning_rate": 3.5e-06,
+      "loss": 5.3541,
+      "num_input_tokens_seen": 44992,
+      "step": 7
+    },
+    {
+      "epoch": 0.2064516129032258,
+      "grad_norm": 226.9576416015625,
+      "learning_rate": 4.000000000000001e-06,
+      "loss": 1.9295,
+      "num_input_tokens_seen": 51328,
+      "step": 8
+    },
+    {
+      "epoch": 0.23225806451612904,
+      "grad_norm": 106.9604721069336,
+      "learning_rate": 4.5e-06,
+      "loss": 0.6328,
+      "num_input_tokens_seen": 57408,
+      "step": 9
+    },
+    {
+      "epoch": 0.25806451612903225,
+      "grad_norm": 426.4488830566406,
+      "learning_rate": 5e-06,
+      "loss": 3.3225,
+      "num_input_tokens_seen": 63696,
+      "step": 10
+    },
+    {
+      "epoch": 0.2838709677419355,
+      "grad_norm": 28.350229263305664,
+      "learning_rate": 4.9996192378909785e-06,
+      "loss": 0.2598,
+      "num_input_tokens_seen": 69984,
+      "step": 11
+    },
+    {
+      "epoch": 0.3096774193548387,
+      "grad_norm": 198.60235595703125,
+      "learning_rate": 4.99847706754774e-06,
+      "loss": 0.6874,
+      "num_input_tokens_seen": 76384,
+      "step": 12
+    },
+    {
+      "epoch": 0.33548387096774196,
+      "grad_norm": 286.51763916015625,
+      "learning_rate": 4.9965738368864345e-06,
+      "loss": 2.0329,
+      "num_input_tokens_seen": 82704,
+      "step": 13
+    },
+    {
+      "epoch": 0.36129032258064514,
+      "grad_norm": 76.4217300415039,
+      "learning_rate": 4.993910125649561e-06,
+      "loss": 0.4942,
+      "num_input_tokens_seen": 88976,
+      "step": 14
+    },
+    {
+      "epoch": 0.3870967741935484,
+      "grad_norm": 150.88587951660156,
+      "learning_rate": 4.990486745229364e-06,
+      "loss": 1.1786,
+      "num_input_tokens_seen": 95472,
+      "step": 15
+    },
+    {
+      "epoch": 0.4129032258064516,
+      "grad_norm": 60.549949645996094,
+      "learning_rate": 4.986304738420684e-06,
+      "loss": 0.4424,
+      "num_input_tokens_seen": 101904,
+      "step": 16
+    },
+    {
+      "epoch": 0.43870967741935485,
+      "grad_norm": 56.29042053222656,
+      "learning_rate": 4.981365379103306e-06,
+      "loss": 0.3336,
+      "num_input_tokens_seen": 108272,
+      "step": 17
+    },
+    {
+      "epoch": 0.4645161290322581,
+      "grad_norm": 27.45728874206543,
+      "learning_rate": 4.975670171853926e-06,
+      "loss": 0.2568,
+      "num_input_tokens_seen": 114464,
+      "step": 18
+    },
+    {
+      "epoch": 0.49032258064516127,
+      "grad_norm": 20.99466323852539,
+      "learning_rate": 4.9692208514878445e-06,
+      "loss": 0.1889,
+      "num_input_tokens_seen": 120816,
+      "step": 19
+    },
+    {
+      "epoch": 0.5161290322580645,
+      "grad_norm": 13.661433219909668,
+      "learning_rate": 4.962019382530521e-06,
+      "loss": 0.1974,
+      "num_input_tokens_seen": 127120,
+      "step": 20
+    },
+    {
+      "epoch": 0.5419354838709678,
+      "grad_norm": 16.250490188598633,
+      "learning_rate": 4.9540679586191605e-06,
+      "loss": 0.1766,
+      "num_input_tokens_seen": 133712,
+      "step": 21
+    },
+    {
+      "epoch": 0.567741935483871,
+      "grad_norm": 10.539461135864258,
+      "learning_rate": 4.9453690018345144e-06,
+      "loss": 0.1694,
+      "num_input_tokens_seen": 139904,
+      "step": 22
+    },
+    {
+      "epoch": 0.5935483870967742,
+      "grad_norm": 11.246196746826172,
+      "learning_rate": 4.935925161963089e-06,
+      "loss": 0.1374,
+      "num_input_tokens_seen": 146256,
+      "step": 23
+    },
+    {
+      "epoch": 0.6193548387096774,
+      "grad_norm": 16.509199142456055,
+      "learning_rate": 4.925739315689991e-06,
+      "loss": 0.1496,
+      "num_input_tokens_seen": 152784,
+      "step": 24
+    },
+    {
+      "epoch": 0.6451612903225806,
+      "grad_norm": 7.252533435821533,
+      "learning_rate": 4.914814565722671e-06,
+      "loss": 0.1554,
+      "num_input_tokens_seen": 158976,
+      "step": 25
+    },
+    {
+      "epoch": 0.6709677419354839,
+      "grad_norm": 11.432785034179688,
+      "learning_rate": 4.903154239845798e-06,
+      "loss": 0.0918,
+      "num_input_tokens_seen": 165280,
+      "step": 26
+    },
+    {
+      "epoch": 0.6967741935483871,
+      "grad_norm": 8.87109375,
+      "learning_rate": 4.890761889907589e-06,
+      "loss": 0.1062,
+      "num_input_tokens_seen": 171808,
+      "step": 27
+    },
+    {
+      "epoch": 0.7225806451612903,
+      "grad_norm": 26.34603500366211,
+      "learning_rate": 4.8776412907378845e-06,
+      "loss": 0.1975,
+      "num_input_tokens_seen": 178112,
+      "step": 28
+    },
+    {
+      "epoch": 0.7483870967741936,
+      "grad_norm": 20.092260360717773,
+      "learning_rate": 4.863796438998293e-06,
+      "loss": 0.1389,
+      "num_input_tokens_seen": 184448,
+      "step": 29
+    },
+    {
+      "epoch": 0.7741935483870968,
+      "grad_norm": 16.30493927001953,
+      "learning_rate": 4.849231551964771e-06,
+      "loss": 0.1382,
+      "num_input_tokens_seen": 190896,
+      "step": 30
+    },
+    {
+      "epoch": 0.8,
+      "grad_norm": 20.723533630371094,
+      "learning_rate": 4.833951066243004e-06,
+      "loss": 0.1982,
+      "num_input_tokens_seen": 197024,
+      "step": 31
+    },
+    {
+      "epoch": 0.8258064516129032,
+      "grad_norm": 7.432217597961426,
+      "learning_rate": 4.817959636416969e-06,
+      "loss": 0.1072,
+      "num_input_tokens_seen": 203248,
+      "step": 32
+    },
+    {
+      "epoch": 0.8516129032258064,
+      "grad_norm": 8.914057731628418,
+      "learning_rate": 4.801262133631101e-06,
+      "loss": 0.0757,
+      "num_input_tokens_seen": 209760,
+      "step": 33
+    },
+    {
+      "epoch": 0.8774193548387097,
+      "grad_norm": 12.913470268249512,
+      "learning_rate": 4.783863644106502e-06,
+      "loss": 0.0829,
+      "num_input_tokens_seen": 215968,
+      "step": 34
+    },
+    {
+      "epoch": 0.9032258064516129,
+      "grad_norm": 8.646073341369629,
+      "learning_rate": 4.765769467591626e-06,
+      "loss": 0.1017,
+      "num_input_tokens_seen": 222192,
+      "step": 35
+    },
+    {
+      "epoch": 0.9290322580645162,
+      "grad_norm": 11.357608795166016,
+      "learning_rate": 4.746985115747918e-06,
+      "loss": 0.0957,
+      "num_input_tokens_seen": 228512,
+      "step": 36
+    },
+    {
+      "epoch": 0.9548387096774194,
+      "grad_norm": 6.806307315826416,
+      "learning_rate": 4.72751631047092e-06,
+      "loss": 0.0999,
+      "num_input_tokens_seen": 235120,
+      "step": 37
+    },
+    {
+      "epoch": 0.9806451612903225,
+      "grad_norm": 7.694289684295654,
+      "learning_rate": 4.707368982147318e-06,
+      "loss": 0.0581,
+      "num_input_tokens_seen": 241584,
+      "step": 38
+    },
+    {
+      "epoch": 1.0064516129032257,
+      "grad_norm": 6.573248386383057,
+      "learning_rate": 4.68654926784849e-06,
+      "loss": 0.0923,
+      "num_input_tokens_seen": 248080,
+      "step": 39
+    },
+    {
+      "epoch": 1.032258064516129,
+      "grad_norm": 6.997208118438721,
+      "learning_rate": 4.665063509461098e-06,
+      "loss": 0.0506,
+      "num_input_tokens_seen": 254416,
+      "step": 40
+    },
+    {
+      "epoch": 1.0580645161290323,
+      "grad_norm": 8.015267372131348,
+      "learning_rate": 4.642918251755281e-06,
+      "loss": 0.0333,
+      "num_input_tokens_seen": 260640,
+      "step": 41
+    },
+    {
+      "epoch": 1.0838709677419356,
+      "grad_norm": 6.756544589996338,
+      "learning_rate": 4.620120240391065e-06,
+      "loss": 0.038,
+      "num_input_tokens_seen": 267072,
+      "step": 42
+    },
+    {
+      "epoch": 1.1096774193548387,
+      "grad_norm": 4.104006290435791,
+      "learning_rate": 4.596676419863561e-06,
+      "loss": 0.0416,
+      "num_input_tokens_seen": 273392,
+      "step": 43
+    },
+    {
+      "epoch": 1.135483870967742,
+      "grad_norm": 16.92180633544922,
+      "learning_rate": 4.572593931387604e-06,
+      "loss": 0.1068,
+      "num_input_tokens_seen": 279680,
+      "step": 44
+    },
+    {
+      "epoch": 1.1612903225806452,
+      "grad_norm": 6.803272247314453,
+      "learning_rate": 4.54788011072248e-06,
+      "loss": 0.0369,
+      "num_input_tokens_seen": 285968,
+      "step": 45
+    },
+    {
+      "epoch": 1.1870967741935483,
+      "grad_norm": 10.87576675415039,
+      "learning_rate": 4.522542485937369e-06,
+      "loss": 0.1703,
+      "num_input_tokens_seen": 292304,
+      "step": 46
+    },
+    {
+      "epoch": 1.2129032258064516,
+      "grad_norm": 10.078003883361816,
+      "learning_rate": 4.496588775118232e-06,
+      "loss": 0.1102,
+      "num_input_tokens_seen": 298608,
+      "step": 47
+    },
+    {
+      "epoch": 1.238709677419355,
+      "grad_norm": 14.269394874572754,
+      "learning_rate": 4.470026884016805e-06,
+      "loss": 0.0595,
+      "num_input_tokens_seen": 304912,
+      "step": 48
+    },
+    {
+      "epoch": 1.2645161290322582,
+      "grad_norm": 12.623174667358398,
+      "learning_rate": 4.442864903642428e-06,
+      "loss": 0.1009,
+      "num_input_tokens_seen": 311328,
+      "step": 49
+    },
+    {
+      "epoch": 1.2903225806451613,
+      "grad_norm": 6.7360053062438965,
+      "learning_rate": 4.415111107797445e-06,
+      "loss": 0.0434,
+      "num_input_tokens_seen": 317664,
+      "step": 50
+    },
+    {
+      "epoch": 1.3161290322580645,
+      "grad_norm": 1.8871471881866455,
+      "learning_rate": 4.386773950556931e-06,
+      "loss": 0.0281,
+      "num_input_tokens_seen": 324128,
+      "step": 51
+    },
+    {
+      "epoch": 1.3419354838709676,
+      "grad_norm": 8.304376602172852,
+      "learning_rate": 4.357862063693486e-06,
+      "loss": 0.0513,
+      "num_input_tokens_seen": 330304,
+      "step": 52
+    },
+    {
+      "epoch": 1.367741935483871,
+      "grad_norm": 9.218457221984863,
+      "learning_rate": 4.328384254047927e-06,
+      "loss": 0.0902,
+      "num_input_tokens_seen": 336608,
+      "step": 53
+    },
+    {
+      "epoch": 1.3935483870967742,
+      "grad_norm": 6.52198600769043,
+      "learning_rate": 4.2983495008466285e-06,
+      "loss": 0.0448,
+      "num_input_tokens_seen": 342944,
+      "step": 54
+    },
+    {
+      "epoch": 1.4193548387096775,
+      "grad_norm": 5.9580397605896,
+      "learning_rate": 4.267766952966369e-06,
+      "loss": 0.036,
+      "num_input_tokens_seen": 349504,
+      "step": 55
+    },
+    {
+      "epoch": 1.4451612903225808,
+      "grad_norm": 7.217082977294922,
+      "learning_rate": 4.236645926147493e-06,
+      "loss": 0.0279,
+      "num_input_tokens_seen": 355808,
+      "step": 56
+    },
+    {
+      "epoch": 1.4709677419354839,
+      "grad_norm": 8.09554386138916,
+      "learning_rate": 4.204995900156247e-06,
+      "loss": 0.0527,
+      "num_input_tokens_seen": 362144,
+      "step": 57
+    },
+    {
+      "epoch": 1.4967741935483871,
+      "grad_norm": 9.561200141906738,
+      "learning_rate": 4.172826515897146e-06,
+      "loss": 0.0466,
+      "num_input_tokens_seen": 368800,
+      "step": 58
+    },
+    {
+      "epoch": 1.5225806451612902,
+      "grad_norm": 4.221444606781006,
+      "learning_rate": 4.140147572476269e-06,
+      "loss": 0.0203,
+      "num_input_tokens_seen": 375264,
+      "step": 59
+    },
+    {
+      "epoch": 1.5483870967741935,
+      "grad_norm": 8.664204597473145,
+      "learning_rate": 4.106969024216348e-06,
+      "loss": 0.0693,
+      "num_input_tokens_seen": 381408,
+      "step": 60
+    },
+    {
+      "epoch": 1.5741935483870968,
+      "grad_norm": 3.899017333984375,
+      "learning_rate": 4.073300977624594e-06,
+      "loss": 0.0193,
+      "num_input_tokens_seen": 387552,
+      "step": 61
+    },
+    {
+      "epoch": 1.6,
+      "grad_norm": 8.732043266296387,
+      "learning_rate": 4.039153688314146e-06,
+      "loss": 0.1155,
+      "num_input_tokens_seen": 394128,
+      "step": 62
+    },
+    {
+      "epoch": 1.6258064516129034,
+      "grad_norm": 5.531858921051025,
+      "learning_rate": 4.0045375578801216e-06,
+      "loss": 0.0594,
+      "num_input_tokens_seen": 400512,
+      "step": 63
+    },
+    {
+      "epoch": 1.6516129032258065,
+      "grad_norm": 8.751105308532715,
+      "learning_rate": 3.969463130731183e-06,
+      "loss": 0.0391,
+      "num_input_tokens_seen": 406752,
+      "step": 64
+    },
+    {
+      "epoch": 1.6774193548387095,
+      "grad_norm": 5.837942600250244,
+      "learning_rate": 3.933941090877615e-06,
+      "loss": 0.0552,
+      "num_input_tokens_seen": 413040,
+      "step": 65
+    },
+    {
+      "epoch": 1.7032258064516128,
+      "grad_norm": 3.627204418182373,
+      "learning_rate": 3.897982258676867e-06,
+      "loss": 0.03,
+      "num_input_tokens_seen": 419408,
+      "step": 66
+    },
+    {
+      "epoch": 1.729032258064516,
+      "grad_norm": 7.315670490264893,
+      "learning_rate": 3.861597587537568e-06,
+      "loss": 0.0458,
+      "num_input_tokens_seen": 425920,
+      "step": 67
+    },
+    {
+      "epoch": 1.7548387096774194,
+      "grad_norm": 5.958889484405518,
+      "learning_rate": 3.824798160583012e-06,
+      "loss": 0.0502,
+      "num_input_tokens_seen": 432400,
+      "step": 68
+    },
+    {
+      "epoch": 1.7806451612903227,
+      "grad_norm": 6.365023136138916,
+      "learning_rate": 3.787595187275136e-06,
+      "loss": 0.0513,
+      "num_input_tokens_seen": 438688,
+      "step": 69
+    },
+    {
+      "epoch": 1.8064516129032258,
+      "grad_norm": 3.058981418609619,
+      "learning_rate": 3.7500000000000005e-06,
+      "loss": 0.0309,
+      "num_input_tokens_seen": 445280,
+      "step": 70
+    },
+    {
+      "epoch": 1.832258064516129,
+      "grad_norm": 4.8149003982543945,
+      "learning_rate": 3.7120240506158433e-06,
+      "loss": 0.0889,
+      "num_input_tokens_seen": 451616,
+      "step": 71
+    },
+    {
+      "epoch": 1.8580645161290321,
+      "grad_norm": 7.181830406188965,
+      "learning_rate": 3.6736789069647273e-06,
+      "loss": 0.0868,
+      "num_input_tokens_seen": 457856,
+      "step": 72
+    },
+    {
+      "epoch": 1.8838709677419354,
+      "grad_norm": 7.750051975250244,
+      "learning_rate": 3.634976249348867e-06,
+      "loss": 0.0516,
+      "num_input_tokens_seen": 464144,
+      "step": 73
+    },
+    {
+      "epoch": 1.9096774193548387,
+      "grad_norm": 5.294251918792725,
+      "learning_rate": 3.595927866972694e-06,
+      "loss": 0.059,
+      "num_input_tokens_seen": 470736,
+      "step": 74
+    },
+    {
+      "epoch": 1.935483870967742,
+      "grad_norm": 4.239963531494141,
+      "learning_rate": 3.556545654351749e-06,
+      "loss": 0.0475,
+      "num_input_tokens_seen": 477168,
+      "step": 75
+    },
+    {
+      "epoch": 1.9612903225806453,
+      "grad_norm": 5.429728031158447,
+      "learning_rate": 3.516841607689501e-06,
+      "loss": 0.0704,
+      "num_input_tokens_seen": 483536,
+      "step": 76
+    },
+    {
+      "epoch": 1.9870967741935484,
+      "grad_norm": 11.018205642700195,
+      "learning_rate": 3.476827821223184e-06,
+      "loss": 0.0666,
+      "num_input_tokens_seen": 489760,
+      "step": 77
+    },
+    {
+      "epoch": 2.0129032258064514,
+      "grad_norm": 8.510910987854004,
+      "learning_rate": 3.436516483539781e-06,
+      "loss": 0.0275,
+      "num_input_tokens_seen": 496000,
+      "step": 78
+    },
+    {
+      "epoch": 2.0387096774193547,
+      "grad_norm": 4.036402225494385,
+      "learning_rate": 3.39591987386325e-06,
+      "loss": 0.0169,
+      "num_input_tokens_seen": 502384,
+      "step": 79
+    },
+    {
+      "epoch": 2.064516129032258,
+      "grad_norm": 1.8402727842330933,
+      "learning_rate": 3.3550503583141726e-06,
+      "loss": 0.0056,
+      "num_input_tokens_seen": 508992,
+      "step": 80
+    },
+    {
+      "epoch": 2.0903225806451613,
+      "grad_norm": 3.9755101203918457,
+      "learning_rate": 3.313920386142892e-06,
+      "loss": 0.0139,
+      "num_input_tokens_seen": 515216,
+      "step": 81
+    },
+    {
+      "epoch": 2.1161290322580646,
+      "grad_norm": 6.4678168296813965,
+      "learning_rate": 3.272542485937369e-06,
+      "loss": 0.0561,
+      "num_input_tokens_seen": 521792,
+      "step": 82
+    },
+    {
+      "epoch": 2.141935483870968,
+      "grad_norm": 4.438370704650879,
+      "learning_rate": 3.230929261806842e-06,
+      "loss": 0.0098,
+      "num_input_tokens_seen": 528176,
+      "step": 83
+    },
+    {
+      "epoch": 2.167741935483871,
+      "grad_norm": 1.3302000761032104,
+      "learning_rate": 3.189093389542498e-06,
+      "loss": 0.0037,
+      "num_input_tokens_seen": 534496,
+      "step": 84
+    },
+    {
+      "epoch": 2.193548387096774,
+      "grad_norm": 4.607197284698486,
+      "learning_rate": 3.147047612756302e-06,
+      "loss": 0.0194,
+      "num_input_tokens_seen": 541024,
+      "step": 85
+    },
+    {
+      "epoch": 2.2193548387096773,
+      "grad_norm": 0.3103199899196625,
+      "learning_rate": 3.1048047389991693e-06,
+      "loss": 0.0004,
+      "num_input_tokens_seen": 547328,
+      "step": 86
+    },
+    {
+      "epoch": 2.2451612903225806,
+      "grad_norm": 0.17417627573013306,
+      "learning_rate": 3.062377635859663e-06,
+      "loss": 0.0003,
+      "num_input_tokens_seen": 553760,
+      "step": 87
+    },
+    {
+      "epoch": 2.270967741935484,
+      "grad_norm": 21.153165817260742,
+      "learning_rate": 3.019779227044398e-06,
+      "loss": 0.0511,
+      "num_input_tokens_seen": 560048,
+      "step": 88
+    },
+    {
+      "epoch": 2.296774193548387,
+      "grad_norm": 1.729843020439148,
+      "learning_rate": 2.9770224884413625e-06,
+      "loss": 0.0974,
+      "num_input_tokens_seen": 566624,
+      "step": 89
+    },
+    {
+      "epoch": 2.3225806451612905,
+      "grad_norm": 14.893946647644043,
+      "learning_rate": 2.9341204441673267e-06,
+      "loss": 0.0442,
+      "num_input_tokens_seen": 572864,
+      "step": 90
+    },
+    {
+      "epoch": 2.3483870967741938,
+      "grad_norm": 6.81472110748291,
+      "learning_rate": 2.8910861626005774e-06,
+      "loss": 0.0802,
+      "num_input_tokens_seen": 579024,
+      "step": 91
+    },
+    {
+      "epoch": 2.3741935483870966,
+      "grad_norm": 8.73901653289795,
+      "learning_rate": 2.847932752400164e-06,
+      "loss": 0.0195,
+      "num_input_tokens_seen": 585536,
+      "step": 92
+    },
+    {
+      "epoch": 2.4,
+      "grad_norm": 2.9088733196258545,
+      "learning_rate": 2.804673358512869e-06,
+      "loss": 0.055,
+      "num_input_tokens_seen": 591792,
+      "step": 93
+    },
+    {
+      "epoch": 2.425806451612903,
+      "grad_norm": 4.13192081451416,
+      "learning_rate": 2.761321158169134e-06,
+      "loss": 0.0268,
+      "num_input_tokens_seen": 598144,
+      "step": 94
+    },
+    {
+      "epoch": 2.4516129032258065,
+      "grad_norm": 3.6112844944000244,
+      "learning_rate": 2.717889356869146e-06,
+      "loss": 0.0196,
+      "num_input_tokens_seen": 604496,
+      "step": 95
+    },
+    {
+      "epoch": 2.47741935483871,
+      "grad_norm": 6.083769798278809,
+      "learning_rate": 2.6743911843603134e-06,
+      "loss": 0.0363,
+      "num_input_tokens_seen": 610784,
+      "step": 96
+    },
+    {
+      "epoch": 2.5032258064516126,
+      "grad_norm": 1.1240483522415161,
+      "learning_rate": 2.6308398906073603e-06,
+      "loss": 0.0046,
+      "num_input_tokens_seen": 617024,
+      "step": 97
+    },
+    {
+      "epoch": 2.5290322580645164,
+      "grad_norm": 7.753751277923584,
+      "learning_rate": 2.587248741756253e-06,
+      "loss": 0.0366,
+      "num_input_tokens_seen": 623312,
+      "step": 98
+    },
+    {
+      "epoch": 2.554838709677419,
+      "grad_norm": 1.1425215005874634,
+      "learning_rate": 2.543631016093209e-06,
+      "loss": 0.0051,
+      "num_input_tokens_seen": 629616,
+      "step": 99
+    },
+    {
+      "epoch": 2.5806451612903225,
+      "grad_norm": 2.6504504680633545,
+      "learning_rate": 2.5e-06,
+      "loss": 0.0226,
+      "num_input_tokens_seen": 636144,
+      "step": 100
+    },
+    {
+      "epoch": 2.606451612903226,
+      "grad_norm": 5.269250869750977,
+      "learning_rate": 2.4563689839067913e-06,
+      "loss": 0.0818,
+      "num_input_tokens_seen": 642496,
+      "step": 101
+    },
+    {
+      "epoch": 2.632258064516129,
+      "grad_norm": 6.670433044433594,
+      "learning_rate": 2.4127512582437486e-06,
+      "loss": 0.0247,
+      "num_input_tokens_seen": 648912,
+      "step": 102
+    },
+    {
+      "epoch": 2.6580645161290324,
+      "grad_norm": 2.8113598823547363,
+      "learning_rate": 2.3691601093926406e-06,
+      "loss": 0.0593,
+      "num_input_tokens_seen": 655088,
+      "step": 103
+    },
+    {
+      "epoch": 2.6838709677419352,
+      "grad_norm": 4.226614475250244,
+      "learning_rate": 2.325608815639687e-06,
+      "loss": 0.0073,
+      "num_input_tokens_seen": 661680,
+      "step": 104
+    },
+    {
+      "epoch": 2.709677419354839,
+      "grad_norm": 2.636570453643799,
+      "learning_rate": 2.2821106431308546e-06,
+      "loss": 0.0295,
+      "num_input_tokens_seen": 668016,
+      "step": 105
+    },
+    {
+      "epoch": 2.735483870967742,
+      "grad_norm": 7.529627323150635,
+      "learning_rate": 2.238678841830867e-06,
+      "loss": 0.0115,
+      "num_input_tokens_seen": 674176,
+      "step": 106
+    },
+    {
+      "epoch": 2.761290322580645,
+      "grad_norm": 2.3682408332824707,
+      "learning_rate": 2.195326641487132e-06,
+      "loss": 0.0064,
+      "num_input_tokens_seen": 680464,
+      "step": 107
+    },
+    {
+      "epoch": 2.7870967741935484,
+      "grad_norm": 4.345768451690674,
+      "learning_rate": 2.1520672475998374e-06,
+      "loss": 0.0229,
+      "num_input_tokens_seen": 686688,
+      "step": 108
+    },
+    {
+      "epoch": 2.8129032258064517,
+      "grad_norm": 8.903531074523926,
+      "learning_rate": 2.1089138373994226e-06,
+      "loss": 0.0605,
+      "num_input_tokens_seen": 692992,
+      "step": 109
+    },
+    {
+      "epoch": 2.838709677419355,
+      "grad_norm": 9.090164184570312,
+      "learning_rate": 2.0658795558326745e-06,
+      "loss": 0.05,
+      "num_input_tokens_seen": 699392,
+      "step": 110
+    },
+    {
+      "epoch": 2.864516129032258,
+      "grad_norm": 5.729383945465088,
+      "learning_rate": 2.022977511558638e-06,
+      "loss": 0.0544,
+      "num_input_tokens_seen": 705680,
+      "step": 111
+    },
+    {
+      "epoch": 2.8903225806451616,
+      "grad_norm": 2.055316925048828,
+      "learning_rate": 1.9802207729556023e-06,
+      "loss": 0.0109,
+      "num_input_tokens_seen": 711952,
+      "step": 112
+    },
+    {
+      "epoch": 2.9161290322580644,
+      "grad_norm": 4.638775825500488,
+      "learning_rate": 1.937622364140338e-06,
+      "loss": 0.0242,
+      "num_input_tokens_seen": 718192,
+      "step": 113
+    },
+    {
+      "epoch": 2.9419354838709677,
+      "grad_norm": 6.185389995574951,
+      "learning_rate": 1.895195261000831e-06,
+      "loss": 0.0223,
+      "num_input_tokens_seen": 724832,
+      "step": 114
+    },
+    {
+      "epoch": 2.967741935483871,
+      "grad_norm": 3.262885332107544,
+      "learning_rate": 1.852952387243698e-06,
+      "loss": 0.0263,
+      "num_input_tokens_seen": 731312,
+      "step": 115
+    },
+    {
+      "epoch": 2.9935483870967743,
+      "grad_norm": 0.28118520975112915,
+      "learning_rate": 1.8109066104575023e-06,
+      "loss": 0.0014,
+      "num_input_tokens_seen": 737488,
+      "step": 116
+    },
+    {
+      "epoch": 3.0193548387096776,
+      "grad_norm": 0.9135170578956604,
+      "learning_rate": 1.7690707381931585e-06,
+      "loss": 0.0061,
+      "num_input_tokens_seen": 743760,
+      "step": 117
+    },
+    {
+      "epoch": 3.0451612903225804,
+      "grad_norm": 2.3123724460601807,
+      "learning_rate": 1.7274575140626318e-06,
+      "loss": 0.0296,
+      "num_input_tokens_seen": 750048,
+      "step": 118
+    },
+    {
+      "epoch": 3.0709677419354837,
+      "grad_norm": 0.6837524771690369,
+      "learning_rate": 1.686079613857109e-06,
+      "loss": 0.0186,
+      "num_input_tokens_seen": 756400,
+      "step": 119
+    },
+    {
+      "epoch": 3.096774193548387,
+      "grad_norm": 1.3550941944122314,
+      "learning_rate": 1.6449496416858285e-06,
+      "loss": 0.0038,
+      "num_input_tokens_seen": 762432,
+      "step": 120
+    },
+    {
+      "epoch": 3.1225806451612903,
+      "grad_norm": 1.2603812217712402,
+      "learning_rate": 1.6040801261367494e-06,
+      "loss": 0.0033,
+      "num_input_tokens_seen": 768688,
+      "step": 121
+    },
+    {
+      "epoch": 3.1483870967741936,
+      "grad_norm": 2.1692001819610596,
+      "learning_rate": 1.56348351646022e-06,
+      "loss": 0.0091,
+      "num_input_tokens_seen": 775024,
+      "step": 122
+    },
+    {
+      "epoch": 3.174193548387097,
+      "grad_norm": 0.3110519349575043,
+      "learning_rate": 1.5231721787768162e-06,
+      "loss": 0.0012,
+      "num_input_tokens_seen": 781360,
+      "step": 123
+    },
+    {
+      "epoch": 3.2,
+      "grad_norm": 1.8163748979568481,
+      "learning_rate": 1.4831583923105e-06,
+      "loss": 0.0223,
+      "num_input_tokens_seen": 787888,
+      "step": 124
+    },
+    {
+      "epoch": 3.225806451612903,
+      "grad_norm": 3.2385294437408447,
+      "learning_rate": 1.443454345648252e-06,
+      "loss": 0.0131,
+      "num_input_tokens_seen": 794112,
+      "step": 125
+    },
+    {
+      "epoch": 3.2516129032258063,
+      "grad_norm": 0.23872306942939758,
+      "learning_rate": 1.4040721330273063e-06,
+      "loss": 0.0008,
+      "num_input_tokens_seen": 800384,
+      "step": 126
+    },
+    {
+      "epoch": 3.2774193548387096,
+      "grad_norm": 2.089226722717285,
+      "learning_rate": 1.3650237506511333e-06,
+      "loss": 0.0058,
+      "num_input_tokens_seen": 806848,
+      "step": 127
+    },
+    {
+      "epoch": 3.303225806451613,
+      "grad_norm": 4.151247501373291,
+      "learning_rate": 1.3263210930352737e-06,
+      "loss": 0.0065,
+      "num_input_tokens_seen": 813136,
+      "step": 128
+    },
+    {
+      "epoch": 3.329032258064516,
+      "grad_norm": 3.59883189201355,
+      "learning_rate": 1.2879759493841577e-06,
+      "loss": 0.0398,
+      "num_input_tokens_seen": 819504,
+      "step": 129
+    },
+    {
+      "epoch": 3.3548387096774195,
+      "grad_norm": 0.13131457567214966,
+      "learning_rate": 1.2500000000000007e-06,
+      "loss": 0.0005,
+      "num_input_tokens_seen": 825936,
+      "step": 130
+    },
+    {
+      "epoch": 3.3806451612903228,
+      "grad_norm": 0.9149203896522522,
+      "learning_rate": 1.2124048127248644e-06,
+      "loss": 0.0049,
+      "num_input_tokens_seen": 832496,
+      "step": 131
+    },
+    {
+      "epoch": 3.4064516129032256,
+      "grad_norm": 1.6843948364257812,
+      "learning_rate": 1.1752018394169882e-06,
+      "loss": 0.0061,
+      "num_input_tokens_seen": 838864,
+      "step": 132
+    },
+    {
+      "epoch": 3.432258064516129,
+      "grad_norm": 1.2536215782165527,
+      "learning_rate": 1.1384024124624324e-06,
+      "loss": 0.0111,
+      "num_input_tokens_seen": 845504,
+      "step": 133
+    },
+    {
+      "epoch": 3.458064516129032,
+      "grad_norm": 1.0523045063018799,
+      "learning_rate": 1.1020177413231334e-06,
+      "loss": 0.0049,
+      "num_input_tokens_seen": 851888,
+      "step": 134
+    },
+    {
+      "epoch": 3.4838709677419355,
+      "grad_norm": 0.698330819606781,
+      "learning_rate": 1.0660589091223854e-06,
+      "loss": 0.0012,
+      "num_input_tokens_seen": 858144,
+      "step": 135
+    },
+    {
+      "epoch": 3.509677419354839,
+      "grad_norm": 0.35953453183174133,
+      "learning_rate": 1.0305368692688175e-06,
+      "loss": 0.0004,
+      "num_input_tokens_seen": 864496,
+      "step": 136
+    },
+    {
+      "epoch": 3.535483870967742,
+      "grad_norm": 0.17629964649677277,
+      "learning_rate": 9.95462442119879e-07,
+      "loss": 0.0006,
+      "num_input_tokens_seen": 870672,
+      "step": 137
+    },
+    {
+      "epoch": 3.5612903225806454,
+      "grad_norm": 0.060391154140233994,
+      "learning_rate": 9.608463116858544e-07,
+      "loss": 0.0003,
+      "num_input_tokens_seen": 876944,
+      "step": 138
+    },
+    {
+      "epoch": 3.587096774193548,
+      "grad_norm": 0.08453088998794556,
+      "learning_rate": 9.266990223754069e-07,
+      "loss": 0.0004,
+      "num_input_tokens_seen": 883488,
+      "step": 139
+    },
+    {
+      "epoch": 3.6129032258064515,
+      "grad_norm": 0.6224934458732605,
+      "learning_rate": 8.930309757836517e-07,
+      "loss": 0.0016,
+      "num_input_tokens_seen": 889824,
+      "step": 140
+    },
+    {
+      "epoch": 3.638709677419355,
+      "grad_norm": 2.8432862758636475,
+      "learning_rate": 8.598524275237321e-07,
+      "loss": 0.0268,
+      "num_input_tokens_seen": 896176,
+      "step": 141
+    },
+    {
+      "epoch": 3.664516129032258,
+      "grad_norm": 0.6191421747207642,
+      "learning_rate": 8.271734841028553e-07,
+      "loss": 0.0018,
+      "num_input_tokens_seen": 902272,
+      "step": 142
+    },
+    {
+      "epoch": 3.6903225806451614,
+      "grad_norm": 1.3128641843795776,
+      "learning_rate": 7.950040998437541e-07,
+      "loss": 0.01,
+      "num_input_tokens_seen": 908512,
+      "step": 143
+    },
+    {
+      "epoch": 3.7161290322580647,
+      "grad_norm": 1.9438813924789429,
+      "learning_rate": 7.633540738525066e-07,
+      "loss": 0.0209,
+      "num_input_tokens_seen": 915152,
+      "step": 144
+    },
+    {
+      "epoch": 3.741935483870968,
+      "grad_norm": 1.1845624446868896,
+      "learning_rate": 7.322330470336314e-07,
+      "loss": 0.0076,
+      "num_input_tokens_seen": 921552,
+      "step": 145
+    },
+    {
+      "epoch": 3.767741935483871,
+      "grad_norm": 4.526978492736816,
+      "learning_rate": 7.016504991533727e-07,
+      "loss": 0.0227,
+      "num_input_tokens_seen": 928048,
+      "step": 146
+    },
+    {
+      "epoch": 3.793548387096774,
+      "grad_norm": 0.03266080841422081,
+      "learning_rate": 6.716157459520739e-07,
+      "loss": 0.0002,
+      "num_input_tokens_seen": 934512,
+      "step": 147
+    },
+    {
+      "epoch": 3.8193548387096774,
+      "grad_norm": 5.138983249664307,
+      "learning_rate": 6.421379363065142e-07,
+      "loss": 0.0296,
+      "num_input_tokens_seen": 940816,
+      "step": 148
+    },
+    {
+      "epoch": 3.8451612903225807,
+      "grad_norm": 0.3178328275680542,
+      "learning_rate": 6.1322604944307e-07,
+      "loss": 0.0006,
+      "num_input_tokens_seen": 946992,
+      "step": 149
+    },
+    {
+      "epoch": 3.870967741935484,
+      "grad_norm": 1.1145384311676025,
+      "learning_rate": 5.848888922025553e-07,
+      "loss": 0.0012,
+      "num_input_tokens_seen": 953424,
+      "step": 150
+    },
+    {
+      "epoch": 3.896774193548387,
+      "grad_norm": 0.23422469198703766,
+      "learning_rate": 5.571350963575728e-07,
+      "loss": 0.0007,
+      "num_input_tokens_seen": 959616,
+      "step": 151
+    },
+    {
+      "epoch": 3.9225806451612906,
+      "grad_norm": 0.09516251087188721,
+      "learning_rate": 5.299731159831953e-07,
+      "loss": 0.0003,
+      "num_input_tokens_seen": 966096,
+      "step": 152
+    },
+    {
+      "epoch": 3.9483870967741934,
+      "grad_norm": 0.3407827317714691,
+      "learning_rate": 5.034112248817685e-07,
+      "loss": 0.0005,
+      "num_input_tokens_seen": 972368,
+      "step": 153
+    },
+    {
+      "epoch": 3.9741935483870967,
+      "grad_norm": 0.2334306687116623,
+      "learning_rate": 4.774575140626317e-07,
+      "loss": 0.0008,
+      "num_input_tokens_seen": 978848,
+      "step": 154
+    },
+    {
+      "epoch": 4.0,
+      "grad_norm": 0.10143516212701797,
+      "learning_rate": 4.5211988927752026e-07,
+      "loss": 0.0003,
+      "num_input_tokens_seen": 985520,
+      "step": 155
+    },
+    {
+      "epoch": 4.025806451612903,
+      "grad_norm": 0.25746700167655945,
+      "learning_rate": 4.27406068612396e-07,
+      "loss": 0.0015,
+      "num_input_tokens_seen": 991904,
+      "step": 156
+    },
+    {
+      "epoch": 4.051612903225807,
+      "grad_norm": 0.22239096462726593,
+      "learning_rate": 4.033235801364402e-07,
+      "loss": 0.0007,
+      "num_input_tokens_seen": 998288,
+      "step": 157
+    },
+    {
+      "epoch": 4.077419354838709,
+      "grad_norm": 0.05284583568572998,
+      "learning_rate": 3.798797596089351e-07,
+      "loss": 0.0002,
+      "num_input_tokens_seen": 1004432,
+      "step": 158
+    },
+    {
+      "epoch": 4.103225806451613,
+      "grad_norm": 1.299528956413269,
+      "learning_rate": 3.5708174824471947e-07,
+      "loss": 0.0052,
+      "num_input_tokens_seen": 1010608,
+      "step": 159
+    },
+    {
+      "epoch": 4.129032258064516,
+      "grad_norm": 1.0830060243606567,
+      "learning_rate": 3.3493649053890325e-07,
+      "loss": 0.004,
+      "num_input_tokens_seen": 1016848,
+      "step": 160
+    },
+    {
+      "epoch": 4.15483870967742,
+      "grad_norm": 0.16024000942707062,
+      "learning_rate": 3.134507321515107e-07,
+      "loss": 0.0004,
+      "num_input_tokens_seen": 1023360,
+      "step": 161
+    },
+    {
+      "epoch": 4.180645161290323,
+      "grad_norm": 0.6330615878105164,
+      "learning_rate": 2.9263101785268253e-07,
+      "loss": 0.002,
+      "num_input_tokens_seen": 1029808,
+      "step": 162
+    },
+    {
+      "epoch": 4.2064516129032254,
+      "grad_norm": 0.03194880485534668,
+      "learning_rate": 2.7248368952908055e-07,
+      "loss": 0.0001,
+      "num_input_tokens_seen": 1036080,
+      "step": 163
+    },
+    {
+      "epoch": 4.232258064516129,
+      "grad_norm": 0.02812141925096512,
+      "learning_rate": 2.53014884252083e-07,
+      "loss": 0.0001,
+      "num_input_tokens_seen": 1042240,
+      "step": 164
+    },
+    {
+      "epoch": 4.258064516129032,
+      "grad_norm": 0.029427967965602875,
+      "learning_rate": 2.3423053240837518e-07,
+      "loss": 0.0002,
+      "num_input_tokens_seen": 1048672,
+      "step": 165
+    },
+    {
+      "epoch": 4.283870967741936,
+      "grad_norm": 2.0345771312713623,
+      "learning_rate": 2.1613635589349756e-07,
+      "loss": 0.0076,
+      "num_input_tokens_seen": 1054832,
+      "step": 166
+    },
+    {
+      "epoch": 4.309677419354839,
+      "grad_norm": 0.02240203320980072,
+      "learning_rate": 1.9873786636889908e-07,
+      "loss": 0.0001,
+      "num_input_tokens_seen": 1061312,
+      "step": 167
+    },
+    {
+      "epoch": 4.335483870967742,
+      "grad_norm": 0.08536162972450256,
+      "learning_rate": 1.8204036358303173e-07,
+      "loss": 0.0002,
+      "num_input_tokens_seen": 1067488,
+      "step": 168
+    },
+    {
+      "epoch": 4.361290322580645,
+      "grad_norm": 0.0193481482565403,
+      "learning_rate": 1.6604893375699594e-07,
+      "loss": 0.0001,
+      "num_input_tokens_seen": 1073648,
+      "step": 169
+    },
+    {
+      "epoch": 4.387096774193548,
+      "grad_norm": 0.021560601890087128,
+      "learning_rate": 1.507684480352292e-07,
+      "loss": 0.0001,
+      "num_input_tokens_seen": 1080160,
+      "step": 170
+    },
+    {
+      "epoch": 4.412903225806452,
+      "grad_norm": 0.03216614946722984,
+      "learning_rate": 1.362035610017079e-07,
+      "loss": 0.0002,
+      "num_input_tokens_seen": 1086832,
+      "step": 171
+    },
+    {
+      "epoch": 4.438709677419355,
+      "grad_norm": 0.04035123065114021,
+      "learning_rate": 1.223587092621162e-07,
+      "loss": 0.0001,
+      "num_input_tokens_seen": 1093184,
+      "step": 172
+    },
+    {
+      "epoch": 4.464516129032258,
+      "grad_norm": 0.17049850523471832,
+      "learning_rate": 1.0923811009241142e-07,
+      "loss": 0.0005,
+      "num_input_tokens_seen": 1099728,
+      "step": 173
+    },
+    {
+      "epoch": 4.490322580645161,
+      "grad_norm": 0.02470760978758335,
+      "learning_rate": 9.684576015420277e-08,
+      "loss": 0.0001,
+      "num_input_tokens_seen": 1106032,
+      "step": 174
+    },
+    {
+      "epoch": 4.516129032258064,
+      "grad_norm": 0.009991397149860859,
+      "learning_rate": 8.518543427732951e-08,
+      "loss": 0.0001,
+      "num_input_tokens_seen": 1112496,
+      "step": 175
+    },
+    {
+      "epoch": 4.541935483870968,
+      "grad_norm": 1.3486413955688477,
+      "learning_rate": 7.426068431000883e-08,
+      "loss": 0.0081,
+      "num_input_tokens_seen": 1119152,
+      "step": 176
+    },
+    {
+      "epoch": 4.567741935483871,
+      "grad_norm": 0.04406896233558655,
+      "learning_rate": 6.407483803691216e-08,
+      "loss": 0.0002,
+      "num_input_tokens_seen": 1125360,
+      "step": 177
+    },
+    {
+      "epoch": 4.593548387096774,
+      "grad_norm": 0.07763337343931198,
+      "learning_rate": 5.463099816548578e-08,
+      "loss": 0.0003,
+      "num_input_tokens_seen": 1131824,
+      "step": 178
+    },
+    {
+      "epoch": 4.619354838709677,
+      "grad_norm": 0.028237691149115562,
+      "learning_rate": 4.593204138084006e-08,
+      "loss": 0.0001,
+      "num_input_tokens_seen": 1138224,
+      "step": 179
+    },
+    {
+      "epoch": 4.645161290322581,
+      "grad_norm": 0.12385120242834091,
+      "learning_rate": 3.798061746947995e-08,
+      "loss": 0.0005,
+      "num_input_tokens_seen": 1144528,
+      "step": 180
+    },
+    {
+      "epoch": 4.670967741935484,
+      "grad_norm": 0.033041104674339294,
+      "learning_rate": 3.077914851215585e-08,
+      "loss": 0.0001,
+      "num_input_tokens_seen": 1150880,
+      "step": 181
+    },
+    {
+      "epoch": 4.6967741935483875,
+      "grad_norm": 0.025356203317642212,
+      "learning_rate": 2.4329828146074096e-08,
+      "loss": 0.0002,
+      "num_input_tokens_seen": 1157184,
+      "step": 182
+    },
+    {
+      "epoch": 4.72258064516129,
+      "grad_norm": 0.021917220205068588,
+      "learning_rate": 1.8634620896695044e-08,
+      "loss": 0.0001,
+      "num_input_tokens_seen": 1163536,
+      "step": 183
+    },
+    {
+      "epoch": 4.748387096774193,
+      "grad_norm": 0.05064333602786064,
+      "learning_rate": 1.3695261579316776e-08,
+      "loss": 0.0002,
+      "num_input_tokens_seen": 1169888,
+      "step": 184
+    },
+    {
+      "epoch": 4.774193548387097,
+      "grad_norm": 0.07646457105875015,
+      "learning_rate": 9.513254770636138e-09,
+      "loss": 0.0002,
+      "num_input_tokens_seen": 1176400,
+      "step": 185
+    },
+    {
+      "epoch": 4.8,
+      "grad_norm": 0.02895214594900608,
+      "learning_rate": 6.089874350439507e-09,
+      "loss": 0.0002,
+      "num_input_tokens_seen": 1182608,
+      "step": 186
+    },
+    {
+      "epoch": 4.825806451612904,
+      "grad_norm": 0.015325246378779411,
+      "learning_rate": 3.4261631135654174e-09,
+      "loss": 0.0001,
+      "num_input_tokens_seen": 1189008,
+      "step": 187
+    },
+    {
+      "epoch": 4.851612903225806,
+      "grad_norm": 0.159898042678833,
+      "learning_rate": 1.5229324522605949e-09,
+      "loss": 0.0004,
+      "num_input_tokens_seen": 1195280,
+      "step": 188
+    },
+    {
+      "epoch": 4.877419354838709,
+      "grad_norm": 0.4591263234615326,
+      "learning_rate": 3.8076210902182607e-10,
+      "loss": 0.0013,
+      "num_input_tokens_seen": 1201456,
+      "step": 189
+    },
+    {
+      "epoch": 4.903225806451613,
+      "grad_norm": 0.39459678530693054,
+      "learning_rate": 0.0,
+      "loss": 0.0008,
+      "num_input_tokens_seen": 1207760,
+      "step": 190
+    },
+    {
+      "epoch": 4.903225806451613,
+      "num_input_tokens_seen": 1207760,
+      "step": 190,
+      "total_flos": 5.438488809413018e+16,
+      "train_loss": 0.49016160156086125,
+      "train_runtime": 2575.226,
+      "train_samples_per_second": 9.626,
+      "train_steps_per_second": 0.074
+    }
+  ],
+  "logging_steps": 1,
+  "max_steps": 190,
+  "num_input_tokens_seen": 1207760,
+  "num_train_epochs": 5,
+  "save_steps": 1000,
+  "stateful_callbacks": {
+    "TrainerControl": {
+      "args": {
+        "should_epoch_stop": false,
+        "should_evaluate": false,
+        "should_log": false,
+        "should_save": true,
+        "should_training_stop": true
+      },
+      "attributes": {}
+    }
+  },
+  "total_flos": 5.438488809413018e+16,
+  "train_batch_size": 2,
+  "trial_name": null,
+  "trial_params": null
+}

training_args.bin ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:b5ec177d398d6cb226db1b1f630ec171ad7ecc41028ab76df8127e78e197e7c2
+size 6584