Upload folder using huggingface_hub

Browse files

Files changed (15) hide show

README.md +76 -0
config.json +39 -0
huggingface-metadata.txt +35 -0
measurement.json +0 -0
model.safetensors.index.json +1 -0
output-00001-of-00007.safetensors +3 -0
output-00002-of-00007.safetensors +3 -0
output-00003-of-00007.safetensors +3 -0
output-00004-of-00007.safetensors +3 -0
output-00005-of-00007.safetensors +3 -0
output-00006-of-00007.safetensors +3 -0
output-00007-of-00007.safetensors +3 -0
special_tokens_map.json +20 -0
tokenizer.json +0 -0
tokenizer_config.json +51 -0

README.md ADDED Viewed

	@@ -0,0 +1,76 @@

+---
+base_model:
+- EVA-UNIT-01/EVA-Qwen2.5-72B-v0.2
+- Sao10K/72B-Qwen2.5-Kunou-v1
+- anthracite-org/magnum-v4-72b
+- allura-org/Qwen2.5-72b-RP-Ink
+- migtissera/Tess-v2.5.2-Qwen2-72B
+library_name: transformers
+tags:
+- mergekit
+- merge
+language:
+- en
+---
+# Chuluun-Qwen2.5-72B-v0.08
+![image/png](https://huggingface.co/DatToad/Chuluun-Qwen2.5-72B-v0.08/resolve/main/Chuluun8-2.png)
+This is a merge of pre-trained language models created using [mergekit](https://github.com/cg123/mergekit).
+I re-ran the original Chuluun formula including the newly released Ink from Allura-Org.  I've found the addition gives the model a lot more variability, likely because of aggressive de-slop applied to its dataset. Sometimes this means a word choice will be strange and you'll want to manually edit when needed, but it means you'll see less ministrations sparkling with mischief.
+Because of this the best way to approach the model is to run multiple regens and choose the one you like, edit mercilessly, and continue.  Like the original Chuluun this variant is very steerable for complex storywriting and RP.  It's probably also a little spicier than v0.01 with both Magnum and whatever the heck Fizz threw into the data for Ink.
+I've also been hearing praise for a level of character intelligence not seen in other models, including Largestral finetunes and merges.  I'm not about to say any model of mine is smarter because it was a dumb idea to use Tess as the base and it somehow worked.
+# Tips for effective use
+As with all writing-focused models balancing intelligence with creativity is tricky.  If this one seems like it understands some details but not others try v0.01, overall I think this model is more creative but a little less coherent.  If v0.08 is a little too chaotic for your tastes consider running v0.01 at first and switch to this model mid-story if it gets stale.
+All the models within the merge use ChatML format so you'll want to use it too.  Use [Konnect's Qwenception](https://huggingface.co/Konnect1221/The-Inception-Presets-Methception-LLamaception-Qwenception) prompt or whatever you prefer, it seems to do fine with any decent sysprompt.  Lower temps are suggested than with v0.01 because of Ink's de-slop dataset, testers reported anywhere between 1 and 1.2 as a baseline but plan to adjust to taste.  Consider dynatemp for this model as well.  If dialogue gets repetitive at all that's usually a sign you need more temp.
+## Merge Details
+### Merge Method
+This model was merged using the [Model Stock](https://arxiv.org/abs/2403.19522) merge method using migtissera/Tess-v2.5.2-Qwen2-72B as a base.
+### Models Merged
+The following models were included in the merge:
+* EVA-UNIT-01/EVA-Qwen2.5-72B-v0.2
+* Sao10K/72B-Qwen2.5-Kunou-v1
+* anthracite-org/magnum-v4-72b
+* allura-org/Qwen2.5-72b-RP-Ink
+### Configuration
+The following YAML configuration was used to produce this model:
+```yaml
+models:
+- model: EVA-UNIT-01/EVA-Qwen2.5-72B-v0.2
+- model: Sao10K/72B-Qwen2.5-Kunou-v1
+- model: anthracite-org/magnum-v4-72b
+- model: allura-org/Qwen2.5-72b-RP-Ink
+merge_method: model_stock
+base_model: migtissera/Tess-v2.5.2-Qwen2-72B
+parameters:
+  filter_wise: false
+dytpe: float16
+name: DatToad/Chuluun-Qwen2.5-72B-v0.08
+```
+### Thank Yous!
+Credit as always to the people who make the finetunes that go into this - they do the hard work, I just throw them in the blender!  Most of them have Ko-fis, training isn't cheap and their time is valuable too.  Special thanks to these contributors:
+- Everyone in Allura-Org and friends in Discord, for the EVA and Ink models, as well as all their support and mentoring that gave me the knowledge that makes merges like this possible.
+- Testers Geeechan and CURSE for invaluable feedback especially on optimal settings
+- Quant support from scene legends Bartowski and MikeRoz
+- All of you that have encouraged me and sent thanks and appreciation for this work.  It wouldn't mean very much to me to keep this to myself.

config.json ADDED Viewed

	@@ -0,0 +1,39 @@

+{
+    "_name_or_path": "C:\\FP16\\Tess",
+    "architectures": [
+        "Qwen2ForCausalLM"
+    ],
+    "attention_dropout": 0.0,
+    "eos_token_id": 151645,
+    "hidden_act": "silu",
+    "hidden_size": 8192,
+    "initializer_range": 0.02,
+    "intermediate_size": 29568,
+    "max_position_embeddings": 131072,
+    "max_window_layers": 80,
+    "model_type": "qwen2",
+    "num_attention_heads": 64,
+    "num_hidden_layers": 80,
+    "num_key_value_heads": 8,
+    "rms_norm_eps": 1e-05,
+    "rope_scaling": null,
+    "rope_theta": 1000000.0,
+    "sliding_window": null,
+    "tie_word_embeddings": false,
+    "torch_dtype": "bfloat16",
+    "transformers_version": "4.47.1",
+    "use_cache": false,
+    "use_sliding_window": false,
+    "vocab_size": 152064,
+    "quantization_config": {
+        "quant_method": "exl2",
+        "version": "0.2.7",
+        "bits": 6.0,
+        "head_bits": 6,
+        "calibration": {
+            "rows": 115,
+            "length": 2048,
+            "dataset": "(default)"
+        }
+    }
+}

huggingface-metadata.txt ADDED Viewed

	@@ -0,0 +1,35 @@

+url: https://huggingface.co/DatToad/Chuluun-Qwen2.5-72B-v0.08
+branch: main
+download date: 2025-01-18 20:11:03
+sha256sum:
+    57818a7f6166ad07f9744fc3c41fb8eab87f67fbbeed1b16eff3563c4ba39945 model-00001-of-00031.safetensors
+    1c8e389319e001d74b0bb605f158742ac6dfa7c2e922ce95425cc21ad4ada804 model-00002-of-00031.safetensors
+    c22ee3f30cb62466dec5da53c01071cdcb7eb8fcbccd568c0d5dc5321438b7af model-00003-of-00031.safetensors
+    2b0ff7f864ed36080a41e951c268aab8d0a93ed79d5650af6a42d14436d35a00 model-00004-of-00031.safetensors
+    012b931ac3688fde228002f2512847c1edf908bc7c544d950e6876917730fd6b model-00005-of-00031.safetensors
+    b6c1cce8ae77620ff7bef9fe77ecc11e35b72f601ed3d996eb2952c482f04e4d model-00006-of-00031.safetensors
+    3d77782f465107538c1ea3a367ec03247bcc7946ec7b15063d41b8a8a58cf0be model-00007-of-00031.safetensors
+    cd4eb0a4232cccdb41ea4487fb90160eb423de75e0dec88edf60fd29d737bb05 model-00008-of-00031.safetensors
+    0b6f15ba8906691673a3fecf027713917dac3a3a135567f0d737a71762565801 model-00009-of-00031.safetensors
+    ef697a00b8f27ace5e5c51dd08fa6c8c1bbf80e347eaa2f90805555255091c09 model-00010-of-00031.safetensors
+    d4d0eec9ef5d9f5e34d7b0291164d21d4bfd9dddf85e5f4028903ed02dee1669 model-00011-of-00031.safetensors
+    8d140dfa271d4b34e203bcffa3e38f646c95e1ef30c6e943d2ad4831152e2482 model-00012-of-00031.safetensors
+    caf263f9e3788c5922d6f35548a69dd1150bce9b0db89728371a89fd10274b46 model-00013-of-00031.safetensors
+    af3b81e32ee2b55e2ebdc5fa0c5231cb132bdff44ac1aef870edf7d398c11a4c model-00014-of-00031.safetensors
+    2e24bfe861b12f2589239ce080e2112cdfb3a26bbb37c6526c50b8079860cda3 model-00015-of-00031.safetensors
+    29e21d055ea919ca8856464992850dfb450e64ac7d00ce57ad3718e5a1540622 model-00016-of-00031.safetensors
+    7bef144025aecec5ebeab46b3ca6d4af8ed3bdb87e915c8878045d8638841ebb model-00017-of-00031.safetensors
+    b8849cc51a0efccbcf16095bf1a6da804dcecb76a36c3ac9c04b9ca351307e0f model-00018-of-00031.safetensors
+    d450868b54d442ced5f297f3d4db405cc36af0946220df96f72b7526882216f4 model-00019-of-00031.safetensors
+    c71efebdfd7ac5365244fd6256573e23b7c859230b66fe72ce31a33250c6eccf model-00020-of-00031.safetensors
+    fe86c647bf39a99cee6d3536906ec9fdd0beb6254bb3f2ea4132fb3b4aebaa65 model-00021-of-00031.safetensors
+    b6bcfe0cef8e791cec1ea50df022c5a19cd1b4281c7cc92a9a6668dee05136c5 model-00022-of-00031.safetensors
+    c851de5c81892be73d1a01112070e231643e2923810df1fb9aab3396fe5669ba model-00023-of-00031.safetensors
+    8b8438839d3c1bfc2271d04c1b0f90707b3f917e50f72504f8960f817f38b7e0 model-00024-of-00031.safetensors
+    972fead1bf90eb7df0bfa1b1c17b8f36600c25e02b276e58ffeb36ec7fbe831b model-00025-of-00031.safetensors
+    e49c8fb8ba3087d2ed29c7f40b54198b3e490fa9c3801bf576440d6ca4f77616 model-00026-of-00031.safetensors
+    4ccaab4aa685a995bc457310acc2a82405af89478ea5667616398dc4df4eee90 model-00027-of-00031.safetensors
+    578f58010930d5ffdbbb40fd785c3a7bc9f156bdd63e4b46860ba41d950eb987 model-00028-of-00031.safetensors
+    8207cf3800870a452a2f5d120a93aba6c372efd02b16f20dc7096d8c6fc3493b model-00029-of-00031.safetensors
+    84955fd5b33b740ebe583594e3466f3037d8b196cb19fba9c28ff1fa58610602 model-00030-of-00031.safetensors
+    a4004799de9f2878cf46786253d37bede82b02cfd31f86507b2d210b8e7ba6df model-00031-of-00031.safetensors

measurement.json ADDED Viewed

The diff for this file is too large to render. See raw diff

model.safetensors.index.json ADDED Viewed

	@@ -0,0 +1 @@

+ {"metadata": {"mergekit_version": "0.0.5.1", "total_size": 145412407296}, "weight_map": {"lm_head.weight": "model-00001-of-00031.safetensors", "model.embed_tokens.weight": "model-00001-of-00031.safetensors", "model.layers.0.input_layernorm.weight": "model-00001-of-00031.safetensors", "model.layers.0.mlp.down_proj.weight": "model-00002-of-00031.safetensors", "model.layers.0.mlp.gate_proj.weight": "model-00002-of-00031.safetensors", "model.layers.0.mlp.up_proj.weight": "model-00002-of-00031.safetensors", "model.layers.0.post_attention_layernorm.weight": "model-00002-of-00031.safetensors", "model.layers.0.self_attn.k_proj.bias": "model-00002-of-00031.safetensors", "model.layers.0.self_attn.k_proj.weight": "model-00002-of-00031.safetensors", "model.layers.0.self_attn.o_proj.weight": "model-00002-of-00031.safetensors", "model.layers.0.self_attn.q_proj.bias": "model-00002-of-00031.safetensors", "model.layers.0.self_attn.q_proj.weight": "model-00002-of-00031.safetensors", "model.layers.0.self_attn.v_proj.bias": "model-00002-of-00031.safetensors", "model.layers.0.self_attn.v_proj.weight": "model-00002-of-00031.safetensors", "model.layers.1.input_layernorm.weight": "model-00002-of-00031.safetensors", "model.layers.1.mlp.down_proj.weight": "model-00002-of-00031.safetensors", "model.layers.1.mlp.gate_proj.weight": "model-00002-of-00031.safetensors", "model.layers.1.mlp.up_proj.weight": "model-00002-of-00031.safetensors", "model.layers.1.post_attention_layernorm.weight": "model-00002-of-00031.safetensors", "model.layers.1.self_attn.k_proj.bias": "model-00002-of-00031.safetensors", "model.layers.1.self_attn.k_proj.weight": "model-00002-of-00031.safetensors", "model.layers.1.self_attn.o_proj.weight": "model-00002-of-00031.safetensors", "model.layers.1.self_attn.q_proj.bias": "model-00002-of-00031.safetensors", "model.layers.1.self_attn.q_proj.weight": "model-00002-of-00031.safetensors", "model.layers.1.self_attn.v_proj.bias": "model-00002-of-00031.safetensors", "model.layers.1.self_attn.v_proj.weight": "model-00002-of-00031.safetensors", "model.layers.10.input_layernorm.weight": "model-00002-of-00031.safetensors", "model.layers.10.mlp.down_proj.weight": "model-00002-of-00031.safetensors", "model.layers.10.mlp.gate_proj.weight": "model-00002-of-00031.safetensors", "model.layers.10.mlp.up_proj.weight": "model-00002-of-00031.safetensors", "model.layers.10.post_attention_layernorm.weight": "model-00002-of-00031.safetensors", "model.layers.10.self_attn.k_proj.bias": "model-00002-of-00031.safetensors", "model.layers.10.self_attn.k_proj.weight": "model-00002-of-00031.safetensors", "model.layers.10.self_attn.o_proj.weight": "model-00003-of-00031.safetensors", "model.layers.10.self_attn.q_proj.bias": "model-00003-of-00031.safetensors", "model.layers.10.self_attn.q_proj.weight": "model-00003-of-00031.safetensors", "model.layers.10.self_attn.v_proj.bias": "model-00003-of-00031.safetensors", "model.layers.10.self_attn.v_proj.weight": "model-00003-of-00031.safetensors", "model.layers.11.input_layernorm.weight": "model-00003-of-00031.safetensors", "model.layers.11.mlp.down_proj.weight": "model-00003-of-00031.safetensors", "model.layers.11.mlp.gate_proj.weight": "model-00003-of-00031.safetensors", "model.layers.11.mlp.up_proj.weight": "model-00003-of-00031.safetensors", "model.layers.11.post_attention_layernorm.weight": "model-00003-of-00031.safetensors", "model.layers.11.self_attn.k_proj.bias": "model-00003-of-00031.safetensors", "model.layers.11.self_attn.k_proj.weight": "model-00003-of-00031.safetensors", "model.layers.11.self_attn.o_proj.weight": "model-00003-of-00031.safetensors", "model.layers.11.self_attn.q_proj.bias": "model-00003-of-00031.safetensors", "model.layers.11.self_attn.q_proj.weight": "model-00003-of-00031.safetensors", "model.layers.11.self_attn.v_proj.bias": "model-00003-of-00031.safetensors", "model.layers.11.self_attn.v_proj.weight": "model-00003-of-00031.safetensors", "model.layers.12.input_layernorm.weight": "model-00003-of-00031.safetensors", "model.layers.12.mlp.down_proj.weight": "model-00003-of-00031.safetensors", "model.layers.12.mlp.gate_proj.weight": "model-00003-of-00031.safetensors", "model.layers.12.mlp.up_proj.weight": "model-00003-of-00031.safetensors", "model.layers.12.post_attention_layernorm.weight": "model-00003-of-00031.safetensors", "model.layers.12.self_attn.k_proj.bias": "model-00003-of-00031.safetensors", "model.layers.12.self_attn.k_proj.weight": "model-00003-of-00031.safetensors", "model.layers.12.self_attn.o_proj.weight": "model-00003-of-00031.safetensors", "model.layers.12.self_attn.q_proj.bias": "model-00003-of-00031.safetensors", "model.layers.12.self_attn.q_proj.weight": "model-00003-of-00031.safetensors", "model.layers.12.self_attn.v_proj.bias": "model-00003-of-00031.safetensors", "model.layers.12.self_attn.v_proj.weight": "model-00003-of-00031.safetensors", "model.layers.13.input_layernorm.weight": "model-00003-of-00031.safetensors", "model.layers.13.mlp.down_proj.weight": "model-00003-of-00031.safetensors", "model.layers.13.mlp.gate_proj.weight": "model-00003-of-00031.safetensors", "model.layers.13.mlp.up_proj.weight": "model-00004-of-00031.safetensors", "model.layers.13.post_attention_layernorm.weight": "model-00004-of-00031.safetensors", "model.layers.13.self_attn.k_proj.bias": "model-00004-of-00031.safetensors", "model.layers.13.self_attn.k_proj.weight": "model-00004-of-00031.safetensors", "model.layers.13.self_attn.o_proj.weight": "model-00004-of-00031.safetensors", "model.layers.13.self_attn.q_proj.bias": "model-00004-of-00031.safetensors", "model.layers.13.self_attn.q_proj.weight": "model-00004-of-00031.safetensors", "model.layers.13.self_attn.v_proj.bias": "model-00004-of-00031.safetensors", "model.layers.13.self_attn.v_proj.weight": "model-00004-of-00031.safetensors", "model.layers.14.input_layernorm.weight": "model-00004-of-00031.safetensors", "model.layers.14.mlp.down_proj.weight": "model-00004-of-00031.safetensors", "model.layers.14.mlp.gate_proj.weight": "model-00004-of-00031.safetensors", "model.layers.14.mlp.up_proj.weight": "model-00004-of-00031.safetensors", "model.layers.14.post_attention_layernorm.weight": "model-00004-of-00031.safetensors", "model.layers.14.self_attn.k_proj.bias": "model-00004-of-00031.safetensors", "model.layers.14.self_attn.k_proj.weight": "model-00004-of-00031.safetensors", "model.layers.14.self_attn.o_proj.weight": "model-00004-of-00031.safetensors", "model.layers.14.self_attn.q_proj.bias": "model-00004-of-00031.safetensors", "model.layers.14.self_attn.q_proj.weight": "model-00004-of-00031.safetensors", "model.layers.14.self_attn.v_proj.bias": "model-00004-of-00031.safetensors", "model.layers.14.self_attn.v_proj.weight": "model-00004-of-00031.safetensors", "model.layers.15.input_layernorm.weight": "model-00004-of-00031.safetensors", "model.layers.15.mlp.down_proj.weight": "model-00004-of-00031.safetensors", "model.layers.15.mlp.gate_proj.weight": "model-00004-of-00031.safetensors", "model.layers.15.mlp.up_proj.weight": "model-00004-of-00031.safetensors", "model.layers.15.post_attention_layernorm.weight": "model-00004-of-00031.safetensors", "model.layers.15.self_attn.k_proj.bias": "model-00004-of-00031.safetensors", "model.layers.15.self_attn.k_proj.weight": "model-00004-of-00031.safetensors", "model.layers.15.self_attn.o_proj.weight": "model-00004-of-00031.safetensors", "model.layers.15.self_attn.q_proj.bias": "model-00004-of-00031.safetensors", "model.layers.15.self_attn.q_proj.weight": "model-00004-of-00031.safetensors", "model.layers.15.self_attn.v_proj.bias": "model-00004-of-00031.safetensors", "model.layers.15.self_attn.v_proj.weight": "model-00004-of-00031.safetensors", "model.layers.16.input_layernorm.weight": "model-00004-of-00031.safetensors", "model.layers.16.mlp.down_proj.weight": "model-00004-of-00031.safetensors", "model.layers.16.mlp.gate_proj.weight": "model-00005-of-00031.safetensors", "model.layers.16.mlp.up_proj.weight": "model-00005-of-00031.safetensors", "model.layers.16.post_attention_layernorm.weight": "model-00005-of-00031.safetensors", "model.layers.16.self_attn.k_proj.bias": "model-00005-of-00031.safetensors", "model.layers.16.self_attn.k_proj.weight": "model-00005-of-00031.safetensors", "model.layers.16.self_attn.o_proj.weight": "model-00005-of-00031.safetensors", "model.layers.16.self_attn.q_proj.bias": "model-00005-of-00031.safetensors", "model.layers.16.self_attn.q_proj.weight": "model-00005-of-00031.safetensors", "model.layers.16.self_attn.v_proj.bias": "model-00005-of-00031.safetensors", "model.layers.16.self_attn.v_proj.weight": "model-00005-of-00031.safetensors", "model.layers.17.input_layernorm.weight": "model-00005-of-00031.safetensors", "model.layers.17.mlp.down_proj.weight": "model-00005-of-00031.safetensors", "model.layers.17.mlp.gate_proj.weight": "model-00005-of-00031.safetensors", "model.layers.17.mlp.up_proj.weight": "model-00005-of-00031.safetensors", "model.layers.17.post_attention_layernorm.weight": "model-00005-of-00031.safetensors", "model.layers.17.self_attn.k_proj.bias": "model-00005-of-00031.safetensors", "model.layers.17.self_attn.k_proj.weight": "model-00005-of-00031.safetensors", "model.layers.17.self_attn.o_proj.weight": "model-00005-of-00031.safetensors", "model.layers.17.self_attn.q_proj.bias": "model-00005-of-00031.safetensors", "model.layers.17.self_attn.q_proj.weight": "model-00005-of-00031.safetensors", "model.layers.17.self_attn.v_proj.bias": "model-00005-of-00031.safetensors", "model.layers.17.self_attn.v_proj.weight": "model-00005-of-00031.safetensors", "model.layers.18.input_layernorm.weight": "model-00005-of-00031.safetensors", "model.layers.18.mlp.down_proj.weight": "model-00005-of-00031.safetensors", "model.layers.18.mlp.gate_proj.weight": "model-00005-of-00031.safetensors", "model.layers.18.mlp.up_proj.weight": "model-00005-of-00031.safetensors", "model.layers.18.post_attention_layernorm.weight": "model-00005-of-00031.safetensors", "model.layers.18.self_attn.k_proj.bias": "model-00005-of-00031.safetensors", "model.layers.18.self_attn.k_proj.weight": "model-00005-of-00031.safetensors", "model.layers.18.self_attn.o_proj.weight": "model-00005-of-00031.safetensors", "model.layers.18.self_attn.q_proj.bias": "model-00005-of-00031.safetensors", "model.layers.18.self_attn.q_proj.weight": "model-00005-of-00031.safetensors", "model.layers.18.self_attn.v_proj.bias": "model-00005-of-00031.safetensors", "model.layers.18.self_attn.v_proj.weight": "model-00005-of-00031.safetensors", "model.layers.19.input_layernorm.weight": "model-00005-of-00031.safetensors", "model.layers.19.mlp.down_proj.weight": "model-00006-of-00031.safetensors", "model.layers.19.mlp.gate_proj.weight": "model-00006-of-00031.safetensors", "model.layers.19.mlp.up_proj.weight": "model-00006-of-00031.safetensors", "model.layers.19.post_attention_layernorm.weight": "model-00006-of-00031.safetensors", "model.layers.19.self_attn.k_proj.bias": "model-00006-of-00031.safetensors", "model.layers.19.self_attn.k_proj.weight": "model-00006-of-00031.safetensors", "model.layers.19.self_attn.o_proj.weight": "model-00006-of-00031.safetensors", "model.layers.19.self_attn.q_proj.bias": "model-00006-of-00031.safetensors", "model.layers.19.self_attn.q_proj.weight": "model-00006-of-00031.safetensors", "model.layers.19.self_attn.v_proj.bias": "model-00006-of-00031.safetensors", "model.layers.19.self_attn.v_proj.weight": "model-00006-of-00031.safetensors", "model.layers.2.input_layernorm.weight": "model-00006-of-00031.safetensors", "model.layers.2.mlp.down_proj.weight": "model-00006-of-00031.safetensors", "model.layers.2.mlp.gate_proj.weight": "model-00006-of-00031.safetensors", "model.layers.2.mlp.up_proj.weight": "model-00006-of-00031.safetensors", "model.layers.2.post_attention_layernorm.weight": "model-00006-of-00031.safetensors", "model.layers.2.self_attn.k_proj.bias": "model-00006-of-00031.safetensors", "model.layers.2.self_attn.k_proj.weight": "model-00006-of-00031.safetensors", "model.layers.2.self_attn.o_proj.weight": "model-00006-of-00031.safetensors", "model.layers.2.self_attn.q_proj.bias": "model-00006-of-00031.safetensors", "model.layers.2.self_attn.q_proj.weight": "model-00006-of-00031.safetensors", "model.layers.2.self_attn.v_proj.bias": "model-00006-of-00031.safetensors", "model.layers.2.self_attn.v_proj.weight": "model-00006-of-00031.safetensors", "model.layers.20.input_layernorm.weight": "model-00006-of-00031.safetensors", "model.layers.20.mlp.down_proj.weight": "model-00006-of-00031.safetensors", "model.layers.20.mlp.gate_proj.weight": "model-00006-of-00031.safetensors", "model.layers.20.mlp.up_proj.weight": "model-00006-of-00031.safetensors", "model.layers.20.post_attention_layernorm.weight": "model-00006-of-00031.safetensors", "model.layers.20.self_attn.k_proj.bias": "model-00006-of-00031.safetensors", "model.layers.20.self_attn.k_proj.weight": "model-00006-of-00031.safetensors", "model.layers.20.self_attn.o_proj.weight": "model-00007-of-00031.safetensors", "model.layers.20.self_attn.q_proj.bias": "model-00007-of-00031.safetensors", "model.layers.20.self_attn.q_proj.weight": "model-00007-of-00031.safetensors", "model.layers.20.self_attn.v_proj.bias": "model-00007-of-00031.safetensors", "model.layers.20.self_attn.v_proj.weight": "model-00007-of-00031.safetensors", "model.layers.21.input_layernorm.weight": "model-00007-of-00031.safetensors", "model.layers.21.mlp.down_proj.weight": "model-00007-of-00031.safetensors", "model.layers.21.mlp.gate_proj.weight": "model-00007-of-00031.safetensors", "model.layers.21.mlp.up_proj.weight": "model-00007-of-00031.safetensors", "model.layers.21.post_attention_layernorm.weight": "model-00007-of-00031.safetensors", "model.layers.21.self_attn.k_proj.bias": "model-00007-of-00031.safetensors", "model.layers.21.self_attn.k_proj.weight": "model-00007-of-00031.safetensors", "model.layers.21.self_attn.o_proj.weight": "model-00007-of-00031.safetensors", "model.layers.21.self_attn.q_proj.bias": "model-00007-of-00031.safetensors", "model.layers.21.self_attn.q_proj.weight": "model-00007-of-00031.safetensors", "model.layers.21.self_attn.v_proj.bias": "model-00007-of-00031.safetensors", "model.layers.21.self_attn.v_proj.weight": "model-00007-of-00031.safetensors", "model.layers.22.input_layernorm.weight": "model-00007-of-00031.safetensors", "model.layers.22.mlp.down_proj.weight": "model-00007-of-00031.safetensors", "model.layers.22.mlp.gate_proj.weight": "model-00007-of-00031.safetensors", "model.layers.22.mlp.up_proj.weight": "model-00007-of-00031.safetensors", "model.layers.22.post_attention_layernorm.weight": "model-00007-of-00031.safetensors", "model.layers.22.self_attn.k_proj.bias": "model-00007-of-00031.safetensors", "model.layers.22.self_attn.k_proj.weight": "model-00007-of-00031.safetensors", "model.layers.22.self_attn.o_proj.weight": "model-00007-of-00031.safetensors", "model.layers.22.self_attn.q_proj.bias": "model-00007-of-00031.safetensors", "model.layers.22.self_attn.q_proj.weight": "model-00007-of-00031.safetensors", "model.layers.22.self_attn.v_proj.bias": "model-00007-of-00031.safetensors", "model.layers.22.self_attn.v_proj.weight": "model-00007-of-00031.safetensors", "model.layers.23.input_layernorm.weight": "model-00007-of-00031.safetensors", "model.layers.23.mlp.down_proj.weight": "model-00007-of-00031.safetensors", "model.layers.23.mlp.gate_proj.weight": "model-00007-of-00031.safetensors", "model.layers.23.mlp.up_proj.weight": "model-00008-of-00031.safetensors", "model.layers.23.post_attention_layernorm.weight": "model-00008-of-00031.safetensors", "model.layers.23.self_attn.k_proj.bias": "model-00008-of-00031.safetensors", "model.layers.23.self_attn.k_proj.weight": "model-00008-of-00031.safetensors", "model.layers.23.self_attn.o_proj.weight": "model-00008-of-00031.safetensors", "model.layers.23.self_attn.q_proj.bias": "model-00008-of-00031.safetensors", "model.layers.23.self_attn.q_proj.weight": "model-00008-of-00031.safetensors", "model.layers.23.self_attn.v_proj.bias": "model-00008-of-00031.safetensors", "model.layers.23.self_attn.v_proj.weight": "model-00008-of-00031.safetensors", "model.layers.24.input_layernorm.weight": "model-00008-of-00031.safetensors", "model.layers.24.mlp.down_proj.weight": "model-00008-of-00031.safetensors", "model.layers.24.mlp.gate_proj.weight": "model-00008-of-00031.safetensors", "model.layers.24.mlp.up_proj.weight": "model-00008-of-00031.safetensors", "model.layers.24.post_attention_layernorm.weight": "model-00008-of-00031.safetensors", "model.layers.24.self_attn.k_proj.bias": "model-00008-of-00031.safetensors", "model.layers.24.self_attn.k_proj.weight": "model-00008-of-00031.safetensors", "model.layers.24.self_attn.o_proj.weight": "model-00008-of-00031.safetensors", "model.layers.24.self_attn.q_proj.bias": "model-00008-of-00031.safetensors", "model.layers.24.self_attn.q_proj.weight": "model-00008-of-00031.safetensors", "model.layers.24.self_attn.v_proj.bias": "model-00008-of-00031.safetensors", "model.layers.24.self_attn.v_proj.weight": "model-00008-of-00031.safetensors", "model.layers.25.input_layernorm.weight": "model-00008-of-00031.safetensors", "model.layers.25.mlp.down_proj.weight": "model-00008-of-00031.safetensors", "model.layers.25.mlp.gate_proj.weight": "model-00008-of-00031.safetensors", "model.layers.25.mlp.up_proj.weight": "model-00008-of-00031.safetensors", "model.layers.25.post_attention_layernorm.weight": "model-00008-of-00031.safetensors", "model.layers.25.self_attn.k_proj.bias": "model-00008-of-00031.safetensors", "model.layers.25.self_attn.k_proj.weight": "model-00008-of-00031.safetensors", "model.layers.25.self_attn.o_proj.weight": "model-00008-of-00031.safetensors", "model.layers.25.self_attn.q_proj.bias": "model-00008-of-00031.safetensors", "model.layers.25.self_attn.q_proj.weight": "model-00008-of-00031.safetensors", "model.layers.25.self_attn.v_proj.bias": "model-00008-of-00031.safetensors", "model.layers.25.self_attn.v_proj.weight": "model-00008-of-00031.safetensors", "model.layers.26.input_layernorm.weight": "model-00008-of-00031.safetensors", "model.layers.26.mlp.down_proj.weight": "model-00008-of-00031.safetensors", "model.layers.26.mlp.gate_proj.weight": "model-00009-of-00031.safetensors", "model.layers.26.mlp.up_proj.weight": "model-00009-of-00031.safetensors", "model.layers.26.post_attention_layernorm.weight": "model-00009-of-00031.safetensors", "model.layers.26.self_attn.k_proj.bias": "model-00009-of-00031.safetensors", "model.layers.26.self_attn.k_proj.weight": "model-00009-of-00031.safetensors", "model.layers.26.self_attn.o_proj.weight": "model-00009-of-00031.safetensors", "model.layers.26.self_attn.q_proj.bias": "model-00009-of-00031.safetensors", "model.layers.26.self_attn.q_proj.weight": "model-00009-of-00031.safetensors", "model.layers.26.self_attn.v_proj.bias": "model-00009-of-00031.safetensors", "model.layers.26.self_attn.v_proj.weight": "model-00009-of-00031.safetensors", "model.layers.27.input_layernorm.weight": "model-00009-of-00031.safetensors", "model.layers.27.mlp.down_proj.weight": "model-00009-of-00031.safetensors", "model.layers.27.mlp.gate_proj.weight": "model-00009-of-00031.safetensors", "model.layers.27.mlp.up_proj.weight": "model-00009-of-00031.safetensors", "model.layers.27.post_attention_layernorm.weight": "model-00009-of-00031.safetensors", "model.layers.27.self_attn.k_proj.bias": "model-00009-of-00031.safetensors", "model.layers.27.self_attn.k_proj.weight": "model-00009-of-00031.safetensors", "model.layers.27.self_attn.o_proj.weight": "model-00009-of-00031.safetensors", "model.layers.27.self_attn.q_proj.bias": "model-00009-of-00031.safetensors", "model.layers.27.self_attn.q_proj.weight": "model-00009-of-00031.safetensors", "model.layers.27.self_attn.v_proj.bias": "model-00009-of-00031.safetensors", "model.layers.27.self_attn.v_proj.weight": "model-00009-of-00031.safetensors", "model.layers.28.input_layernorm.weight": "model-00009-of-00031.safetensors", "model.layers.28.mlp.down_proj.weight": "model-00009-of-00031.safetensors", "model.layers.28.mlp.gate_proj.weight": "model-00009-of-00031.safetensors", "model.layers.28.mlp.up_proj.weight": "model-00009-of-00031.safetensors", "model.layers.28.post_attention_layernorm.weight": "model-00009-of-00031.safetensors", "model.layers.28.self_attn.k_proj.bias": "model-00009-of-00031.safetensors", "model.layers.28.self_attn.k_proj.weight": "model-00009-of-00031.safetensors", "model.layers.28.self_attn.o_proj.weight": "model-00009-of-00031.safetensors", "model.layers.28.self_attn.q_proj.bias": "model-00009-of-00031.safetensors", "model.layers.28.self_attn.q_proj.weight": "model-00009-of-00031.safetensors", "model.layers.28.self_attn.v_proj.bias": "model-00009-of-00031.safetensors", "model.layers.28.self_attn.v_proj.weight": "model-00009-of-00031.safetensors", "model.layers.29.input_layernorm.weight": "model-00009-of-00031.safetensors", "model.layers.29.mlp.down_proj.weight": "model-00010-of-00031.safetensors", "model.layers.29.mlp.gate_proj.weight": "model-00010-of-00031.safetensors", "model.layers.29.mlp.up_proj.weight": "model-00010-of-00031.safetensors", "model.layers.29.post_attention_layernorm.weight": "model-00010-of-00031.safetensors", "model.layers.29.self_attn.k_proj.bias": "model-00010-of-00031.safetensors", "model.layers.29.self_attn.k_proj.weight": "model-00010-of-00031.safetensors", "model.layers.29.self_attn.o_proj.weight": "model-00010-of-00031.safetensors", "model.layers.29.self_attn.q_proj.bias": "model-00010-of-00031.safetensors", "model.layers.29.self_attn.q_proj.weight": "model-00010-of-00031.safetensors", "model.layers.29.self_attn.v_proj.bias": "model-00010-of-00031.safetensors", "model.layers.29.self_attn.v_proj.weight": "model-00010-of-00031.safetensors", "model.layers.3.input_layernorm.weight": "model-00010-of-00031.safetensors", "model.layers.3.mlp.down_proj.weight": "model-00010-of-00031.safetensors", "model.layers.3.mlp.gate_proj.weight": "model-00010-of-00031.safetensors", "model.layers.3.mlp.up_proj.weight": "model-00010-of-00031.safetensors", "model.layers.3.post_attention_layernorm.weight": "model-00010-of-00031.safetensors", "model.layers.3.self_attn.k_proj.bias": "model-00010-of-00031.safetensors", "model.layers.3.self_attn.k_proj.weight": "model-00010-of-00031.safetensors", "model.layers.3.self_attn.o_proj.weight": "model-00010-of-00031.safetensors", "model.layers.3.self_attn.q_proj.bias": "model-00010-of-00031.safetensors", "model.layers.3.self_attn.q_proj.weight": "model-00010-of-00031.safetensors", "model.layers.3.self_attn.v_proj.bias": "model-00010-of-00031.safetensors", "model.layers.3.self_attn.v_proj.weight": "model-00010-of-00031.safetensors", "model.layers.30.input_layernorm.weight": "model-00010-of-00031.safetensors", "model.layers.30.mlp.down_proj.weight": "model-00010-of-00031.safetensors", "model.layers.30.mlp.gate_proj.weight": "model-00010-of-00031.safetensors", "model.layers.30.mlp.up_proj.weight": "model-00010-of-00031.safetensors", "model.layers.30.post_attention_layernorm.weight": "model-00010-of-00031.safetensors", "model.layers.30.self_attn.k_proj.bias": "model-00010-of-00031.safetensors", "model.layers.30.self_attn.k_proj.weight": "model-00010-of-00031.safetensors", "model.layers.30.self_attn.o_proj.weight": "model-00011-of-00031.safetensors", "model.layers.30.self_attn.q_proj.bias": "model-00011-of-00031.safetensors", "model.layers.30.self_attn.q_proj.weight": "model-00011-of-00031.safetensors", "model.layers.30.self_attn.v_proj.bias": "model-00011-of-00031.safetensors", "model.layers.30.self_attn.v_proj.weight": "model-00011-of-00031.safetensors", "model.layers.31.input_layernorm.weight": "model-00011-of-00031.safetensors", "model.layers.31.mlp.down_proj.weight": "model-00011-of-00031.safetensors", "model.layers.31.mlp.gate_proj.weight": "model-00011-of-00031.safetensors", "model.layers.31.mlp.up_proj.weight": "model-00011-of-00031.safetensors", "model.layers.31.post_attention_layernorm.weight": "model-00011-of-00031.safetensors", "model.layers.31.self_attn.k_proj.bias": "model-00011-of-00031.safetensors", "model.layers.31.self_attn.k_proj.weight": "model-00011-of-00031.safetensors", "model.layers.31.self_attn.o_proj.weight": "model-00011-of-00031.safetensors", "model.layers.31.self_attn.q_proj.bias": "model-00011-of-00031.safetensors", "model.layers.31.self_attn.q_proj.weight": "model-00011-of-00031.safetensors", "model.layers.31.self_attn.v_proj.bias": "model-00011-of-00031.safetensors", "model.layers.31.self_attn.v_proj.weight": "model-00011-of-00031.safetensors", "model.layers.32.input_layernorm.weight": "model-00011-of-00031.safetensors", "model.layers.32.mlp.down_proj.weight": "model-00011-of-00031.safetensors", "model.layers.32.mlp.gate_proj.weight": "model-00011-of-00031.safetensors", "model.layers.32.mlp.up_proj.weight": "model-00011-of-00031.safetensors", "model.layers.32.post_attention_layernorm.weight": "model-00011-of-00031.safetensors", "model.layers.32.self_attn.k_proj.bias": "model-00011-of-00031.safetensors", "model.layers.32.self_attn.k_proj.weight": "model-00011-of-00031.safetensors", "model.layers.32.self_attn.o_proj.weight": "model-00011-of-00031.safetensors", "model.layers.32.self_attn.q_proj.bias": "model-00011-of-00031.safetensors", "model.layers.32.self_attn.q_proj.weight": "model-00011-of-00031.safetensors", "model.layers.32.self_attn.v_proj.bias": "model-00011-of-00031.safetensors", "model.layers.32.self_attn.v_proj.weight": "model-00011-of-00031.safetensors", "model.layers.33.input_layernorm.weight": "model-00011-of-00031.safetensors", "model.layers.33.mlp.down_proj.weight": "model-00011-of-00031.safetensors", "model.layers.33.mlp.gate_proj.weight": "model-00011-of-00031.safetensors", "model.layers.33.mlp.up_proj.weight": "model-00012-of-00031.safetensors", "model.layers.33.post_attention_layernorm.weight": "model-00012-of-00031.safetensors", "model.layers.33.self_attn.k_proj.bias": "model-00012-of-00031.safetensors", "model.layers.33.self_attn.k_proj.weight": "model-00012-of-00031.safetensors", "model.layers.33.self_attn.o_proj.weight": "model-00012-of-00031.safetensors", "model.layers.33.self_attn.q_proj.bias": "model-00012-of-00031.safetensors", "model.layers.33.self_attn.q_proj.weight": "model-00012-of-00031.safetensors", "model.layers.33.self_attn.v_proj.bias": "model-00012-of-00031.safetensors", "model.layers.33.self_attn.v_proj.weight": "model-00012-of-00031.safetensors", "model.layers.34.input_layernorm.weight": "model-00012-of-00031.safetensors", "model.layers.34.mlp.down_proj.weight": "model-00012-of-00031.safetensors", "model.layers.34.mlp.gate_proj.weight": "model-00012-of-00031.safetensors", "model.layers.34.mlp.up_proj.weight": "model-00012-of-00031.safetensors", "model.layers.34.post_attention_layernorm.weight": "model-00012-of-00031.safetensors", "model.layers.34.self_attn.k_proj.bias": "model-00012-of-00031.safetensors", "model.layers.34.self_attn.k_proj.weight": "model-00012-of-00031.safetensors", "model.layers.34.self_attn.o_proj.weight": "model-00012-of-00031.safetensors", "model.layers.34.self_attn.q_proj.bias": "model-00012-of-00031.safetensors", "model.layers.34.self_attn.q_proj.weight": "model-00012-of-00031.safetensors", "model.layers.34.self_attn.v_proj.bias": "model-00012-of-00031.safetensors", "model.layers.34.self_attn.v_proj.weight": "model-00012-of-00031.safetensors", "model.layers.35.input_layernorm.weight": "model-00012-of-00031.safetensors", "model.layers.35.mlp.down_proj.weight": "model-00012-of-00031.safetensors", "model.layers.35.mlp.gate_proj.weight": "model-00012-of-00031.safetensors", "model.layers.35.mlp.up_proj.weight": "model-00012-of-00031.safetensors", "model.layers.35.post_attention_layernorm.weight": "model-00012-of-00031.safetensors", "model.layers.35.self_attn.k_proj.bias": "model-00012-of-00031.safetensors", "model.layers.35.self_attn.k_proj.weight": "model-00012-of-00031.safetensors", "model.layers.35.self_attn.o_proj.weight": "model-00012-of-00031.safetensors", "model.layers.35.self_attn.q_proj.bias": "model-00012-of-00031.safetensors", "model.layers.35.self_attn.q_proj.weight": "model-00012-of-00031.safetensors", "model.layers.35.self_attn.v_proj.bias": "model-00012-of-00031.safetensors", "model.layers.35.self_attn.v_proj.weight": "model-00012-of-00031.safetensors", "model.layers.36.input_layernorm.weight": "model-00012-of-00031.safetensors", "model.layers.36.mlp.down_proj.weight": "model-00012-of-00031.safetensors", "model.layers.36.mlp.gate_proj.weight": "model-00013-of-00031.safetensors", "model.layers.36.mlp.up_proj.weight": "model-00013-of-00031.safetensors", "model.layers.36.post_attention_layernorm.weight": "model-00013-of-00031.safetensors", "model.layers.36.self_attn.k_proj.bias": "model-00013-of-00031.safetensors", "model.layers.36.self_attn.k_proj.weight": "model-00013-of-00031.safetensors", "model.layers.36.self_attn.o_proj.weight": "model-00013-of-00031.safetensors", "model.layers.36.self_attn.q_proj.bias": "model-00013-of-00031.safetensors", "model.layers.36.self_attn.q_proj.weight": "model-00013-of-00031.safetensors", "model.layers.36.self_attn.v_proj.bias": "model-00013-of-00031.safetensors", "model.layers.36.self_attn.v_proj.weight": "model-00013-of-00031.safetensors", "model.layers.37.input_layernorm.weight": "model-00013-of-00031.safetensors", "model.layers.37.mlp.down_proj.weight": "model-00013-of-00031.safetensors", "model.layers.37.mlp.gate_proj.weight": "model-00013-of-00031.safetensors", "model.layers.37.mlp.up_proj.weight": "model-00013-of-00031.safetensors", "model.layers.37.post_attention_layernorm.weight": "model-00013-of-00031.safetensors", "model.layers.37.self_attn.k_proj.bias": "model-00013-of-00031.safetensors", "model.layers.37.self_attn.k_proj.weight": "model-00013-of-00031.safetensors", "model.layers.37.self_attn.o_proj.weight": "model-00013-of-00031.safetensors", "model.layers.37.self_attn.q_proj.bias": "model-00013-of-00031.safetensors", "model.layers.37.self_attn.q_proj.weight": "model-00013-of-00031.safetensors", "model.layers.37.self_attn.v_proj.bias": "model-00013-of-00031.safetensors", "model.layers.37.self_attn.v_proj.weight": "model-00013-of-00031.safetensors", "model.layers.38.input_layernorm.weight": "model-00013-of-00031.safetensors", "model.layers.38.mlp.down_proj.weight": "model-00013-of-00031.safetensors", "model.layers.38.mlp.gate_proj.weight": "model-00013-of-00031.safetensors", "model.layers.38.mlp.up_proj.weight": "model-00013-of-00031.safetensors", "model.layers.38.post_attention_layernorm.weight": "model-00013-of-00031.safetensors", "model.layers.38.self_attn.k_proj.bias": "model-00013-of-00031.safetensors", "model.layers.38.self_attn.k_proj.weight": "model-00013-of-00031.safetensors", "model.layers.38.self_attn.o_proj.weight": "model-00013-of-00031.safetensors", "model.layers.38.self_attn.q_proj.bias": "model-00013-of-00031.safetensors", "model.layers.38.self_attn.q_proj.weight": "model-00013-of-00031.safetensors", "model.layers.38.self_attn.v_proj.bias": "model-00013-of-00031.safetensors", "model.layers.38.self_attn.v_proj.weight": "model-00013-of-00031.safetensors", "model.layers.39.input_layernorm.weight": "model-00013-of-00031.safetensors", "model.layers.39.mlp.down_proj.weight": "model-00014-of-00031.safetensors", "model.layers.39.mlp.gate_proj.weight": "model-00014-of-00031.safetensors", "model.layers.39.mlp.up_proj.weight": "model-00014-of-00031.safetensors", "model.layers.39.post_attention_layernorm.weight": "model-00014-of-00031.safetensors", "model.layers.39.self_attn.k_proj.bias": "model-00014-of-00031.safetensors", "model.layers.39.self_attn.k_proj.weight": "model-00014-of-00031.safetensors", "model.layers.39.self_attn.o_proj.weight": "model-00014-of-00031.safetensors", "model.layers.39.self_attn.q_proj.bias": "model-00014-of-00031.safetensors", "model.layers.39.self_attn.q_proj.weight": "model-00014-of-00031.safetensors", "model.layers.39.self_attn.v_proj.bias": "model-00014-of-00031.safetensors", "model.layers.39.self_attn.v_proj.weight": "model-00014-of-00031.safetensors", "model.layers.4.input_layernorm.weight": "model-00014-of-00031.safetensors", "model.layers.4.mlp.down_proj.weight": "model-00014-of-00031.safetensors", "model.layers.4.mlp.gate_proj.weight": "model-00014-of-00031.safetensors", "model.layers.4.mlp.up_proj.weight": "model-00014-of-00031.safetensors", "model.layers.4.post_attention_layernorm.weight": "model-00014-of-00031.safetensors", "model.layers.4.self_attn.k_proj.bias": "model-00014-of-00031.safetensors", "model.layers.4.self_attn.k_proj.weight": "model-00014-of-00031.safetensors", "model.layers.4.self_attn.o_proj.weight": "model-00014-of-00031.safetensors", "model.layers.4.self_attn.q_proj.bias": "model-00014-of-00031.safetensors", "model.layers.4.self_attn.q_proj.weight": "model-00014-of-00031.safetensors", "model.layers.4.self_attn.v_proj.bias": "model-00014-of-00031.safetensors", "model.layers.4.self_attn.v_proj.weight": "model-00014-of-00031.safetensors", "model.layers.40.input_layernorm.weight": "model-00014-of-00031.safetensors", "model.layers.40.mlp.down_proj.weight": "model-00014-of-00031.safetensors", "model.layers.40.mlp.gate_proj.weight": "model-00014-of-00031.safetensors", "model.layers.40.mlp.up_proj.weight": "model-00014-of-00031.safetensors", "model.layers.40.post_attention_layernorm.weight": "model-00014-of-00031.safetensors", "model.layers.40.self_attn.k_proj.bias": "model-00014-of-00031.safetensors", "model.layers.40.self_attn.k_proj.weight": "model-00014-of-00031.safetensors", "model.layers.40.self_attn.o_proj.weight": "model-00015-of-00031.safetensors", "model.layers.40.self_attn.q_proj.bias": "model-00015-of-00031.safetensors", "model.layers.40.self_attn.q_proj.weight": "model-00015-of-00031.safetensors", "model.layers.40.self_attn.v_proj.bias": "model-00015-of-00031.safetensors", "model.layers.40.self_attn.v_proj.weight": "model-00015-of-00031.safetensors", "model.layers.41.input_layernorm.weight": "model-00015-of-00031.safetensors", "model.layers.41.mlp.down_proj.weight": "model-00015-of-00031.safetensors", "model.layers.41.mlp.gate_proj.weight": "model-00015-of-00031.safetensors", "model.layers.41.mlp.up_proj.weight": "model-00015-of-00031.safetensors", "model.layers.41.post_attention_layernorm.weight": "model-00015-of-00031.safetensors", "model.layers.41.self_attn.k_proj.bias": "model-00015-of-00031.safetensors", "model.layers.41.self_attn.k_proj.weight": "model-00015-of-00031.safetensors", "model.layers.41.self_attn.o_proj.weight": "model-00015-of-00031.safetensors", "model.layers.41.self_attn.q_proj.bias": "model-00015-of-00031.safetensors", "model.layers.41.self_attn.q_proj.weight": "model-00015-of-00031.safetensors", "model.layers.41.self_attn.v_proj.bias": "model-00015-of-00031.safetensors", "model.layers.41.self_attn.v_proj.weight": "model-00015-of-00031.safetensors", "model.layers.42.input_layernorm.weight": "model-00015-of-00031.safetensors", "model.layers.42.mlp.down_proj.weight": "model-00015-of-00031.safetensors", "model.layers.42.mlp.gate_proj.weight": "model-00015-of-00031.safetensors", "model.layers.42.mlp.up_proj.weight": "model-00015-of-00031.safetensors", "model.layers.42.post_attention_layernorm.weight": "model-00015-of-00031.safetensors", "model.layers.42.self_attn.k_proj.bias": "model-00015-of-00031.safetensors", "model.layers.42.self_attn.k_proj.weight": "model-00015-of-00031.safetensors", "model.layers.42.self_attn.o_proj.weight": "model-00015-of-00031.safetensors", "model.layers.42.self_attn.q_proj.bias": "model-00015-of-00031.safetensors", "model.layers.42.self_attn.q_proj.weight": "model-00015-of-00031.safetensors", "model.layers.42.self_attn.v_proj.bias": "model-00015-of-00031.safetensors", "model.layers.42.self_attn.v_proj.weight": "model-00015-of-00031.safetensors", "model.layers.43.input_layernorm.weight": "model-00015-of-00031.safetensors", "model.layers.43.mlp.down_proj.weight": "model-00015-of-00031.safetensors", "model.layers.43.mlp.gate_proj.weight": "model-00015-of-00031.safetensors", "model.layers.43.mlp.up_proj.weight": "model-00016-of-00031.safetensors", "model.layers.43.post_attention_layernorm.weight": "model-00016-of-00031.safetensors", "model.layers.43.self_attn.k_proj.bias": "model-00016-of-00031.safetensors", "model.layers.43.self_attn.k_proj.weight": "model-00016-of-00031.safetensors", "model.layers.43.self_attn.o_proj.weight": "model-00016-of-00031.safetensors", "model.layers.43.self_attn.q_proj.bias": "model-00016-of-00031.safetensors", "model.layers.43.self_attn.q_proj.weight": "model-00016-of-00031.safetensors", "model.layers.43.self_attn.v_proj.bias": "model-00016-of-00031.safetensors", "model.layers.43.self_attn.v_proj.weight": "model-00016-of-00031.safetensors", "model.layers.44.input_layernorm.weight": "model-00016-of-00031.safetensors", "model.layers.44.mlp.down_proj.weight": "model-00016-of-00031.safetensors", "model.layers.44.mlp.gate_proj.weight": "model-00016-of-00031.safetensors", "model.layers.44.mlp.up_proj.weight": "model-00016-of-00031.safetensors", "model.layers.44.post_attention_layernorm.weight": "model-00016-of-00031.safetensors", "model.layers.44.self_attn.k_proj.bias": "model-00016-of-00031.safetensors", "model.layers.44.self_attn.k_proj.weight": "model-00016-of-00031.safetensors", "model.layers.44.self_attn.o_proj.weight": "model-00016-of-00031.safetensors", "model.layers.44.self_attn.q_proj.bias": "model-00016-of-00031.safetensors", "model.layers.44.self_attn.q_proj.weight": "model-00016-of-00031.safetensors", "model.layers.44.self_attn.v_proj.bias": "model-00016-of-00031.safetensors", "model.layers.44.self_attn.v_proj.weight": "model-00016-of-00031.safetensors", "model.layers.45.input_layernorm.weight": "model-00016-of-00031.safetensors", "model.layers.45.mlp.down_proj.weight": "model-00016-of-00031.safetensors", "model.layers.45.mlp.gate_proj.weight": "model-00016-of-00031.safetensors", "model.layers.45.mlp.up_proj.weight": "model-00016-of-00031.safetensors", "model.layers.45.post_attention_layernorm.weight": "model-00016-of-00031.safetensors", "model.layers.45.self_attn.k_proj.bias": "model-00016-of-00031.safetensors", "model.layers.45.self_attn.k_proj.weight": "model-00016-of-00031.safetensors", "model.layers.45.self_attn.o_proj.weight": "model-00016-of-00031.safetensors", "model.layers.45.self_attn.q_proj.bias": "model-00016-of-00031.safetensors", "model.layers.45.self_attn.q_proj.weight": "model-00016-of-00031.safetensors", "model.layers.45.self_attn.v_proj.bias": "model-00016-of-00031.safetensors", "model.layers.45.self_attn.v_proj.weight": "model-00016-of-00031.safetensors", "model.layers.46.input_layernorm.weight": "model-00016-of-00031.safetensors", "model.layers.46.mlp.down_proj.weight": "model-00016-of-00031.safetensors", "model.layers.46.mlp.gate_proj.weight": "model-00017-of-00031.safetensors", "model.layers.46.mlp.up_proj.weight": "model-00017-of-00031.safetensors", "model.layers.46.post_attention_layernorm.weight": "model-00017-of-00031.safetensors", "model.layers.46.self_attn.k_proj.bias": "model-00017-of-00031.safetensors", "model.layers.46.self_attn.k_proj.weight": "model-00017-of-00031.safetensors", "model.layers.46.self_attn.o_proj.weight": "model-00017-of-00031.safetensors", "model.layers.46.self_attn.q_proj.bias": "model-00017-of-00031.safetensors", "model.layers.46.self_attn.q_proj.weight": "model-00017-of-00031.safetensors", "model.layers.46.self_attn.v_proj.bias": "model-00017-of-00031.safetensors", "model.layers.46.self_attn.v_proj.weight": "model-00017-of-00031.safetensors", "model.layers.47.input_layernorm.weight": "model-00017-of-00031.safetensors", "model.layers.47.mlp.down_proj.weight": "model-00017-of-00031.safetensors", "model.layers.47.mlp.gate_proj.weight": "model-00017-of-00031.safetensors", "model.layers.47.mlp.up_proj.weight": "model-00017-of-00031.safetensors", "model.layers.47.post_attention_layernorm.weight": "model-00017-of-00031.safetensors", "model.layers.47.self_attn.k_proj.bias": "model-00017-of-00031.safetensors", "model.layers.47.self_attn.k_proj.weight": "model-00017-of-00031.safetensors", "model.layers.47.self_attn.o_proj.weight": "model-00017-of-00031.safetensors", "model.layers.47.self_attn.q_proj.bias": "model-00017-of-00031.safetensors", "model.layers.47.self_attn.q_proj.weight": "model-00017-of-00031.safetensors", "model.layers.47.self_attn.v_proj.bias": "model-00017-of-00031.safetensors", "model.layers.47.self_attn.v_proj.weight": "model-00017-of-00031.safetensors", "model.layers.48.input_layernorm.weight": "model-00017-of-00031.safetensors", "model.layers.48.mlp.down_proj.weight": "model-00017-of-00031.safetensors", "model.layers.48.mlp.gate_proj.weight": "model-00017-of-00031.safetensors", "model.layers.48.mlp.up_proj.weight": "model-00017-of-00031.safetensors", "model.layers.48.post_attention_layernorm.weight": "model-00017-of-00031.safetensors", "model.layers.48.self_attn.k_proj.bias": "model-00017-of-00031.safetensors", "model.layers.48.self_attn.k_proj.weight": "model-00017-of-00031.safetensors", "model.layers.48.self_attn.o_proj.weight": "model-00017-of-00031.safetensors", "model.layers.48.self_attn.q_proj.bias": "model-00017-of-00031.safetensors", "model.layers.48.self_attn.q_proj.weight": "model-00017-of-00031.safetensors", "model.layers.48.self_attn.v_proj.bias": "model-00017-of-00031.safetensors", "model.layers.48.self_attn.v_proj.weight": "model-00017-of-00031.safetensors", "model.layers.49.input_layernorm.weight": "model-00017-of-00031.safetensors", "model.layers.49.mlp.down_proj.weight": "model-00018-of-00031.safetensors", "model.layers.49.mlp.gate_proj.weight": "model-00018-of-00031.safetensors", "model.layers.49.mlp.up_proj.weight": "model-00018-of-00031.safetensors", "model.layers.49.post_attention_layernorm.weight": "model-00018-of-00031.safetensors", "model.layers.49.self_attn.k_proj.bias": "model-00018-of-00031.safetensors", "model.layers.49.self_attn.k_proj.weight": "model-00018-of-00031.safetensors", "model.layers.49.self_attn.o_proj.weight": "model-00018-of-00031.safetensors", "model.layers.49.self_attn.q_proj.bias": "model-00018-of-00031.safetensors", "model.layers.49.self_attn.q_proj.weight": "model-00018-of-00031.safetensors", "model.layers.49.self_attn.v_proj.bias": "model-00018-of-00031.safetensors", "model.layers.49.self_attn.v_proj.weight": "model-00018-of-00031.safetensors", "model.layers.5.input_layernorm.weight": "model-00018-of-00031.safetensors", "model.layers.5.mlp.down_proj.weight": "model-00018-of-00031.safetensors", "model.layers.5.mlp.gate_proj.weight": "model-00018-of-00031.safetensors", "model.layers.5.mlp.up_proj.weight": "model-00018-of-00031.safetensors", "model.layers.5.post_attention_layernorm.weight": "model-00018-of-00031.safetensors", "model.layers.5.self_attn.k_proj.bias": "model-00018-of-00031.safetensors", "model.layers.5.self_attn.k_proj.weight": "model-00018-of-00031.safetensors", "model.layers.5.self_attn.o_proj.weight": "model-00018-of-00031.safetensors", "model.layers.5.self_attn.q_proj.bias": "model-00018-of-00031.safetensors", "model.layers.5.self_attn.q_proj.weight": "model-00018-of-00031.safetensors", "model.layers.5.self_attn.v_proj.bias": "model-00018-of-00031.safetensors", "model.layers.5.self_attn.v_proj.weight": "model-00018-of-00031.safetensors", "model.layers.50.input_layernorm.weight": "model-00018-of-00031.safetensors", "model.layers.50.mlp.down_proj.weight": "model-00018-of-00031.safetensors", "model.layers.50.mlp.gate_proj.weight": "model-00018-of-00031.safetensors", "model.layers.50.mlp.up_proj.weight": "model-00018-of-00031.safetensors", "model.layers.50.post_attention_layernorm.weight": "model-00018-of-00031.safetensors", "model.layers.50.self_attn.k_proj.bias": "model-00018-of-00031.safetensors", "model.layers.50.self_attn.k_proj.weight": "model-00018-of-00031.safetensors", "model.layers.50.self_attn.o_proj.weight": "model-00019-of-00031.safetensors", "model.layers.50.self_attn.q_proj.bias": "model-00019-of-00031.safetensors", "model.layers.50.self_attn.q_proj.weight": "model-00019-of-00031.safetensors", "model.layers.50.self_attn.v_proj.bias": "model-00019-of-00031.safetensors", "model.layers.50.self_attn.v_proj.weight": "model-00019-of-00031.safetensors", "model.layers.51.input_layernorm.weight": "model-00019-of-00031.safetensors", "model.layers.51.mlp.down_proj.weight": "model-00019-of-00031.safetensors", "model.layers.51.mlp.gate_proj.weight": "model-00019-of-00031.safetensors", "model.layers.51.mlp.up_proj.weight": "model-00019-of-00031.safetensors", "model.layers.51.post_attention_layernorm.weight": "model-00019-of-00031.safetensors", "model.layers.51.self_attn.k_proj.bias": "model-00019-of-00031.safetensors", "model.layers.51.self_attn.k_proj.weight": "model-00019-of-00031.safetensors", "model.layers.51.self_attn.o_proj.weight": "model-00019-of-00031.safetensors", "model.layers.51.self_attn.q_proj.bias": "model-00019-of-00031.safetensors", "model.layers.51.self_attn.q_proj.weight": "model-00019-of-00031.safetensors", "model.layers.51.self_attn.v_proj.bias": "model-00019-of-00031.safetensors", "model.layers.51.self_attn.v_proj.weight": "model-00019-of-00031.safetensors", "model.layers.52.input_layernorm.weight": "model-00019-of-00031.safetensors", "model.layers.52.mlp.down_proj.weight": "model-00019-of-00031.safetensors", "model.layers.52.mlp.gate_proj.weight": "model-00019-of-00031.safetensors", "model.layers.52.mlp.up_proj.weight": "model-00019-of-00031.safetensors", "model.layers.52.post_attention_layernorm.weight": "model-00019-of-00031.safetensors", "model.layers.52.self_attn.k_proj.bias": "model-00019-of-00031.safetensors", "model.layers.52.self_attn.k_proj.weight": "model-00019-of-00031.safetensors", "model.layers.52.self_attn.o_proj.weight": "model-00019-of-00031.safetensors", "model.layers.52.self_attn.q_proj.bias": "model-00019-of-00031.safetensors", "model.layers.52.self_attn.q_proj.weight": "model-00019-of-00031.safetensors", "model.layers.52.self_attn.v_proj.bias": "model-00019-of-00031.safetensors", "model.layers.52.self_attn.v_proj.weight": "model-00019-of-00031.safetensors", "model.layers.53.input_layernorm.weight": "model-00019-of-00031.safetensors", "model.layers.53.mlp.down_proj.weight": "model-00019-of-00031.safetensors", "model.layers.53.mlp.gate_proj.weight": "model-00019-of-00031.safetensors", "model.layers.53.mlp.up_proj.weight": "model-00020-of-00031.safetensors", "model.layers.53.post_attention_layernorm.weight": "model-00020-of-00031.safetensors", "model.layers.53.self_attn.k_proj.bias": "model-00020-of-00031.safetensors", "model.layers.53.self_attn.k_proj.weight": "model-00020-of-00031.safetensors", "model.layers.53.self_attn.o_proj.weight": "model-00020-of-00031.safetensors", "model.layers.53.self_attn.q_proj.bias": "model-00020-of-00031.safetensors", "model.layers.53.self_attn.q_proj.weight": "model-00020-of-00031.safetensors", "model.layers.53.self_attn.v_proj.bias": "model-00020-of-00031.safetensors", "model.layers.53.self_attn.v_proj.weight": "model-00020-of-00031.safetensors", "model.layers.54.input_layernorm.weight": "model-00020-of-00031.safetensors", "model.layers.54.mlp.down_proj.weight": "model-00020-of-00031.safetensors", "model.layers.54.mlp.gate_proj.weight": "model-00020-of-00031.safetensors", "model.layers.54.mlp.up_proj.weight": "model-00020-of-00031.safetensors", "model.layers.54.post_attention_layernorm.weight": "model-00020-of-00031.safetensors", "model.layers.54.self_attn.k_proj.bias": "model-00020-of-00031.safetensors", "model.layers.54.self_attn.k_proj.weight": "model-00020-of-00031.safetensors", "model.layers.54.self_attn.o_proj.weight": "model-00020-of-00031.safetensors", "model.layers.54.self_attn.q_proj.bias": "model-00020-of-00031.safetensors", "model.layers.54.self_attn.q_proj.weight": "model-00020-of-00031.safetensors", "model.layers.54.self_attn.v_proj.bias": "model-00020-of-00031.safetensors", "model.layers.54.self_attn.v_proj.weight": "model-00020-of-00031.safetensors", "model.layers.55.input_layernorm.weight": "model-00020-of-00031.safetensors", "model.layers.55.mlp.down_proj.weight": "model-00020-of-00031.safetensors", "model.layers.55.mlp.gate_proj.weight": "model-00020-of-00031.safetensors", "model.layers.55.mlp.up_proj.weight": "model-00020-of-00031.safetensors", "model.layers.55.post_attention_layernorm.weight": "model-00020-of-00031.safetensors", "model.layers.55.self_attn.k_proj.bias": "model-00020-of-00031.safetensors", "model.layers.55.self_attn.k_proj.weight": "model-00020-of-00031.safetensors", "model.layers.55.self_attn.o_proj.weight": "model-00020-of-00031.safetensors", "model.layers.55.self_attn.q_proj.bias": "model-00020-of-00031.safetensors", "model.layers.55.self_attn.q_proj.weight": "model-00020-of-00031.safetensors", "model.layers.55.self_attn.v_proj.bias": "model-00020-of-00031.safetensors", "model.layers.55.self_attn.v_proj.weight": "model-00020-of-00031.safetensors", "model.layers.56.input_layernorm.weight": "model-00020-of-00031.safetensors", "model.layers.56.mlp.down_proj.weight": "model-00020-of-00031.safetensors", "model.layers.56.mlp.gate_proj.weight": "model-00021-of-00031.safetensors", "model.layers.56.mlp.up_proj.weight": "model-00021-of-00031.safetensors", "model.layers.56.post_attention_layernorm.weight": "model-00021-of-00031.safetensors", "model.layers.56.self_attn.k_proj.bias": "model-00021-of-00031.safetensors", "model.layers.56.self_attn.k_proj.weight": "model-00021-of-00031.safetensors", "model.layers.56.self_attn.o_proj.weight": "model-00021-of-00031.safetensors", "model.layers.56.self_attn.q_proj.bias": "model-00021-of-00031.safetensors", "model.layers.56.self_attn.q_proj.weight": "model-00021-of-00031.safetensors", "model.layers.56.self_attn.v_proj.bias": "model-00021-of-00031.safetensors", "model.layers.56.self_attn.v_proj.weight": "model-00021-of-00031.safetensors", "model.layers.57.input_layernorm.weight": "model-00021-of-00031.safetensors", "model.layers.57.mlp.down_proj.weight": "model-00021-of-00031.safetensors", "model.layers.57.mlp.gate_proj.weight": "model-00021-of-00031.safetensors", "model.layers.57.mlp.up_proj.weight": "model-00021-of-00031.safetensors", "model.layers.57.post_attention_layernorm.weight": "model-00021-of-00031.safetensors", "model.layers.57.self_attn.k_proj.bias": "model-00021-of-00031.safetensors", "model.layers.57.self_attn.k_proj.weight": "model-00021-of-00031.safetensors", "model.layers.57.self_attn.o_proj.weight": "model-00021-of-00031.safetensors", "model.layers.57.self_attn.q_proj.bias": "model-00021-of-00031.safetensors", "model.layers.57.self_attn.q_proj.weight": "model-00021-of-00031.safetensors", "model.layers.57.self_attn.v_proj.bias": "model-00021-of-00031.safetensors", "model.layers.57.self_attn.v_proj.weight": "model-00021-of-00031.safetensors", "model.layers.58.input_layernorm.weight": "model-00021-of-00031.safetensors", "model.layers.58.mlp.down_proj.weight": "model-00021-of-00031.safetensors", "model.layers.58.mlp.gate_proj.weight": "model-00021-of-00031.safetensors", "model.layers.58.mlp.up_proj.weight": "model-00021-of-00031.safetensors", "model.layers.58.post_attention_layernorm.weight": "model-00021-of-00031.safetensors", "model.layers.58.self_attn.k_proj.bias": "model-00021-of-00031.safetensors", "model.layers.58.self_attn.k_proj.weight": "model-00021-of-00031.safetensors", "model.layers.58.self_attn.o_proj.weight": "model-00021-of-00031.safetensors", "model.layers.58.self_attn.q_proj.bias": "model-00021-of-00031.safetensors", "model.layers.58.self_attn.q_proj.weight": "model-00021-of-00031.safetensors", "model.layers.58.self_attn.v_proj.bias": "model-00021-of-00031.safetensors", "model.layers.58.self_attn.v_proj.weight": "model-00021-of-00031.safetensors", "model.layers.59.input_layernorm.weight": "model-00021-of-00031.safetensors", "model.layers.59.mlp.down_proj.weight": "model-00022-of-00031.safetensors", "model.layers.59.mlp.gate_proj.weight": "model-00022-of-00031.safetensors", "model.layers.59.mlp.up_proj.weight": "model-00022-of-00031.safetensors", "model.layers.59.post_attention_layernorm.weight": "model-00022-of-00031.safetensors", "model.layers.59.self_attn.k_proj.bias": "model-00022-of-00031.safetensors", "model.layers.59.self_attn.k_proj.weight": "model-00022-of-00031.safetensors", "model.layers.59.self_attn.o_proj.weight": "model-00022-of-00031.safetensors", "model.layers.59.self_attn.q_proj.bias": "model-00022-of-00031.safetensors", "model.layers.59.self_attn.q_proj.weight": "model-00022-of-00031.safetensors", "model.layers.59.self_attn.v_proj.bias": "model-00022-of-00031.safetensors", "model.layers.59.self_attn.v_proj.weight": "model-00022-of-00031.safetensors", "model.layers.6.input_layernorm.weight": "model-00022-of-00031.safetensors", "model.layers.6.mlp.down_proj.weight": "model-00022-of-00031.safetensors", "model.layers.6.mlp.gate_proj.weight": "model-00022-of-00031.safetensors", "model.layers.6.mlp.up_proj.weight": "model-00022-of-00031.safetensors", "model.layers.6.post_attention_layernorm.weight": "model-00022-of-00031.safetensors", "model.layers.6.self_attn.k_proj.bias": "model-00022-of-00031.safetensors", "model.layers.6.self_attn.k_proj.weight": "model-00022-of-00031.safetensors", "model.layers.6.self_attn.o_proj.weight": "model-00022-of-00031.safetensors", "model.layers.6.self_attn.q_proj.bias": "model-00022-of-00031.safetensors", "model.layers.6.self_attn.q_proj.weight": "model-00022-of-00031.safetensors", "model.layers.6.self_attn.v_proj.bias": "model-00022-of-00031.safetensors", "model.layers.6.self_attn.v_proj.weight": "model-00022-of-00031.safetensors", "model.layers.60.input_layernorm.weight": "model-00022-of-00031.safetensors", "model.layers.60.mlp.down_proj.weight": "model-00022-of-00031.safetensors", "model.layers.60.mlp.gate_proj.weight": "model-00022-of-00031.safetensors", "model.layers.60.mlp.up_proj.weight": "model-00022-of-00031.safetensors", "model.layers.60.post_attention_layernorm.weight": "model-00022-of-00031.safetensors", "model.layers.60.self_attn.k_proj.bias": "model-00022-of-00031.safetensors", "model.layers.60.self_attn.k_proj.weight": "model-00022-of-00031.safetensors", "model.layers.60.self_attn.o_proj.weight": "model-00023-of-00031.safetensors", "model.layers.60.self_attn.q_proj.bias": "model-00023-of-00031.safetensors", "model.layers.60.self_attn.q_proj.weight": "model-00023-of-00031.safetensors", "model.layers.60.self_attn.v_proj.bias": "model-00023-of-00031.safetensors", "model.layers.60.self_attn.v_proj.weight": "model-00023-of-00031.safetensors", "model.layers.61.input_layernorm.weight": "model-00023-of-00031.safetensors", "model.layers.61.mlp.down_proj.weight": "model-00023-of-00031.safetensors", "model.layers.61.mlp.gate_proj.weight": "model-00023-of-00031.safetensors", "model.layers.61.mlp.up_proj.weight": "model-00023-of-00031.safetensors", "model.layers.61.post_attention_layernorm.weight": "model-00023-of-00031.safetensors", "model.layers.61.self_attn.k_proj.bias": "model-00023-of-00031.safetensors", "model.layers.61.self_attn.k_proj.weight": "model-00023-of-00031.safetensors", "model.layers.61.self_attn.o_proj.weight": "model-00023-of-00031.safetensors", "model.layers.61.self_attn.q_proj.bias": "model-00023-of-00031.safetensors", "model.layers.61.self_attn.q_proj.weight": "model-00023-of-00031.safetensors", "model.layers.61.self_attn.v_proj.bias": "model-00023-of-00031.safetensors", "model.layers.61.self_attn.v_proj.weight": "model-00023-of-00031.safetensors", "model.layers.62.input_layernorm.weight": "model-00023-of-00031.safetensors", "model.layers.62.mlp.down_proj.weight": "model-00023-of-00031.safetensors", "model.layers.62.mlp.gate_proj.weight": "model-00023-of-00031.safetensors", "model.layers.62.mlp.up_proj.weight": "model-00023-of-00031.safetensors", "model.layers.62.post_attention_layernorm.weight": "model-00023-of-00031.safetensors", "model.layers.62.self_attn.k_proj.bias": "model-00023-of-00031.safetensors", "model.layers.62.self_attn.k_proj.weight": "model-00023-of-00031.safetensors", "model.layers.62.self_attn.o_proj.weight": "model-00023-of-00031.safetensors", "model.layers.62.self_attn.q_proj.bias": "model-00023-of-00031.safetensors", "model.layers.62.self_attn.q_proj.weight": "model-00023-of-00031.safetensors", "model.layers.62.self_attn.v_proj.bias": "model-00023-of-00031.safetensors", "model.layers.62.self_attn.v_proj.weight": "model-00023-of-00031.safetensors", "model.layers.63.input_layernorm.weight": "model-00023-of-00031.safetensors", "model.layers.63.mlp.down_proj.weight": "model-00023-of-00031.safetensors", "model.layers.63.mlp.gate_proj.weight": "model-00023-of-00031.safetensors", "model.layers.63.mlp.up_proj.weight": "model-00024-of-00031.safetensors", "model.layers.63.post_attention_layernorm.weight": "model-00024-of-00031.safetensors", "model.layers.63.self_attn.k_proj.bias": "model-00024-of-00031.safetensors", "model.layers.63.self_attn.k_proj.weight": "model-00024-of-00031.safetensors", "model.layers.63.self_attn.o_proj.weight": "model-00024-of-00031.safetensors", "model.layers.63.self_attn.q_proj.bias": "model-00024-of-00031.safetensors", "model.layers.63.self_attn.q_proj.weight": "model-00024-of-00031.safetensors", "model.layers.63.self_attn.v_proj.bias": "model-00024-of-00031.safetensors", "model.layers.63.self_attn.v_proj.weight": "model-00024-of-00031.safetensors", "model.layers.64.input_layernorm.weight": "model-00024-of-00031.safetensors", "model.layers.64.mlp.down_proj.weight": "model-00024-of-00031.safetensors", "model.layers.64.mlp.gate_proj.weight": "model-00024-of-00031.safetensors", "model.layers.64.mlp.up_proj.weight": "model-00024-of-00031.safetensors", "model.layers.64.post_attention_layernorm.weight": "model-00024-of-00031.safetensors", "model.layers.64.self_attn.k_proj.bias": "model-00024-of-00031.safetensors", "model.layers.64.self_attn.k_proj.weight": "model-00024-of-00031.safetensors", "model.layers.64.self_attn.o_proj.weight": "model-00024-of-00031.safetensors", "model.layers.64.self_attn.q_proj.bias": "model-00024-of-00031.safetensors", "model.layers.64.self_attn.q_proj.weight": "model-00024-of-00031.safetensors", "model.layers.64.self_attn.v_proj.bias": "model-00024-of-00031.safetensors", "model.layers.64.self_attn.v_proj.weight": "model-00024-of-00031.safetensors", "model.layers.65.input_layernorm.weight": "model-00024-of-00031.safetensors", "model.layers.65.mlp.down_proj.weight": "model-00024-of-00031.safetensors", "model.layers.65.mlp.gate_proj.weight": "model-00024-of-00031.safetensors", "model.layers.65.mlp.up_proj.weight": "model-00024-of-00031.safetensors", "model.layers.65.post_attention_layernorm.weight": "model-00024-of-00031.safetensors", "model.layers.65.self_attn.k_proj.bias": "model-00024-of-00031.safetensors", "model.layers.65.self_attn.k_proj.weight": "model-00024-of-00031.safetensors", "model.layers.65.self_attn.o_proj.weight": "model-00024-of-00031.safetensors", "model.layers.65.self_attn.q_proj.bias": "model-00024-of-00031.safetensors", "model.layers.65.self_attn.q_proj.weight": "model-00024-of-00031.safetensors", "model.layers.65.self_attn.v_proj.bias": "model-00024-of-00031.safetensors", "model.layers.65.self_attn.v_proj.weight": "model-00024-of-00031.safetensors", "model.layers.66.input_layernorm.weight": "model-00024-of-00031.safetensors", "model.layers.66.mlp.down_proj.weight": "model-00024-of-00031.safetensors", "model.layers.66.mlp.gate_proj.weight": "model-00025-of-00031.safetensors", "model.layers.66.mlp.up_proj.weight": "model-00025-of-00031.safetensors", "model.layers.66.post_attention_layernorm.weight": "model-00025-of-00031.safetensors", "model.layers.66.self_attn.k_proj.bias": "model-00025-of-00031.safetensors", "model.layers.66.self_attn.k_proj.weight": "model-00025-of-00031.safetensors", "model.layers.66.self_attn.o_proj.weight": "model-00025-of-00031.safetensors", "model.layers.66.self_attn.q_proj.bias": "model-00025-of-00031.safetensors", "model.layers.66.self_attn.q_proj.weight": "model-00025-of-00031.safetensors", "model.layers.66.self_attn.v_proj.bias": "model-00025-of-00031.safetensors", "model.layers.66.self_attn.v_proj.weight": "model-00025-of-00031.safetensors", "model.layers.67.input_layernorm.weight": "model-00025-of-00031.safetensors", "model.layers.67.mlp.down_proj.weight": "model-00025-of-00031.safetensors", "model.layers.67.mlp.gate_proj.weight": "model-00025-of-00031.safetensors", "model.layers.67.mlp.up_proj.weight": "model-00025-of-00031.safetensors", "model.layers.67.post_attention_layernorm.weight": "model-00025-of-00031.safetensors", "model.layers.67.self_attn.k_proj.bias": "model-00025-of-00031.safetensors", "model.layers.67.self_attn.k_proj.weight": "model-00025-of-00031.safetensors", "model.layers.67.self_attn.o_proj.weight": "model-00025-of-00031.safetensors", "model.layers.67.self_attn.q_proj.bias": "model-00025-of-00031.safetensors", "model.layers.67.self_attn.q_proj.weight": "model-00025-of-00031.safetensors", "model.layers.67.self_attn.v_proj.bias": "model-00025-of-00031.safetensors", "model.layers.67.self_attn.v_proj.weight": "model-00025-of-00031.safetensors", "model.layers.68.input_layernorm.weight": "model-00025-of-00031.safetensors", "model.layers.68.mlp.down_proj.weight": "model-00025-of-00031.safetensors", "model.layers.68.mlp.gate_proj.weight": "model-00025-of-00031.safetensors", "model.layers.68.mlp.up_proj.weight": "model-00025-of-00031.safetensors", "model.layers.68.post_attention_layernorm.weight": "model-00025-of-00031.safetensors", "model.layers.68.self_attn.k_proj.bias": "model-00025-of-00031.safetensors", "model.layers.68.self_attn.k_proj.weight": "model-00025-of-00031.safetensors", "model.layers.68.self_attn.o_proj.weight": "model-00025-of-00031.safetensors", "model.layers.68.self_attn.q_proj.bias": "model-00025-of-00031.safetensors", "model.layers.68.self_attn.q_proj.weight": "model-00025-of-00031.safetensors", "model.layers.68.self_attn.v_proj.bias": "model-00025-of-00031.safetensors", "model.layers.68.self_attn.v_proj.weight": "model-00025-of-00031.safetensors", "model.layers.69.input_layernorm.weight": "model-00025-of-00031.safetensors", "model.layers.69.mlp.down_proj.weight": "model-00026-of-00031.safetensors", "model.layers.69.mlp.gate_proj.weight": "model-00026-of-00031.safetensors", "model.layers.69.mlp.up_proj.weight": "model-00026-of-00031.safetensors", "model.layers.69.post_attention_layernorm.weight": "model-00026-of-00031.safetensors", "model.layers.69.self_attn.k_proj.bias": "model-00026-of-00031.safetensors", "model.layers.69.self_attn.k_proj.weight": "model-00026-of-00031.safetensors", "model.layers.69.self_attn.o_proj.weight": "model-00026-of-00031.safetensors", "model.layers.69.self_attn.q_proj.bias": "model-00026-of-00031.safetensors", "model.layers.69.self_attn.q_proj.weight": "model-00026-of-00031.safetensors", "model.layers.69.self_attn.v_proj.bias": "model-00026-of-00031.safetensors", "model.layers.69.self_attn.v_proj.weight": "model-00026-of-00031.safetensors", "model.layers.7.input_layernorm.weight": "model-00026-of-00031.safetensors", "model.layers.7.mlp.down_proj.weight": "model-00026-of-00031.safetensors", "model.layers.7.mlp.gate_proj.weight": "model-00026-of-00031.safetensors", "model.layers.7.mlp.up_proj.weight": "model-00026-of-00031.safetensors", "model.layers.7.post_attention_layernorm.weight": "model-00026-of-00031.safetensors", "model.layers.7.self_attn.k_proj.bias": "model-00026-of-00031.safetensors", "model.layers.7.self_attn.k_proj.weight": "model-00026-of-00031.safetensors", "model.layers.7.self_attn.o_proj.weight": "model-00026-of-00031.safetensors", "model.layers.7.self_attn.q_proj.bias": "model-00026-of-00031.safetensors", "model.layers.7.self_attn.q_proj.weight": "model-00026-of-00031.safetensors", "model.layers.7.self_attn.v_proj.bias": "model-00026-of-00031.safetensors", "model.layers.7.self_attn.v_proj.weight": "model-00026-of-00031.safetensors", "model.layers.70.input_layernorm.weight": "model-00026-of-00031.safetensors", "model.layers.70.mlp.down_proj.weight": "model-00026-of-00031.safetensors", "model.layers.70.mlp.gate_proj.weight": "model-00026-of-00031.safetensors", "model.layers.70.mlp.up_proj.weight": "model-00026-of-00031.safetensors", "model.layers.70.post_attention_layernorm.weight": "model-00026-of-00031.safetensors", "model.layers.70.self_attn.k_proj.bias": "model-00026-of-00031.safetensors", "model.layers.70.self_attn.k_proj.weight": "model-00026-of-00031.safetensors", "model.layers.70.self_attn.o_proj.weight": "model-00027-of-00031.safetensors", "model.layers.70.self_attn.q_proj.bias": "model-00027-of-00031.safetensors", "model.layers.70.self_attn.q_proj.weight": "model-00027-of-00031.safetensors", "model.layers.70.self_attn.v_proj.bias": "model-00027-of-00031.safetensors", "model.layers.70.self_attn.v_proj.weight": "model-00027-of-00031.safetensors", "model.layers.71.input_layernorm.weight": "model-00027-of-00031.safetensors", "model.layers.71.mlp.down_proj.weight": "model-00027-of-00031.safetensors", "model.layers.71.mlp.gate_proj.weight": "model-00027-of-00031.safetensors", "model.layers.71.mlp.up_proj.weight": "model-00027-of-00031.safetensors", "model.layers.71.post_attention_layernorm.weight": "model-00027-of-00031.safetensors", "model.layers.71.self_attn.k_proj.bias": "model-00027-of-00031.safetensors", "model.layers.71.self_attn.k_proj.weight": "model-00027-of-00031.safetensors", "model.layers.71.self_attn.o_proj.weight": "model-00027-of-00031.safetensors", "model.layers.71.self_attn.q_proj.bias": "model-00027-of-00031.safetensors", "model.layers.71.self_attn.q_proj.weight": "model-00027-of-00031.safetensors", "model.layers.71.self_attn.v_proj.bias": "model-00027-of-00031.safetensors", "model.layers.71.self_attn.v_proj.weight": "model-00027-of-00031.safetensors", "model.layers.72.input_layernorm.weight": "model-00027-of-00031.safetensors", "model.layers.72.mlp.down_proj.weight": "model-00027-of-00031.safetensors", "model.layers.72.mlp.gate_proj.weight": "model-00027-of-00031.safetensors", "model.layers.72.mlp.up_proj.weight": "model-00027-of-00031.safetensors", "model.layers.72.post_attention_layernorm.weight": "model-00027-of-00031.safetensors", "model.layers.72.self_attn.k_proj.bias": "model-00027-of-00031.safetensors", "model.layers.72.self_attn.k_proj.weight": "model-00027-of-00031.safetensors", "model.layers.72.self_attn.o_proj.weight": "model-00027-of-00031.safetensors", "model.layers.72.self_attn.q_proj.bias": "model-00027-of-00031.safetensors", "model.layers.72.self_attn.q_proj.weight": "model-00027-of-00031.safetensors", "model.layers.72.self_attn.v_proj.bias": "model-00027-of-00031.safetensors", "model.layers.72.self_attn.v_proj.weight": "model-00027-of-00031.safetensors", "model.layers.73.input_layernorm.weight": "model-00027-of-00031.safetensors", "model.layers.73.mlp.down_proj.weight": "model-00027-of-00031.safetensors", "model.layers.73.mlp.gate_proj.weight": "model-00027-of-00031.safetensors", "model.layers.73.mlp.up_proj.weight": "model-00028-of-00031.safetensors", "model.layers.73.post_attention_layernorm.weight": "model-00028-of-00031.safetensors", "model.layers.73.self_attn.k_proj.bias": "model-00028-of-00031.safetensors", "model.layers.73.self_attn.k_proj.weight": "model-00028-of-00031.safetensors", "model.layers.73.self_attn.o_proj.weight": "model-00028-of-00031.safetensors", "model.layers.73.self_attn.q_proj.bias": "model-00028-of-00031.safetensors", "model.layers.73.self_attn.q_proj.weight": "model-00028-of-00031.safetensors", "model.layers.73.self_attn.v_proj.bias": "model-00028-of-00031.safetensors", "model.layers.73.self_attn.v_proj.weight": "model-00028-of-00031.safetensors", "model.layers.74.input_layernorm.weight": "model-00028-of-00031.safetensors", "model.layers.74.mlp.down_proj.weight": "model-00028-of-00031.safetensors", "model.layers.74.mlp.gate_proj.weight": "model-00028-of-00031.safetensors", "model.layers.74.mlp.up_proj.weight": "model-00028-of-00031.safetensors", "model.layers.74.post_attention_layernorm.weight": "model-00028-of-00031.safetensors", "model.layers.74.self_attn.k_proj.bias": "model-00028-of-00031.safetensors", "model.layers.74.self_attn.k_proj.weight": "model-00028-of-00031.safetensors", "model.layers.74.self_attn.o_proj.weight": "model-00028-of-00031.safetensors", "model.layers.74.self_attn.q_proj.bias": "model-00028-of-00031.safetensors", "model.layers.74.self_attn.q_proj.weight": "model-00028-of-00031.safetensors", "model.layers.74.self_attn.v_proj.bias": "model-00028-of-00031.safetensors", "model.layers.74.self_attn.v_proj.weight": "model-00028-of-00031.safetensors", "model.layers.75.input_layernorm.weight": "model-00028-of-00031.safetensors", "model.layers.75.mlp.down_proj.weight": "model-00028-of-00031.safetensors", "model.layers.75.mlp.gate_proj.weight": "model-00028-of-00031.safetensors", "model.layers.75.mlp.up_proj.weight": "model-00028-of-00031.safetensors", "model.layers.75.post_attention_layernorm.weight": "model-00028-of-00031.safetensors", "model.layers.75.self_attn.k_proj.bias": "model-00028-of-00031.safetensors", "model.layers.75.self_attn.k_proj.weight": "model-00028-of-00031.safetensors", "model.layers.75.self_attn.o_proj.weight": "model-00028-of-00031.safetensors", "model.layers.75.self_attn.q_proj.bias": "model-00028-of-00031.safetensors", "model.layers.75.self_attn.q_proj.weight": "model-00028-of-00031.safetensors", "model.layers.75.self_attn.v_proj.bias": "model-00028-of-00031.safetensors", "model.layers.75.self_attn.v_proj.weight": "model-00028-of-00031.safetensors", "model.layers.76.input_layernorm.weight": "model-00028-of-00031.safetensors", "model.layers.76.mlp.down_proj.weight": "model-00028-of-00031.safetensors", "model.layers.76.mlp.gate_proj.weight": "model-00029-of-00031.safetensors", "model.layers.76.mlp.up_proj.weight": "model-00029-of-00031.safetensors", "model.layers.76.post_attention_layernorm.weight": "model-00029-of-00031.safetensors", "model.layers.76.self_attn.k_proj.bias": "model-00029-of-00031.safetensors", "model.layers.76.self_attn.k_proj.weight": "model-00029-of-00031.safetensors", "model.layers.76.self_attn.o_proj.weight": "model-00029-of-00031.safetensors", "model.layers.76.self_attn.q_proj.bias": "model-00029-of-00031.safetensors", "model.layers.76.self_attn.q_proj.weight": "model-00029-of-00031.safetensors", "model.layers.76.self_attn.v_proj.bias": "model-00029-of-00031.safetensors", "model.layers.76.self_attn.v_proj.weight": "model-00029-of-00031.safetensors", "model.layers.77.input_layernorm.weight": "model-00029-of-00031.safetensors", "model.layers.77.mlp.down_proj.weight": "model-00029-of-00031.safetensors", "model.layers.77.mlp.gate_proj.weight": "model-00029-of-00031.safetensors", "model.layers.77.mlp.up_proj.weight": "model-00029-of-00031.safetensors", "model.layers.77.post_attention_layernorm.weight": "model-00029-of-00031.safetensors", "model.layers.77.self_attn.k_proj.bias": "model-00029-of-00031.safetensors", "model.layers.77.self_attn.k_proj.weight": "model-00029-of-00031.safetensors", "model.layers.77.self_attn.o_proj.weight": "model-00029-of-00031.safetensors", "model.layers.77.self_attn.q_proj.bias": "model-00029-of-00031.safetensors", "model.layers.77.self_attn.q_proj.weight": "model-00029-of-00031.safetensors", "model.layers.77.self_attn.v_proj.bias": "model-00029-of-00031.safetensors", "model.layers.77.self_attn.v_proj.weight": "model-00029-of-00031.safetensors", "model.layers.78.input_layernorm.weight": "model-00029-of-00031.safetensors", "model.layers.78.mlp.down_proj.weight": "model-00029-of-00031.safetensors", "model.layers.78.mlp.gate_proj.weight": "model-00029-of-00031.safetensors", "model.layers.78.mlp.up_proj.weight": "model-00029-of-00031.safetensors", "model.layers.78.post_attention_layernorm.weight": "model-00029-of-00031.safetensors", "model.layers.78.self_attn.k_proj.bias": "model-00029-of-00031.safetensors", "model.layers.78.self_attn.k_proj.weight": "model-00029-of-00031.safetensors", "model.layers.78.self_attn.o_proj.weight": "model-00029-of-00031.safetensors", "model.layers.78.self_attn.q_proj.bias": "model-00029-of-00031.safetensors", "model.layers.78.self_attn.q_proj.weight": "model-00029-of-00031.safetensors", "model.layers.78.self_attn.v_proj.bias": "model-00029-of-00031.safetensors", "model.layers.78.self_attn.v_proj.weight": "model-00029-of-00031.safetensors", "model.layers.79.input_layernorm.weight": "model-00029-of-00031.safetensors", "model.layers.79.mlp.down_proj.weight": "model-00030-of-00031.safetensors", "model.layers.79.mlp.gate_proj.weight": "model-00030-of-00031.safetensors", "model.layers.79.mlp.up_proj.weight": "model-00030-of-00031.safetensors", "model.layers.79.post_attention_layernorm.weight": "model-00030-of-00031.safetensors", "model.layers.79.self_attn.k_proj.bias": "model-00030-of-00031.safetensors", "model.layers.79.self_attn.k_proj.weight": "model-00030-of-00031.safetensors", "model.layers.79.self_attn.o_proj.weight": "model-00030-of-00031.safetensors", "model.layers.79.self_attn.q_proj.bias": "model-00030-of-00031.safetensors", "model.layers.79.self_attn.q_proj.weight": "model-00030-of-00031.safetensors", "model.layers.79.self_attn.v_proj.bias": "model-00030-of-00031.safetensors", "model.layers.79.self_attn.v_proj.weight": "model-00030-of-00031.safetensors", "model.layers.8.input_layernorm.weight": "model-00030-of-00031.safetensors", "model.layers.8.mlp.down_proj.weight": "model-00030-of-00031.safetensors", "model.layers.8.mlp.gate_proj.weight": "model-00030-of-00031.safetensors", "model.layers.8.mlp.up_proj.weight": "model-00030-of-00031.safetensors", "model.layers.8.post_attention_layernorm.weight": "model-00030-of-00031.safetensors", "model.layers.8.self_attn.k_proj.bias": "model-00030-of-00031.safetensors", "model.layers.8.self_attn.k_proj.weight": "model-00030-of-00031.safetensors", "model.layers.8.self_attn.o_proj.weight": "model-00030-of-00031.safetensors", "model.layers.8.self_attn.q_proj.bias": "model-00030-of-00031.safetensors", "model.layers.8.self_attn.q_proj.weight": "model-00030-of-00031.safetensors", "model.layers.8.self_attn.v_proj.bias": "model-00030-of-00031.safetensors", "model.layers.8.self_attn.v_proj.weight": "model-00030-of-00031.safetensors", "model.layers.9.input_layernorm.weight": "model-00030-of-00031.safetensors", "model.layers.9.mlp.down_proj.weight": "model-00030-of-00031.safetensors", "model.layers.9.mlp.gate_proj.weight": "model-00030-of-00031.safetensors", "model.layers.9.mlp.up_proj.weight": "model-00030-of-00031.safetensors", "model.layers.9.post_attention_layernorm.weight": "model-00030-of-00031.safetensors", "model.layers.9.self_attn.k_proj.bias": "model-00030-of-00031.safetensors", "model.layers.9.self_attn.k_proj.weight": "model-00030-of-00031.safetensors", "model.layers.9.self_attn.o_proj.weight": "model-00031-of-00031.safetensors", "model.layers.9.self_attn.q_proj.bias": "model-00031-of-00031.safetensors", "model.layers.9.self_attn.q_proj.weight": "model-00031-of-00031.safetensors", "model.layers.9.self_attn.v_proj.bias": "model-00031-of-00031.safetensors", "model.layers.9.self_attn.v_proj.weight": "model-00031-of-00031.safetensors", "model.norm.weight": "model-00031-of-00031.safetensors"}}

output-00001-of-00007.safetensors ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:17f58bf9376666d4f87696cafa5394f87362a9782b19a1b1d0a98f0c1f9c5cf9
+size 8534104712

output-00002-of-00007.safetensors ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:3349a48735631d1fad69d33af469b9c02b7a5958f214b18f4504d7682a78dde5
+size 8470856906

output-00003-of-00007.safetensors ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:15403a62e6282b002fc907349ce9786a4c31f0f424a790cc385fd01de605b0e2
+size 8579564508

output-00004-of-00007.safetensors ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:75144bc0d3735a67ea305f3a8bf5a35aec09b789b737c29dfc2cea442431f95b
+size 8557086952

output-00005-of-00007.safetensors ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:511800ad4e3f727ea9f60cf833962507f68a3a2b260d09564ef62bceb9144448
+size 8398437310

output-00006-of-00007.safetensors ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:362beda9c8eca65a34b36227490f98b4f3f415649a8e86b445c19b4dac866994
+size 8443422542

output-00007-of-00007.safetensors ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:11a9dff78273726dc6f522dcf48e81f1a9c647e758972c1cb60760204eff422a
+size 4968289074

special_tokens_map.json ADDED Viewed

	@@ -0,0 +1,20 @@

+{
+  "additional_special_tokens": [
+    "<|im_start|>",
+    "<|im_end|>"
+  ],
+  "eos_token": {
+    "content": "<|im_end|>",
+    "lstrip": false,
+    "normalized": false,
+    "rstrip": false,
+    "single_word": false
+  },
+  "pad_token": {
+    "content": "<|end_of_text|>",
+    "lstrip": false,
+    "normalized": false,
+    "rstrip": false,
+    "single_word": false
+  }
+}

tokenizer.json ADDED Viewed

The diff for this file is too large to render. See raw diff

tokenizer_config.json ADDED Viewed

	@@ -0,0 +1,51 @@

+{
+  "add_prefix_space": false,
+  "added_tokens_decoder": {
+    "151643": {
+      "content": "<|endoftext|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "151644": {
+      "content": "<|im_start|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": false
+    },
+    "151645": {
+      "content": "<|im_end|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": false
+    },
+    "151646": {
+      "content": "<|end_of_text|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    }
+  },
+  "additional_special_tokens": [
+    "<|im_start|>",
+    "<|im_end|>"
+  ],
+  "bos_token": null,
+  "chat_template": "{% if not add_generation_prompt is defined %}{% set add_generation_prompt = false %}{% endif %}{% for message in messages %}{{'<|im_start|>' + message['role'] + '\n' + message['content'] + '<|im_end|>' + '\n'}}{% endfor %}{% if add_generation_prompt %}{{ '<|im_start|>assistant\n' }}{% endif %}",
+  "clean_up_tokenization_spaces": false,
+  "eos_token": "<|im_end|>",
+  "errors": "replace",
+  "model_max_length": 131072,
+  "pad_token": "<|end_of_text|>",
+  "split_special_tokens": false,
+  "tokenizer_class": "Qwen2Tokenizer",
+  "unk_token": null
+}