Upload folder using huggingface_hub

Browse files

Files changed (13) hide show

README.md +524 -0
added_tokens.json +33 -0
config.json +195 -0
configuration_intern_vit.py +120 -0
configuration_internvl_chat.py +95 -0
generation_config.json +9 -0
merges.txt +0 -0
model-00001-of-00002.safetensors +3 -0
model-00002-of-00002.safetensors +3 -0
model.safetensors.index.json +788 -0
special_tokens_map.json +40 -0
tokenizer_config.json +290 -0
vocab.json +0 -0

README.md ADDED Viewed

	@@ -0,0 +1,524 @@

+---
+license: mit
+language:
+- multilingual
+tags:
+- nlp
+base_model: OpenGVLab/InternVL2_5-4B
+pipeline_tag: text-generation
+inference: true
+---
+# NuExtract-2.0-4B by NuMind 🔥
+NuExtract 2.0 is a family of models trained specifically for structured information extraction tasks. It supports both multimodal inputs and is multilingual.
+We provide several versions of different sizes, all based on the InternVL2.5 family.
+| Model Size | Model Name | Base Model | Huggingface Link |
+|------------|------------|------------|------------------|
+| 2B | NuExtract-2.0-2B | [InternVL2_5-2B](https://huggingface.co/OpenGVLab/InternVL2_5-2B) | [NuExtract-2.0-2B](https://huggingface.co/numind/NuExtract-2.0-2B) |
+| 4B | NuExtract-2.0-4B | [InternVL2_5-4B](https://huggingface.co/OpenGVLab/InternVL2_5-4B) | [NuExtract-2.0-4B](https://huggingface.co/numind/NuExtract-2.0-4B) |
+| 8B | NuExtract-2.0-8B | [InternVL2_5-8B](https://huggingface.co/OpenGVLab/InternVL2_5-8B) | [NuExtract-2.0-8B](https://huggingface.co/numind/NuExtract-2.0-8B) |
+## Overview
+To use the model, provide an input text/image and a JSON template describing the information you need to extract. The template should be a JSON object, specifying field names and their expected type.
+Support types include:
+* `verbatim-string` - instructs the model to extract text that is present verbatim in the input.
+* `string` - a generic string field that can incorporate paraphrasing/abstraction.
+* `integer` - a whole number.
+* `number` - a whole or decimal number.
+* `date-time` - ISO formatted date.
+* `enum` - a choice from set of possible answers (represented in template as an array of options, e.g. `["yes", "no", "maybe"]`).
+* `multi-label` - an enum that can have multiple possible answers (represented in template as a double-wrapped array, e.g. `[["A", "B", "C"]]`).
+The following is an example template:
+```json
+{
+  "first_name": "verbatim-string",
+  "last_name": "verbatim-string",
+  "description": "string",
+  "age": "integer",
+  "gpa": "number",
+  "birth_date": "date-time",
+  "nationality": ["France", "England", "Japan", "USA", "China"],
+  "languages_spoken": [["English", "French", "Japanese", "Mandarin", "Spanish"]]
+}
+```
+⚠️ We recommend using NuExtract with a temperature at or very close to 0. Some inference frameworks, such as Ollama, use a default of 0.7 which is not well suited to many extraction tasks.
+## Inference
+Use the following code to handle loading and preprocessing of input data:
+```python
+import torch
+import torchvision.transforms as T
+from PIL import Image
+from torchvision.transforms.functional import InterpolationMode
+IMAGENET_MEAN = (0.485, 0.456, 0.406)
+IMAGENET_STD = (0.229, 0.224, 0.225)
+def build_transform(input_size):
+    MEAN, STD = IMAGENET_MEAN, IMAGENET_STD
+    transform = T.Compose([
+        T.Lambda(lambda img: img.convert('RGB') if img.mode != 'RGB' else img),
+        T.Resize((input_size, input_size), interpolation=InterpolationMode.BICUBIC),
+        T.ToTensor(),
+        T.Normalize(mean=MEAN, std=STD)
+    ])
+    return transform
+def find_closest_aspect_ratio(aspect_ratio, target_ratios, width, height, image_size):
+    best_ratio_diff = float('inf')
+    best_ratio = (1, 1)
+    area = width * height
+    for ratio in target_ratios:
+        target_aspect_ratio = ratio[0] / ratio[1]
+        ratio_diff = abs(aspect_ratio - target_aspect_ratio)
+        if ratio_diff < best_ratio_diff:
+            best_ratio_diff = ratio_diff
+            best_ratio = ratio
+        elif ratio_diff == best_ratio_diff:
+            if area > 0.5 * image_size * image_size * ratio[0] * ratio[1]:
+                best_ratio = ratio
+    return best_ratio
+def dynamic_preprocess(image, min_num=1, max_num=12, image_size=448, use_thumbnail=False):
+    orig_width, orig_height = image.size
+    aspect_ratio = orig_width / orig_height
+    # calculate the existing image aspect ratio
+    target_ratios = set(
+        (i, j) for n in range(min_num, max_num + 1) for i in range(1, n + 1) for j in range(1, n + 1) if
+        i * j <= max_num and i * j >= min_num)
+    target_ratios = sorted(target_ratios, key=lambda x: x[0] * x[1])
+    # find the closest aspect ratio to the target
+    target_aspect_ratio = find_closest_aspect_ratio(
+        aspect_ratio, target_ratios, orig_width, orig_height, image_size)
+    # calculate the target width and height
+    target_width = image_size * target_aspect_ratio[0]
+    target_height = image_size * target_aspect_ratio[1]
+    blocks = target_aspect_ratio[0] * target_aspect_ratio[1]
+    # resize the image
+    resized_img = image.resize((target_width, target_height))
+    processed_images = []
+    for i in range(blocks):
+        box = (
+            (i % (target_width // image_size)) * image_size,
+            (i // (target_width // image_size)) * image_size,
+            ((i % (target_width // image_size)) + 1) * image_size,
+            ((i // (target_width // image_size)) + 1) * image_size
+        )
+        # split the image
+        split_img = resized_img.crop(box)
+        processed_images.append(split_img)
+    assert len(processed_images) == blocks
+    if use_thumbnail and len(processed_images) != 1:
+        thumbnail_img = image.resize((image_size, image_size))
+        processed_images.append(thumbnail_img)
+    return processed_images
+def load_image(image_file, input_size=448, max_num=12):
+    image = Image.open(image_file).convert('RGB')
+    transform = build_transform(input_size=input_size)
+    images = dynamic_preprocess(image, image_size=input_size, use_thumbnail=True, max_num=max_num)
+    pixel_values = [transform(image) for image in images]
+    pixel_values = torch.stack(pixel_values)
+    return pixel_values
+def prepare_inputs(messages, image_paths, tokenizer, device='cuda', dtype=torch.bfloat16):
+    """
+    Prepares multi-modal input components (supports multiple images per prompt).
+    Args:
+        messages: List of input messages/prompts (strings or dicts with 'role' and 'content')
+        image_paths: List where each element is either None (for text-only) or a list of image paths
+        tokenizer: The tokenizer to use for applying chat templates
+        device: Device to place tensors on ('cuda', 'cpu', etc.)
+        dtype: Data type for image tensors (default: torch.bfloat16)
+    Returns:
+        dict: Contains 'prompts', 'pixel_values_list', and 'num_patches_list' ready for the model
+    """
+    # Make sure image_paths list is at least as long as messages
+    if len(image_paths) < len(messages):
+        # Pad with None for text-only messages
+        image_paths = image_paths + [None] * (len(messages) - len(image_paths))
+    # Process images and collect patch information
+    loaded_images = []
+    num_patches_list = []
+    for paths in image_paths:
+        if paths and isinstance(paths, list) and len(paths) > 0:
+            # Load each image in this prompt
+            prompt_images = []
+            prompt_patches = []
+            for path in paths:
+                # Load the image
+                img = load_image(path).to(dtype=dtype, device=device)
+                # Ensure img has correct shape [patches, C, H, W]
+                if len(img.shape) == 3:  # [C, H, W] -> [1, C, H, W]
+                    img = img.unsqueeze(0)
+                prompt_images.append(img)
+                # Record the number of patches for this image
+                prompt_patches.append(img.shape[0])
+            loaded_images.append(prompt_images)
+            num_patches_list.append(prompt_patches)
+        else:
+            # Text-only prompt
+            loaded_images.append(None)
+            num_patches_list.append([])
+    # Create the concatenated pixel_values_list
+    pixel_values_list = []
+    for prompt_images in loaded_images:
+        if prompt_images:
+            # Concatenate all images for this prompt
+            pixel_values_list.append(torch.cat(prompt_images, dim=0))
+        else:
+            # Text-only prompt
+            pixel_values_list.append(None)
+    # Format messages for the model
+    if all(isinstance(m, str) for m in messages):
+        # Simple string messages: convert to chat format
+        batch_messages = [
+            [{"role": "user", "content": message}]
+            for message in messages
+        ]
+    else:
+        # Assume messages are already in the right format
+        batch_messages = messages
+    # Apply chat template
+    prompts = tokenizer.apply_chat_template(
+        batch_messages,
+        tokenize=False,
+        add_generation_prompt=True
+    )
+    return {
+        'prompts': prompts,
+        'pixel_values_list': pixel_values_list,
+        'num_patches_list': num_patches_list
+    }
+def construct_message(text, template, examples=None):
+    """
+    Construct the individual NuExtract message texts, prior to chat template formatting.
+    """
+    # add few-shot examples if needed
+    if examples is not None and len(examples) > 0:
+        icl = "# Examples:\n"
+        for row in examples:
+            icl += f"## Input:\n{row['input']}\n## Output:\n{row['output']}\n"
+    else:
+        icl = ""
+    return f"""# Template:\n{template}\n{icl}# Context:\n{text}"""
+```
+To handle inference:
+```python
+IMG_START_TOKEN='<img>'
+IMG_END_TOKEN='</img>'
+IMG_CONTEXT_TOKEN='<IMG_CONTEXT>'
+def nuextract_generate(model, tokenizer, prompts, generation_config, pixel_values_list=None, num_patches_list=None):
+    """
+    Generate responses for a batch of NuExtract inputs.
+    Support for multiple and varying numbers of images per prompt.
+    Args:
+        model: The vision-language model
+        tokenizer: The tokenizer for the model
+        pixel_values_list: List of tensor batches, one per prompt
+                          Each batch has shape [num_images, channels, height, width] or None for text-only prompts
+        prompts: List of text prompts
+        generation_config: Configuration for text generation
+        num_patches_list: List of lists, each containing patch counts for images in a prompt
+    Returns:
+        List of generated responses
+    """
+    img_context_token_id = tokenizer.convert_tokens_to_ids(IMG_CONTEXT_TOKEN)
+    model.img_context_token_id = img_context_token_id
+    # Replace all image placeholders with appropriate tokens
+    modified_prompts = []
+    total_image_files = 0
+    total_patches = 0
+    image_containing_prompts = []
+    for idx, prompt in enumerate(prompts):
+        # check if this prompt has images
+        has_images = (pixel_values_list and
+                      idx < len(pixel_values_list) and
+                      pixel_values_list[idx] is not None and
+                      isinstance(pixel_values_list[idx], torch.Tensor) and
+                      pixel_values_list[idx].shape[0] > 0)
+        if has_images:
+            # prompt with image placeholders
+            image_containing_prompts.append(idx)
+            modified_prompt = prompt
+            patches = num_patches_list[idx] if (num_patches_list and idx < len(num_patches_list)) else []
+            num_images = len(patches)
+            total_image_files += num_images
+            total_patches += sum(patches)
+            # replace each <image> placeholder with image tokens
+            for i, num_patches in enumerate(patches):
+                image_tokens = IMG_START_TOKEN + IMG_CONTEXT_TOKEN * model.num_image_token * num_patches + IMG_END_TOKEN
+                modified_prompt = modified_prompt.replace('<image>', image_tokens, 1)
+        else:
+            # text-only prompt
+            modified_prompt = prompt
+        modified_prompts.append(modified_prompt)
+    # process all prompts in a single batch
+    tokenizer.padding_side = 'left'
+    model_inputs = tokenizer(modified_prompts, return_tensors='pt', padding=True)
+    input_ids = model_inputs['input_ids'].to(model.device)
+    attention_mask = model_inputs['attention_mask'].to(model.device)
+    eos_token_id = tokenizer.convert_tokens_to_ids("<|im_end|>\n".strip())
+    generation_config['eos_token_id'] = eos_token_id
+    # prepare pixel values
+    flattened_pixel_values = None
+    if image_containing_prompts:
+        # collect and concatenate all image tensors
+        all_pixel_values = []
+        for idx in image_containing_prompts:
+            all_pixel_values.append(pixel_values_list[idx])
+        flattened_pixel_values = torch.cat(all_pixel_values, dim=0)
+        print(f"Processing batch with {len(prompts)} prompts, {total_image_files} actual images, and {total_patches} total patches")
+    else:
+        print(f"Processing text-only batch with {len(prompts)} prompts")
+    # generate outputs
+    outputs = model.generate(
+        pixel_values=flattened_pixel_values,  # will be None for text-only prompts
+        input_ids=input_ids,
+        attention_mask=attention_mask,
+        **generation_config
+    )
+    # Decode responses
+    responses = tokenizer.batch_decode(outputs, skip_special_tokens=True)
+    return responses
+```
+To load the model:
+```python
+import torch
+from transformers import AutoModelForCausalLM, AutoTokenizer
+model_name = ""
+tokenizer = AutoTokenizer.from_pretrained(model_name, trust_remote_code=True, padding_side='left')
+model = AutoModelForCausalLM.from_pretrained(model_name, trust_remote_code=True,
+                                             torch_dtype=torch.bfloat16,
+                                             attn_implementation="flash_attention_2" # we recommend using flash attention
+                                            ).to("cuda")
+```
+Simple 0-shot text-only example:
+```python
+template = """{"names": ["verbatim-string"]}"""
+text = "John went to the restaurant with Mary. James went to the cinema."
+input_messages = [construct_message(text, template)]
+input_content = prepare_inputs(
+    messages=input_messages,
+    image_paths=[],
+    tokenizer=tokenizer,
+)
+generation_config = {"do_sample": False, "num_beams": 1, "max_new_tokens": 2048}
+with torch.no_grad():
+    result = nuextract_generate(
+        model=model,
+        tokenizer=tokenizer,
+        prompts=input_content['prompts'],
+        pixel_values_list=input_content['pixel_values_list'],
+        num_patches_list=input_content['num_patches_list'],
+        generation_config=generation_config
+    )
+for y in result:
+    print(y)
+# {"names": ["John", "Mary", "James"]}
+```
+Text-only input with an in-context example:
+```python
+template = """{"names": ["verbatim-string"], "female_names": ["verbatim-string"]}"""
+text = "John went to the restaurant with Mary. James went to the cinema."
+examples = [
+    {
+        "input": "Stephen is the manager at Susan's store.",
+        "output": """{"names": ["STEPHEN", "SUSAN"], "female_names": ["SUSAN"]}"""
+    }
+]
+input_messages = [construct_message(text, template, examples)]
+input_content = prepare_inputs(
+    messages=input_messages,
+    image_paths=[],
+    tokenizer=tokenizer,
+)
+generation_config = {"do_sample": False, "num_beams": 1, "max_new_tokens": 2048}
+with torch.no_grad():
+    result = nuextract_generate(
+        model=model,
+        tokenizer=tokenizer,
+        prompts=input_content['prompts'],
+        pixel_values_list=input_content['pixel_values_list'],
+        num_patches_list=input_content['num_patches_list'],
+        generation_config=generation_config
+    )
+for y in result:
+    print(y)
+# {"names": ["JOHN", "MARY", "JAMES"], "female_names": ["MARY"]}
+```
+Example with image input and an in-context example. Image inputs should use `<image>` placeholder instead of text and image paths should be provided in a list in order of appearance in the prompt (in this example `0.jpg` will be for the in-context example and `1.jpg` for the true input).
+```python
+template = """{"store": "verbatim-string"}"""
+text = "<image>"
+examples = [
+    {
+        "input": "<image>",
+        "output": """{"store": "Walmart"}"""
+    }
+]
+input_messages = [construct_message(text, template, examples)]
+images = [
+    ["0.jpg", "1.jpg"]
+]
+input_content = prepare_inputs(
+    messages=input_messages,
+    image_paths=images,
+    tokenizer=tokenizer,
+)
+generation_config = {"do_sample": False, "num_beams": 1, "max_new_tokens": 2048}
+with torch.no_grad():
+    result = nuextract_generate(
+        model=model,
+        tokenizer=tokenizer,
+        prompts=input_content['prompts'],
+        pixel_values_list=input_content['pixel_values_list'],
+        num_patches_list=input_content['num_patches_list'],
+        generation_config=generation_config
+    )
+for y in result:
+    print(y)
+# {"store": "Trader Joe's"}
+```
+Multi-modal batched input:
+```python
+inputs = [
+    # image input with no ICL examples
+    {
+        "text": "<image>",
+        "template": """{"store_name": "verbatim-string"}""",
+        "examples": None,
+    },
+    # image input with 1 ICL example
+    {
+        "text": "<image>",
+        "template": """{"store_name": "verbatim-string"}""",
+        "examples": [
+            {
+                "input": "<image>",
+                "output": """{"store_name": "Walmart"}""",
+            }
+        ],
+    },
+    # text input with no ICL examples
+    {
+        "text": "John went to the restaurant with Mary. James went to the cinema.",
+        "template": """{"names": ["verbatim-string"]}""",
+        "examples": None,
+    },
+    # text input with ICL example
+    {
+        "text": "John went to the restaurant with Mary. James went to the cinema.",
+        "template": """{"names": ["verbatim-string"], "female_names": ["verbatim-string"]}""",
+        "examples": [
+            {
+                "input": "Stephen is the manager at Susan's store.",
+                "output": """{"names": ["STEPHEN", "SUSAN"], "female_names": ["SUSAN"]}"""
+            }
+        ],
+    },
+]
+input_messages = [
+    construct_message(
+        x["text"],
+        x["template"],
+        x["examples"]
+    ) for x in inputs
+]
+images = [
+    ["0.jpg"],
+    ["0.jpg", "1.jpg"],
+    None,
+    None
+]
+input_content = prepare_inputs(
+    messages=input_messages,
+    image_paths=images,
+    tokenizer=tokenizer,
+)
+generation_config = {"do_sample": False, "num_beams": 1, "max_new_tokens": 2048}
+with torch.no_grad():
+    result = nuextract_generate(
+        model=model,
+        tokenizer=tokenizer,
+        prompts=input_content['prompts'],
+        pixel_values_list=input_content['pixel_values_list'],
+        num_patches_list=input_content['num_patches_list'],
+        generation_config=generation_config
+    )
+for y in result:
+    print(y)
+# {"store_name": "WAL*MART"}
+# {"store_name": "Trader Joe's"}
+# {"names": ["John", "Mary", "James"]}
+# {"names": ["JOHN", "MARY", "JAMES"], "female_names": ["MARY"]}
+```

added_tokens.json ADDED Viewed

	@@ -0,0 +1,33 @@

+{
+  "</box>": 151673,
+  "</img>": 151666,
+  "</quad>": 151669,
+  "</ref>": 151671,
+  "</tool_call>": 151658,
+  "<IMG_CONTEXT>": 151667,
+  "<box>": 151672,
+  "<img>": 151665,
+  "<quad>": 151668,
+  "<ref>": 151670,
+  "<tool_call>": 151657,
+  "<|box_end|>": 151649,
+  "<|box_start|>": 151648,
+  "<|endoftext|>": 151643,
+  "<|file_sep|>": 151664,
+  "<|fim_middle|>": 151660,
+  "<|fim_pad|>": 151662,
+  "<|fim_prefix|>": 151659,
+  "<|fim_suffix|>": 151661,
+  "<|im_end|>": 151645,
+  "<|im_start|>": 151644,
+  "<|image_pad|>": 151655,
+  "<|object_ref_end|>": 151647,
+  "<|object_ref_start|>": 151646,
+  "<|quad_end|>": 151651,
+  "<|quad_start|>": 151650,
+  "<|repo_name|>": 151663,
+  "<|video_pad|>": 151656,
+  "<|vision_end|>": 151653,
+  "<|vision_pad|>": 151654,
+  "<|vision_start|>": 151652
+}

config.json ADDED Viewed

	@@ -0,0 +1,195 @@

+{
+  "_commit_hash": null,
+  "_name_or_path": "experiments/intervl4B_filter/checkpoint-6000",
+  "architectures": [
+    "InternVLChatModel"
+  ],
+  "auto_map": {
+    "AutoConfig": "configuration_internvl_chat.InternVLChatConfig",
+    "AutoModel": "OpenGVLab/InternVL2_5-4B-MPO--modeling_internvl_chat.InternVLChatModel",
+    "AutoModelForCausalLM": "OpenGVLab/InternVL2_5-4B-MPO--modeling_internvl_chat.InternVLChatModel"
+  },
+  "downsample_ratio": 0.5,
+  "dynamic_image_size": true,
+  "force_image_size": 448,
+  "llm_config": {
+    "_attn_implementation_autoset": true,
+    "_name_or_path": "Qwen/Qwen2.5-3B-Instruct",
+    "add_cross_attention": false,
+    "architectures": [
+      "Qwen2ForCausalLM"
+    ],
+    "attention_dropout": 0.0,
+    "bad_words_ids": null,
+    "begin_suppress_tokens": null,
+    "bos_token_id": 151643,
+    "chunk_size_feed_forward": 0,
+    "cross_attention_hidden_size": null,
+    "decoder_start_token_id": null,
+    "diversity_penalty": 0.0,
+    "do_sample": false,
+    "early_stopping": false,
+    "encoder_no_repeat_ngram_size": 0,
+    "eos_token_id": 151645,
+    "exponential_decay_length_penalty": null,
+    "finetuning_task": null,
+    "forced_bos_token_id": null,
+    "forced_eos_token_id": null,
+    "hidden_act": "silu",
+    "hidden_size": 2048,
+    "id2label": {
+      "0": "LABEL_0",
+      "1": "LABEL_1"
+    },
+    "initializer_range": 0.02,
+    "intermediate_size": 11008,
+    "is_decoder": false,
+    "is_encoder_decoder": false,
+    "label2id": {
+      "LABEL_0": 0,
+      "LABEL_1": 1
+    },
+    "length_penalty": 1.0,
+    "max_length": 20,
+    "max_position_embeddings": 32768,
+    "max_window_layers": 70,
+    "min_length": 0,
+    "model_type": "qwen2",
+    "no_repeat_ngram_size": 0,
+    "num_attention_heads": 16,
+    "num_beam_groups": 1,
+    "num_beams": 1,
+    "num_hidden_layers": 36,
+    "num_key_value_heads": 2,
+    "num_return_sequences": 1,
+    "output_attentions": false,
+    "output_hidden_states": false,
+    "output_scores": false,
+    "pad_token_id": null,
+    "prefix": null,
+    "problem_type": null,
+    "pruned_heads": {},
+    "remove_invalid_values": false,
+    "repetition_penalty": 1.0,
+    "return_dict": true,
+    "return_dict_in_generate": false,
+    "rms_norm_eps": 1e-06,
+    "rope_scaling": null,
+    "rope_theta": 1000000.0,
+    "sep_token_id": null,
+    "sliding_window": null,
+    "suppress_tokens": null,
+    "task_specific_params": null,
+    "temperature": 1.0,
+    "tf_legacy_loss": false,
+    "tie_encoder_decoder": false,
+    "tie_word_embeddings": false,
+    "tokenizer_class": null,
+    "top_k": 50,
+    "top_p": 1.0,
+    "torch_dtype": "bfloat16",
+    "torchscript": false,
+    "transformers_version": "4.49.0.dev0",
+    "typical_p": 1.0,
+    "use_bfloat16": true,
+    "use_cache": true,
+    "use_sliding_window": false,
+    "vocab_size": 151674
+  },
+  "max_dynamic_patch": 12,
+  "min_dynamic_patch": 1,
+  "model_type": "internvl_chat",
+  "ps_version": "v2",
+  "select_layer": -1,
+  "template": "internvl2_5",
+  "torch_dtype": "bfloat16",
+  "transformers_version": null,
+  "use_backbone_lora": 0,
+  "use_llm_lora": 0,
+  "use_thumbnail": true,
+  "vision_config": {
+    "_attn_implementation_autoset": true,
+    "_name_or_path": "",
+    "add_cross_attention": false,
+    "architectures": [
+      "InternVisionModel"
+    ],
+    "attention_dropout": 0.0,
+    "bad_words_ids": null,
+    "begin_suppress_tokens": null,
+    "bos_token_id": null,
+    "chunk_size_feed_forward": 0,
+    "cross_attention_hidden_size": null,
+    "decoder_start_token_id": null,
+    "diversity_penalty": 0.0,
+    "do_sample": false,
+    "drop_path_rate": 0.0,
+    "dropout": 0.0,
+    "early_stopping": false,
+    "encoder_no_repeat_ngram_size": 0,
+    "eos_token_id": null,
+    "exponential_decay_length_penalty": null,
+    "finetuning_task": null,
+    "forced_bos_token_id": null,
+    "forced_eos_token_id": null,
+    "hidden_act": "gelu",
+    "hidden_size": 1024,
+    "id2label": {
+      "0": "LABEL_0",
+      "1": "LABEL_1"
+    },
+    "image_size": 448,
+    "initializer_factor": 1.0,
+    "initializer_range": 0.02,
+    "intermediate_size": 4096,
+    "is_decoder": false,
+    "is_encoder_decoder": false,
+    "label2id": {
+      "LABEL_0": 0,
+      "LABEL_1": 1
+    },
+    "layer_norm_eps": 1e-06,
+    "length_penalty": 1.0,
+    "max_length": 20,
+    "min_length": 0,
+    "model_type": "intern_vit_6b",
+    "no_repeat_ngram_size": 0,
+    "norm_type": "layer_norm",
+    "num_attention_heads": 16,
+    "num_beam_groups": 1,
+    "num_beams": 1,
+    "num_channels": 3,
+    "num_hidden_layers": 24,
+    "num_return_sequences": 1,
+    "output_attentions": false,
+    "output_hidden_states": false,
+    "output_scores": false,
+    "pad_token_id": null,
+    "patch_size": 14,
+    "prefix": null,
+    "problem_type": null,
+    "pruned_heads": {},
+    "qk_normalization": false,
+    "qkv_bias": true,
+    "remove_invalid_values": false,
+    "repetition_penalty": 1.0,
+    "return_dict": true,
+    "return_dict_in_generate": false,
+    "sep_token_id": null,
+    "suppress_tokens": null,
+    "task_specific_params": null,
+    "temperature": 1.0,
+    "tf_legacy_loss": false,
+    "tie_encoder_decoder": false,
+    "tie_word_embeddings": true,
+    "tokenizer_class": null,
+    "top_k": 50,
+    "top_p": 1.0,
+    "torch_dtype": "bfloat16",
+    "torchscript": false,
+    "transformers_version": "4.49.0.dev0",
+    "typical_p": 1.0,
+    "use_bfloat16": true,
+    "use_flash_attn": true
+  }
+}

configuration_intern_vit.py ADDED Viewed

	@@ -0,0 +1,120 @@

+# --------------------------------------------------------
+# InternVL
+# Copyright (c) 2024 OpenGVLab
+# Licensed under The MIT License [see LICENSE for details]
+# --------------------------------------------------------
+import os
+from typing import Union
+from transformers.configuration_utils import PretrainedConfig
+from transformers.utils import logging
+logger = logging.get_logger(__name__)
+class InternVisionConfig(PretrainedConfig):
+    r"""
+    This is the configuration class to store the configuration of a [`InternVisionModel`]. It is used to
+    instantiate a vision encoder according to the specified arguments, defining the model architecture.
+    Configuration objects inherit from [`PretrainedConfig`] and can be used to control the model outputs. Read the
+    documentation from [`PretrainedConfig`] for more information.
+    Args:
+        num_channels (`int`, *optional*, defaults to 3):
+            Number of color channels in the input images (e.g., 3 for RGB).
+        patch_size (`int`, *optional*, defaults to 14):
+            The size (resolution) of each patch.
+        image_size (`int`, *optional*, defaults to 224):
+            The size (resolution) of each image.
+        qkv_bias (`bool`, *optional*, defaults to `False`):
+            Whether to add a bias to the queries and values in the self-attention layers.
+        hidden_size (`int`, *optional*, defaults to 3200):
+            Dimensionality of the encoder layers and the pooler layer.
+        num_attention_heads (`int`, *optional*, defaults to 25):
+            Number of attention heads for each attention layer in the Transformer encoder.
+        intermediate_size (`int`, *optional*, defaults to 12800):
+            Dimensionality of the "intermediate" (i.e., feed-forward) layer in the Transformer encoder.
+        qk_normalization (`bool`, *optional*, defaults to `True`):
+            Whether to normalize the queries and keys in the self-attention layers.
+        num_hidden_layers (`int`, *optional*, defaults to 48):
+            Number of hidden layers in the Transformer encoder.
+        use_flash_attn (`bool`, *optional*, defaults to `True`):
+            Whether to use flash attention mechanism.
+        hidden_act (`str` or `function`, *optional*, defaults to `"gelu"`):
+            The non-linear activation function (function or string) in the encoder and pooler. If string, `"gelu"`,
+            `"relu"`, `"selu"` and `"gelu_new"` ``"gelu"` are supported.
+        layer_norm_eps (`float`, *optional*, defaults to 1e-6):
+            The epsilon used by the layer normalization layers.
+        dropout (`float`, *optional*, defaults to 0.0):
+            The dropout probability for all fully connected layers in the embeddings, encoder, and pooler.
+        drop_path_rate (`float`, *optional*, defaults to 0.0):
+            Dropout rate for stochastic depth.
+        attention_dropout (`float`, *optional*, defaults to 0.0):
+            The dropout ratio for the attention probabilities.
+        initializer_range (`float`, *optional*, defaults to 0.02):
+            The standard deviation of the truncated_normal_initializer for initializing all weight matrices.
+        initializer_factor (`float`, *optional*, defaults to 0.1):
+            A factor for layer scale.
+    """
+    model_type = 'intern_vit_6b'
+    def __init__(
+            self,
+            num_channels=3,
+            patch_size=14,
+            image_size=224,
+            qkv_bias=False,
+            hidden_size=3200,
+            num_attention_heads=25,
+            intermediate_size=12800,
+            qk_normalization=True,
+            num_hidden_layers=48,
+            use_flash_attn=True,
+            hidden_act='gelu',
+            norm_type='rms_norm',
+            layer_norm_eps=1e-6,
+            dropout=0.0,
+            drop_path_rate=0.0,
+            attention_dropout=0.0,
+            initializer_range=0.02,
+            initializer_factor=0.1,
+            **kwargs,
+    ):
+        super().__init__(**kwargs)
+        self.hidden_size = hidden_size
+        self.intermediate_size = intermediate_size
+        self.dropout = dropout
+        self.drop_path_rate = drop_path_rate
+        self.num_hidden_layers = num_hidden_layers
+        self.num_attention_heads = num_attention_heads
+        self.num_channels = num_channels
+        self.patch_size = patch_size
+        self.image_size = image_size
+        self.initializer_range = initializer_range
+        self.initializer_factor = initializer_factor
+        self.attention_dropout = attention_dropout
+        self.layer_norm_eps = layer_norm_eps
+        self.hidden_act = hidden_act
+        self.norm_type = norm_type
+        self.qkv_bias = qkv_bias
+        self.qk_normalization = qk_normalization
+        self.use_flash_attn = use_flash_attn
+    @classmethod
+    def from_pretrained(cls, pretrained_model_name_or_path: Union[str, os.PathLike], **kwargs) -> 'PretrainedConfig':
+        config_dict, kwargs = cls.get_config_dict(pretrained_model_name_or_path, **kwargs)
+        if 'vision_config' in config_dict:
+            config_dict = config_dict['vision_config']
+        if 'model_type' in config_dict and hasattr(cls, 'model_type') and config_dict['model_type'] != cls.model_type:
+            logger.warning(
+                f"You are using a model of type {config_dict['model_type']} to instantiate a model of type "
+                f'{cls.model_type}. This is not supported for all configurations of models and can yield errors.'
+            )
+        return cls.from_dict(config_dict, **kwargs)

configuration_internvl_chat.py ADDED Viewed

	@@ -0,0 +1,95 @@

+# --------------------------------------------------------
+# InternVL
+# Copyright (c) 2024 OpenGVLab
+# Licensed under The MIT License [see LICENSE for details]
+# --------------------------------------------------------
+import copy
+from transformers import AutoConfig, LlamaConfig, Qwen2Config
+from transformers.configuration_utils import PretrainedConfig
+from transformers.utils import logging
+from .configuration_intern_vit import InternVisionConfig
+logger = logging.get_logger(__name__)
+class InternVLChatConfig(PretrainedConfig):
+    model_type = 'internvl_chat'
+    is_composition = True
+    def __init__(
+            self,
+            vision_config=None,
+            llm_config=None,
+            use_backbone_lora=0,
+            use_llm_lora=0,
+            select_layer=-1,
+            force_image_size=None,
+            downsample_ratio=0.5,
+            template=None,
+            dynamic_image_size=False,
+            use_thumbnail=False,
+            ps_version='v1',
+            min_dynamic_patch=1,
+            max_dynamic_patch=6,
+            **kwargs):
+        super().__init__(**kwargs)
+        if vision_config is None:
+            vision_config = {'architectures': ['InternVisionModel']}
+            logger.info('vision_config is None. Initializing the InternVisionConfig with default values.')
+        if llm_config is None:
+            llm_config = {'architectures': ['Qwen2ForCausalLM']}
+            logger.info('llm_config is None. Initializing the LlamaConfig config with default values (`LlamaConfig`).')
+        self.vision_config = InternVisionConfig(**vision_config)
+        if llm_config.get('architectures')[0] == 'LlamaForCausalLM':
+            self.llm_config = LlamaConfig(**llm_config)
+        elif llm_config.get('architectures')[0] == 'Qwen2ForCausalLM':
+            self.llm_config = Qwen2Config(**llm_config)
+        else:
+            raise ValueError('Unsupported architecture: {}'.format(llm_config.get('architectures')[0]))
+        self.use_backbone_lora = use_backbone_lora
+        self.use_llm_lora = use_llm_lora
+        self.select_layer = select_layer
+        self.force_image_size = force_image_size
+        self.downsample_ratio = downsample_ratio
+        self.template = template
+        self.dynamic_image_size = dynamic_image_size
+        self.use_thumbnail = use_thumbnail
+        self.ps_version = ps_version  # pixel shuffle version
+        self.min_dynamic_patch = min_dynamic_patch
+        self.max_dynamic_patch = max_dynamic_patch
+        logger.info(f'vision_select_layer: {self.select_layer}')
+        logger.info(f'ps_version: {self.ps_version}')
+        logger.info(f'min_dynamic_patch: {self.min_dynamic_patch}')
+        logger.info(f'max_dynamic_patch: {self.max_dynamic_patch}')
+    def to_dict(self):
+        """
+        Serializes this instance to a Python dictionary. Override the default [`~PretrainedConfig.to_dict`].
+        Returns:
+            `Dict[str, any]`: Dictionary of all the attributes that make up this configuration instance,
+        """
+        output = copy.deepcopy(self.__dict__)
+        output['vision_config'] = self.vision_config.to_dict()
+        output['llm_config'] = self.llm_config.to_dict()
+        output['model_type'] = self.__class__.model_type
+        output['use_backbone_lora'] = self.use_backbone_lora
+        output['use_llm_lora'] = self.use_llm_lora
+        output['select_layer'] = self.select_layer
+        output['force_image_size'] = self.force_image_size
+        output['downsample_ratio'] = self.downsample_ratio
+        output['template'] = self.template
+        output['dynamic_image_size'] = self.dynamic_image_size
+        output['use_thumbnail'] = self.use_thumbnail
+        output['ps_version'] = self.ps_version
+        output['min_dynamic_patch'] = self.min_dynamic_patch
+        output['max_dynamic_patch'] = self.max_dynamic_patch
+        return output

generation_config.json ADDED Viewed

	@@ -0,0 +1,9 @@

+{
+  "_from_model_config": true,
+  "eos_token_id": [
+    151644,
+    151645,
+    151643
+  ],
+  "transformers_version": "4.49.0.dev0"
+}

merges.txt ADDED Viewed

The diff for this file is too large to render. See raw diff

model-00001-of-00002.safetensors ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:b0468f648c6c99010629f4604f5286abb27cee37b1e079fb142b48eb98468566
+size 4993023560

model-00002-of-00002.safetensors ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:2b68e1f2a5f56d507eff47c5c565e68abbd02a28bf1398b28a7892c259ed86b3
+size 2432349168

model.safetensors.index.json ADDED Viewed

	@@ -0,0 +1,788 @@

+{
+  "metadata": {
+    "total_size": 7425275904
+  },
+  "weight_map": {
+    "language_model.lm_head.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.embed_tokens.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.0.input_layernorm.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.0.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.0.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.0.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.0.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.0.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.0.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.0.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.0.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.0.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.0.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.0.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.1.input_layernorm.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.1.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.1.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.1.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.1.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.1.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.1.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.1.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.1.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.1.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.1.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.1.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.10.input_layernorm.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.10.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.10.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.10.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.10.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.10.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.10.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.10.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.10.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.10.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.10.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.10.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.11.input_layernorm.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.11.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.11.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.11.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.11.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.11.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.11.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.11.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.11.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.11.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.11.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.11.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.12.input_layernorm.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.12.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.12.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.12.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.12.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.12.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.12.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.12.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.12.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.12.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.12.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.12.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.13.input_layernorm.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.13.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.13.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.13.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.13.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.13.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.13.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.13.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.13.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.13.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.13.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.13.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.14.input_layernorm.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.14.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.14.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.14.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.14.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.14.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.14.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.14.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.14.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.14.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.14.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.14.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.15.input_layernorm.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.15.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.15.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.15.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.15.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.15.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.15.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.15.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.15.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.15.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.15.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.15.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.16.input_layernorm.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.16.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.16.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.16.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.16.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.16.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.16.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.16.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.16.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.16.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.16.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.16.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.17.input_layernorm.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.17.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.17.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.17.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.17.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.17.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.17.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.17.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.17.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.17.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.17.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.17.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.18.input_layernorm.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.18.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.18.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.18.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.18.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.18.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.18.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.18.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.18.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.18.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.18.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.18.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.19.input_layernorm.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.19.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.19.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.19.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.19.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.19.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.19.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.19.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.19.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.19.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.19.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.19.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.2.input_layernorm.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.2.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.2.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.2.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.2.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.2.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.2.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.2.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.2.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.2.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.2.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.2.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.20.input_layernorm.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.20.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.20.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.20.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.20.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.20.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.20.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.20.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.20.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.20.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.20.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.20.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.21.input_layernorm.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.21.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.21.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.21.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.21.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.21.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.21.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.21.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.21.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.21.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.21.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.21.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.22.input_layernorm.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.22.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.22.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.22.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.22.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.22.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.22.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.22.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.22.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.22.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.22.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.22.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.23.input_layernorm.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.23.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.23.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.23.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.23.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.23.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.23.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.23.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.23.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.23.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.23.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.23.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.24.input_layernorm.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.24.mlp.down_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.24.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.24.mlp.up_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.24.post_attention_layernorm.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.24.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.24.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.24.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.24.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.24.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.24.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.24.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.25.input_layernorm.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.25.mlp.down_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.25.mlp.gate_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.25.mlp.up_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.25.post_attention_layernorm.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.25.self_attn.k_proj.bias": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.25.self_attn.k_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.25.self_attn.o_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.25.self_attn.q_proj.bias": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.25.self_attn.q_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.25.self_attn.v_proj.bias": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.25.self_attn.v_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.26.input_layernorm.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.26.mlp.down_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.26.mlp.gate_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.26.mlp.up_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.26.post_attention_layernorm.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.26.self_attn.k_proj.bias": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.26.self_attn.k_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.26.self_attn.o_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.26.self_attn.q_proj.bias": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.26.self_attn.q_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.26.self_attn.v_proj.bias": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.26.self_attn.v_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.27.input_layernorm.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.27.mlp.down_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.27.mlp.gate_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.27.mlp.up_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.27.post_attention_layernorm.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.27.self_attn.k_proj.bias": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.27.self_attn.k_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.27.self_attn.o_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.27.self_attn.q_proj.bias": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.27.self_attn.q_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.27.self_attn.v_proj.bias": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.27.self_attn.v_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.28.input_layernorm.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.28.mlp.down_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.28.mlp.gate_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.28.mlp.up_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.28.post_attention_layernorm.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.28.self_attn.k_proj.bias": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.28.self_attn.k_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.28.self_attn.o_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.28.self_attn.q_proj.bias": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.28.self_attn.q_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.28.self_attn.v_proj.bias": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.28.self_attn.v_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.29.input_layernorm.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.29.mlp.down_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.29.mlp.gate_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.29.mlp.up_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.29.post_attention_layernorm.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.29.self_attn.k_proj.bias": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.29.self_attn.k_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.29.self_attn.o_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.29.self_attn.q_proj.bias": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.29.self_attn.q_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.29.self_attn.v_proj.bias": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.29.self_attn.v_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.3.input_layernorm.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.3.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.3.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.3.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.3.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.3.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.3.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.3.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.3.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.3.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.3.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.3.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.30.input_layernorm.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.30.mlp.down_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.30.mlp.gate_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.30.mlp.up_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.30.post_attention_layernorm.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.30.self_attn.k_proj.bias": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.30.self_attn.k_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.30.self_attn.o_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.30.self_attn.q_proj.bias": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.30.self_attn.q_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.30.self_attn.v_proj.bias": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.30.self_attn.v_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.31.input_layernorm.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.31.mlp.down_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.31.mlp.gate_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.31.mlp.up_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.31.post_attention_layernorm.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.31.self_attn.k_proj.bias": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.31.self_attn.k_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.31.self_attn.o_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.31.self_attn.q_proj.bias": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.31.self_attn.q_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.31.self_attn.v_proj.bias": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.31.self_attn.v_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.32.input_layernorm.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.32.mlp.down_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.32.mlp.gate_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.32.mlp.up_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.32.post_attention_layernorm.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.32.self_attn.k_proj.bias": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.32.self_attn.k_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.32.self_attn.o_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.32.self_attn.q_proj.bias": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.32.self_attn.q_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.32.self_attn.v_proj.bias": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.32.self_attn.v_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.33.input_layernorm.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.33.mlp.down_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.33.mlp.gate_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.33.mlp.up_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.33.post_attention_layernorm.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.33.self_attn.k_proj.bias": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.33.self_attn.k_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.33.self_attn.o_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.33.self_attn.q_proj.bias": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.33.self_attn.q_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.33.self_attn.v_proj.bias": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.33.self_attn.v_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.34.input_layernorm.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.34.mlp.down_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.34.mlp.gate_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.34.mlp.up_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.34.post_attention_layernorm.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.34.self_attn.k_proj.bias": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.34.self_attn.k_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.34.self_attn.o_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.34.self_attn.q_proj.bias": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.34.self_attn.q_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.34.self_attn.v_proj.bias": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.34.self_attn.v_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.35.input_layernorm.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.35.mlp.down_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.35.mlp.gate_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.35.mlp.up_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.35.post_attention_layernorm.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.35.self_attn.k_proj.bias": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.35.self_attn.k_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.35.self_attn.o_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.35.self_attn.q_proj.bias": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.35.self_attn.q_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.35.self_attn.v_proj.bias": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.35.self_attn.v_proj.weight": "model-00002-of-00002.safetensors",
+    "language_model.model.layers.4.input_layernorm.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.4.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.4.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.4.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.4.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.4.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.4.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.4.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.4.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.4.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.4.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.4.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.5.input_layernorm.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.5.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.5.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.5.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.5.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.5.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.5.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.5.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.5.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.5.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.5.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.5.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.6.input_layernorm.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.6.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.6.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.6.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.6.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.6.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.6.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.6.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.6.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.6.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.6.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.6.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.7.input_layernorm.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.7.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.7.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.7.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.7.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.7.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.7.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.7.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.7.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.7.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.7.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.7.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.8.input_layernorm.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.8.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.8.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.8.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.8.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.8.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.8.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.8.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.8.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.8.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.8.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.8.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.9.input_layernorm.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.9.mlp.down_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.9.mlp.gate_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.9.mlp.up_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.9.post_attention_layernorm.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.9.self_attn.k_proj.bias": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.9.self_attn.k_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.9.self_attn.o_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.9.self_attn.q_proj.bias": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.9.self_attn.q_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.9.self_attn.v_proj.bias": "model-00001-of-00002.safetensors",
+    "language_model.model.layers.9.self_attn.v_proj.weight": "model-00001-of-00002.safetensors",
+    "language_model.model.norm.weight": "model-00002-of-00002.safetensors",
+    "mlp1.0.bias": "model-00002-of-00002.safetensors",
+    "mlp1.0.weight": "model-00002-of-00002.safetensors",
+    "mlp1.1.bias": "model-00002-of-00002.safetensors",
+    "mlp1.1.weight": "model-00002-of-00002.safetensors",
+    "mlp1.3.bias": "model-00002-of-00002.safetensors",
+    "mlp1.3.weight": "model-00002-of-00002.safetensors",
+    "vision_model.embeddings.class_embedding": "model-00001-of-00002.safetensors",
+    "vision_model.embeddings.patch_embedding.bias": "model-00001-of-00002.safetensors",
+    "vision_model.embeddings.patch_embedding.weight": "model-00001-of-00002.safetensors",
+    "vision_model.embeddings.position_embedding": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.0.attn.proj.bias": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.0.attn.proj.weight": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.0.attn.qkv.bias": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.0.attn.qkv.weight": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.0.ls1": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.0.ls2": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.0.mlp.fc1.bias": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.0.mlp.fc1.weight": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.0.mlp.fc2.bias": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.0.mlp.fc2.weight": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.0.norm1.bias": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.0.norm1.weight": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.0.norm2.bias": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.0.norm2.weight": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.1.attn.proj.bias": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.1.attn.proj.weight": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.1.attn.qkv.bias": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.1.attn.qkv.weight": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.1.ls1": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.1.ls2": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.1.mlp.fc1.bias": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.1.mlp.fc1.weight": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.1.mlp.fc2.bias": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.1.mlp.fc2.weight": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.1.norm1.bias": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.1.norm1.weight": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.1.norm2.bias": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.1.norm2.weight": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.10.attn.proj.bias": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.10.attn.proj.weight": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.10.attn.qkv.bias": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.10.attn.qkv.weight": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.10.ls1": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.10.ls2": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.10.mlp.fc1.bias": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.10.mlp.fc1.weight": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.10.mlp.fc2.bias": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.10.mlp.fc2.weight": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.10.norm1.bias": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.10.norm1.weight": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.10.norm2.bias": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.10.norm2.weight": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.11.attn.proj.bias": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.11.attn.proj.weight": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.11.attn.qkv.bias": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.11.attn.qkv.weight": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.11.ls1": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.11.ls2": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.11.mlp.fc1.bias": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.11.mlp.fc1.weight": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.11.mlp.fc2.bias": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.11.mlp.fc2.weight": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.11.norm1.bias": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.11.norm1.weight": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.11.norm2.bias": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.11.norm2.weight": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.12.attn.proj.bias": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.12.attn.proj.weight": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.12.attn.qkv.bias": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.12.attn.qkv.weight": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.12.ls1": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.12.ls2": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.12.mlp.fc1.bias": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.12.mlp.fc1.weight": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.12.mlp.fc2.bias": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.12.mlp.fc2.weight": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.12.norm1.bias": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.12.norm1.weight": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.12.norm2.bias": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.12.norm2.weight": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.13.attn.proj.bias": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.13.attn.proj.weight": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.13.attn.qkv.bias": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.13.attn.qkv.weight": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.13.ls1": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.13.ls2": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.13.mlp.fc1.bias": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.13.mlp.fc1.weight": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.13.mlp.fc2.bias": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.13.mlp.fc2.weight": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.13.norm1.bias": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.13.norm1.weight": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.13.norm2.bias": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.13.norm2.weight": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.14.attn.proj.bias": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.14.attn.proj.weight": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.14.attn.qkv.bias": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.14.attn.qkv.weight": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.14.ls1": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.14.ls2": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.14.mlp.fc1.bias": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.14.mlp.fc1.weight": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.14.mlp.fc2.bias": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.14.mlp.fc2.weight": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.14.norm1.bias": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.14.norm1.weight": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.14.norm2.bias": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.14.norm2.weight": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.15.attn.proj.bias": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.15.attn.proj.weight": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.15.attn.qkv.bias": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.15.attn.qkv.weight": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.15.ls1": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.15.ls2": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.15.mlp.fc1.bias": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.15.mlp.fc1.weight": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.15.mlp.fc2.bias": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.15.mlp.fc2.weight": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.15.norm1.bias": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.15.norm1.weight": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.15.norm2.bias": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.15.norm2.weight": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.16.attn.proj.bias": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.16.attn.proj.weight": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.16.attn.qkv.bias": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.16.attn.qkv.weight": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.16.ls1": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.16.ls2": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.16.mlp.fc1.bias": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.16.mlp.fc1.weight": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.16.mlp.fc2.bias": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.16.mlp.fc2.weight": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.16.norm1.bias": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.16.norm1.weight": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.16.norm2.bias": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.16.norm2.weight": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.17.attn.proj.bias": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.17.attn.proj.weight": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.17.attn.qkv.bias": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.17.attn.qkv.weight": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.17.ls1": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.17.ls2": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.17.mlp.fc1.bias": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.17.mlp.fc1.weight": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.17.mlp.fc2.bias": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.17.mlp.fc2.weight": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.17.norm1.bias": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.17.norm1.weight": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.17.norm2.bias": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.17.norm2.weight": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.18.attn.proj.bias": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.18.attn.proj.weight": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.18.attn.qkv.bias": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.18.attn.qkv.weight": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.18.ls1": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.18.ls2": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.18.mlp.fc1.bias": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.18.mlp.fc1.weight": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.18.mlp.fc2.bias": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.18.mlp.fc2.weight": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.18.norm1.bias": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.18.norm1.weight": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.18.norm2.bias": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.18.norm2.weight": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.19.attn.proj.bias": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.19.attn.proj.weight": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.19.attn.qkv.bias": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.19.attn.qkv.weight": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.19.ls1": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.19.ls2": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.19.mlp.fc1.bias": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.19.mlp.fc1.weight": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.19.mlp.fc2.bias": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.19.mlp.fc2.weight": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.19.norm1.bias": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.19.norm1.weight": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.19.norm2.bias": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.19.norm2.weight": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.2.attn.proj.bias": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.2.attn.proj.weight": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.2.attn.qkv.bias": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.2.attn.qkv.weight": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.2.ls1": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.2.ls2": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.2.mlp.fc1.bias": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.2.mlp.fc1.weight": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.2.mlp.fc2.bias": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.2.mlp.fc2.weight": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.2.norm1.bias": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.2.norm1.weight": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.2.norm2.bias": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.2.norm2.weight": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.20.attn.proj.bias": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.20.attn.proj.weight": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.20.attn.qkv.bias": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.20.attn.qkv.weight": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.20.ls1": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.20.ls2": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.20.mlp.fc1.bias": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.20.mlp.fc1.weight": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.20.mlp.fc2.bias": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.20.mlp.fc2.weight": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.20.norm1.bias": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.20.norm1.weight": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.20.norm2.bias": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.20.norm2.weight": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.21.attn.proj.bias": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.21.attn.proj.weight": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.21.attn.qkv.bias": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.21.attn.qkv.weight": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.21.ls1": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.21.ls2": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.21.mlp.fc1.bias": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.21.mlp.fc1.weight": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.21.mlp.fc2.bias": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.21.mlp.fc2.weight": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.21.norm1.bias": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.21.norm1.weight": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.21.norm2.bias": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.21.norm2.weight": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.22.attn.proj.bias": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.22.attn.proj.weight": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.22.attn.qkv.bias": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.22.attn.qkv.weight": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.22.ls1": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.22.ls2": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.22.mlp.fc1.bias": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.22.mlp.fc1.weight": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.22.mlp.fc2.bias": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.22.mlp.fc2.weight": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.22.norm1.bias": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.22.norm1.weight": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.22.norm2.bias": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.22.norm2.weight": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.23.attn.proj.bias": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.23.attn.proj.weight": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.23.attn.qkv.bias": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.23.attn.qkv.weight": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.23.ls1": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.23.ls2": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.23.mlp.fc1.bias": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.23.mlp.fc1.weight": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.23.mlp.fc2.bias": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.23.mlp.fc2.weight": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.23.norm1.bias": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.23.norm1.weight": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.23.norm2.bias": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.23.norm2.weight": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.3.attn.proj.bias": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.3.attn.proj.weight": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.3.attn.qkv.bias": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.3.attn.qkv.weight": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.3.ls1": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.3.ls2": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.3.mlp.fc1.bias": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.3.mlp.fc1.weight": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.3.mlp.fc2.bias": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.3.mlp.fc2.weight": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.3.norm1.bias": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.3.norm1.weight": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.3.norm2.bias": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.3.norm2.weight": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.4.attn.proj.bias": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.4.attn.proj.weight": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.4.attn.qkv.bias": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.4.attn.qkv.weight": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.4.ls1": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.4.ls2": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.4.mlp.fc1.bias": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.4.mlp.fc1.weight": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.4.mlp.fc2.bias": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.4.mlp.fc2.weight": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.4.norm1.bias": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.4.norm1.weight": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.4.norm2.bias": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.4.norm2.weight": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.5.attn.proj.bias": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.5.attn.proj.weight": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.5.attn.qkv.bias": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.5.attn.qkv.weight": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.5.ls1": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.5.ls2": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.5.mlp.fc1.bias": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.5.mlp.fc1.weight": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.5.mlp.fc2.bias": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.5.mlp.fc2.weight": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.5.norm1.bias": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.5.norm1.weight": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.5.norm2.bias": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.5.norm2.weight": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.6.attn.proj.bias": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.6.attn.proj.weight": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.6.attn.qkv.bias": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.6.attn.qkv.weight": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.6.ls1": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.6.ls2": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.6.mlp.fc1.bias": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.6.mlp.fc1.weight": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.6.mlp.fc2.bias": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.6.mlp.fc2.weight": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.6.norm1.bias": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.6.norm1.weight": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.6.norm2.bias": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.6.norm2.weight": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.7.attn.proj.bias": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.7.attn.proj.weight": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.7.attn.qkv.bias": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.7.attn.qkv.weight": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.7.ls1": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.7.ls2": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.7.mlp.fc1.bias": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.7.mlp.fc1.weight": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.7.mlp.fc2.bias": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.7.mlp.fc2.weight": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.7.norm1.bias": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.7.norm1.weight": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.7.norm2.bias": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.7.norm2.weight": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.8.attn.proj.bias": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.8.attn.proj.weight": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.8.attn.qkv.bias": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.8.attn.qkv.weight": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.8.ls1": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.8.ls2": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.8.mlp.fc1.bias": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.8.mlp.fc1.weight": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.8.mlp.fc2.bias": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.8.mlp.fc2.weight": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.8.norm1.bias": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.8.norm1.weight": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.8.norm2.bias": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.8.norm2.weight": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.9.attn.proj.bias": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.9.attn.proj.weight": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.9.attn.qkv.bias": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.9.attn.qkv.weight": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.9.ls1": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.9.ls2": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.9.mlp.fc1.bias": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.9.mlp.fc1.weight": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.9.mlp.fc2.bias": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.9.mlp.fc2.weight": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.9.norm1.bias": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.9.norm1.weight": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.9.norm2.bias": "model-00001-of-00002.safetensors",
+    "vision_model.encoder.layers.9.norm2.weight": "model-00001-of-00002.safetensors"
+  }
+}

special_tokens_map.json ADDED Viewed

	@@ -0,0 +1,40 @@

+{
+  "additional_special_tokens": [
+    "<|im_start|>",
+    "<|im_end|>",
+    "<|object_ref_start|>",
+    "<|object_ref_end|>",
+    "<|box_start|>",
+    "<|box_end|>",
+    "<|quad_start|>",
+    "<|quad_end|>",
+    "<|vision_start|>",
+    "<|vision_end|>",
+    "<|vision_pad|>",
+    "<|image_pad|>",
+    "<|video_pad|>",
+    "<img>",
+    "</img>",
+    "<IMG_CONTEXT>",
+    "<quad>",
+    "</quad>",
+    "<ref>",
+    "</ref>",
+    "<box>",
+    "</box>"
+  ],
+  "eos_token": {
+    "content": "<|im_end|>",
+    "lstrip": false,
+    "normalized": false,
+    "rstrip": false,
+    "single_word": false
+  },
+  "pad_token": {
+    "content": "<|endoftext|>",
+    "lstrip": false,
+    "normalized": false,
+    "rstrip": false,
+    "single_word": false
+  }
+}

tokenizer_config.json ADDED Viewed

	@@ -0,0 +1,290 @@

+{
+  "add_bos_token": false,
+  "add_eos_token": false,
+  "add_prefix_space": false,
+  "added_tokens_decoder": {
+    "151643": {
+      "content": "<|endoftext|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "151644": {
+      "content": "<|im_start|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "151645": {
+      "content": "<|im_end|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "151646": {
+      "content": "<|object_ref_start|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "151647": {
+      "content": "<|object_ref_end|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "151648": {
+      "content": "<|box_start|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "151649": {
+      "content": "<|box_end|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "151650": {
+      "content": "<|quad_start|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "151651": {
+      "content": "<|quad_end|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "151652": {
+      "content": "<|vision_start|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "151653": {
+      "content": "<|vision_end|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "151654": {
+      "content": "<|vision_pad|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "151655": {
+      "content": "<|image_pad|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "151656": {
+      "content": "<|video_pad|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "151657": {
+      "content": "<tool_call>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": false
+    },
+    "151658": {
+      "content": "</tool_call>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": false
+    },
+    "151659": {
+      "content": "<|fim_prefix|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": false
+    },
+    "151660": {
+      "content": "<|fim_middle|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": false
+    },
+    "151661": {
+      "content": "<|fim_suffix|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": false
+    },
+    "151662": {
+      "content": "<|fim_pad|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": false
+    },
+    "151663": {
+      "content": "<|repo_name|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": false
+    },
+    "151664": {
+      "content": "<|file_sep|>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": false
+    },
+    "151665": {
+      "content": "<img>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "151666": {
+      "content": "</img>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "151667": {
+      "content": "<IMG_CONTEXT>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "151668": {
+      "content": "<quad>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "151669": {
+      "content": "</quad>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "151670": {
+      "content": "<ref>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "151671": {
+      "content": "</ref>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "151672": {
+      "content": "<box>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    },
+    "151673": {
+      "content": "</box>",
+      "lstrip": false,
+      "normalized": false,
+      "rstrip": false,
+      "single_word": false,
+      "special": true
+    }
+  },
+  "additional_special_tokens": [
+    "<|im_start|>",
+    "<|im_end|>",
+    "<|object_ref_start|>",
+    "<|object_ref_end|>",
+    "<|box_start|>",
+    "<|box_end|>",
+    "<|quad_start|>",
+    "<|quad_end|>",
+    "<|vision_start|>",
+    "<|vision_end|>",
+    "<|vision_pad|>",
+    "<|image_pad|>",
+    "<|video_pad|>",
+    "<img>",
+    "</img>",
+    "<IMG_CONTEXT>",
+    "<quad>",
+    "</quad>",
+    "<ref>",
+    "</ref>",
+    "<box>",
+    "</box>"
+  ],
+  "bos_token": null,
+  "chat_template": "{%- if tools %}\n    {{- '<|im_start|>system\\n' }}\n    {%- if messages[0]['role'] == 'system' %}\n        {{- messages[0]['content'] }}\n    {%- else %}\n        {{- 'You are Qwen, created by Alibaba Cloud. You are a helpful assistant.' }}\n    {%- endif %}\n    {{- \"\\n\\n# Tools\\n\\nYou may call one or more functions to assist with the user query.\\n\\nYou are provided with function signatures within <tools></tools> XML tags:\\n<tools>\" }}\n    {%- for tool in tools %}\n        {{- \"\\n\" }}\n        {{- tool | tojson }}\n    {%- endfor %}\n    {{- \"\\n</tools>\\n\\nFor each function call, return a json object with function name and arguments within <tool_call></tool_call> XML tags:\\n<tool_call>\\n{\\\"name\\\": <function-name>, \\\"arguments\\\": <args-json-object>}\\n</tool_call><|im_end|>\\n\" }}\n{%- else %}\n    {%- if messages[0]['role'] == 'system' %}\n        {{- '<|im_start|>system\\n' + messages[0]['content'] + '<|im_end|>\\n' }}\n    {%- else %}\n        {{- '<|im_start|>system\\nYou are Qwen, created by Alibaba Cloud. You are a helpful assistant.<|im_end|>\\n' }}\n    {%- endif %}\n{%- endif %}\n{%- for message in messages %}\n    {%- if (message.role == \"user\") or (message.role == \"system\" and not loop.first) or (message.role == \"assistant\" and not message.tool_calls) %}\n        {{- '<|im_start|>' + message.role + '\\n' + message.content + '<|im_end|>' + '\\n' }}\n    {%- elif message.role == \"assistant\" %}\n        {{- '<|im_start|>' + message.role }}\n        {%- if message.content %}\n            {{- '\\n' + message.content }}\n        {%- endif %}\n        {%- for tool_call in message.tool_calls %}\n            {%- if tool_call.function is defined %}\n                {%- set tool_call = tool_call.function %}\n            {%- endif %}\n            {{- '\\n<tool_call>\\n{\"name\": \"' }}\n            {{- tool_call.name }}\n            {{- '\", \"arguments\": ' }}\n            {{- tool_call.arguments | tojson }}\n            {{- '}\\n</tool_call>' }}\n        {%- endfor %}\n        {{- '<|im_end|>\\n' }}\n    {%- elif message.role == \"tool\" %}\n        {%- if (loop.index0 == 0) or (messages[loop.index0 - 1].role != \"tool\") %}\n            {{- '<|im_start|>user' }}\n        {%- endif %}\n        {{- '\\n<tool_response>\\n' }}\n        {{- message.content }}\n        {{- '\\n</tool_response>' }}\n        {%- if loop.last or (messages[loop.index0 + 1].role != \"tool\") %}\n            {{- '<|im_end|>\\n' }}\n        {%- endif %}\n    {%- endif %}\n{%- endfor %}\n{%- if add_generation_prompt %}\n    {{- '<|im_start|>assistant\\n' }}\n{%- endif %}\n",
+  "clean_up_tokenization_spaces": false,
+  "eos_token": "<|im_end|>",
+  "errors": "replace",
+  "extra_special_tokens": {},
+  "model_max_length": 16384,
+  "pad_token": "<|endoftext|>",
+  "split_special_tokens": false,
+  "tokenizer_class": "Qwen2Tokenizer",
+  "unk_token": null
+}

vocab.json ADDED Viewed

The diff for this file is too large to render. See raw diff