model

Browse files

Files changed (14) hide show

.gitattributes +1 -0
README.md +0 -0
config.json +3 -0
conversion_config.json +3 -0
convert.py +51 -0
onnx/model.onnx +3 -0
onnx/model_int8.onnx +3 -0
onnx/model_uint8.onnx +3 -0
sentencepiece.bpe.model +3 -0
special_tokens_map.json +3 -0
test_local.py +49 -0
test_teradata.py +106 -0
tokenizer.json +3 -0
tokenizer_config.json +3 -0

.gitattributes CHANGED Viewed

@@ -7,6 +7,7 @@
 *.gz filter=lfs diff=lfs merge=lfs -text
 *.h5 filter=lfs diff=lfs merge=lfs -text
 *.joblib filter=lfs diff=lfs merge=lfs -text
 *.lfs.* filter=lfs diff=lfs merge=lfs -text
 *.mlmodel filter=lfs diff=lfs merge=lfs -text
 *.model filter=lfs diff=lfs merge=lfs -text

 *.gz filter=lfs diff=lfs merge=lfs -text
 *.h5 filter=lfs diff=lfs merge=lfs -text
 *.joblib filter=lfs diff=lfs merge=lfs -text
+*.json filter=lfs diff=lfs merge=lfs -text
 *.lfs.* filter=lfs diff=lfs merge=lfs -text
 *.mlmodel filter=lfs diff=lfs merge=lfs -text
 *.model filter=lfs diff=lfs merge=lfs -text

README.md CHANGED Viewed

The diff for this file is too large to render. See raw diff

config.json ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:bb9341fdaa9b357bfdd20c0346405f65eb61eaba6e9936983248e4a6db20c649
+size 792

conversion_config.json ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:f11e34adf023f7e7d45302679b02f8fcff767d7890ee34c6cc90c649354bf6f5
+size 284

convert.py ADDED Viewed

	@@ -0,0 +1,51 @@

+import os
+import json
+import shutil
+from optimum.exporters.onnx import main_export
+import onnx
+from onnxconverter_common import float16
+import onnxruntime as rt
+from onnxruntime.tools.onnx_model_utils import *
+from onnxruntime.quantization import quantize_dynamic, QuantType
+with open('conversion_config.json') as json_file:
+    conversion_config = json.load(json_file)
+    model_id = conversion_config["model_id"]
+    number_of_generated_embeddings = conversion_config["number_of_generated_embeddings"]
+    precision_to_filename_map = conversion_config["precision_to_filename_map"]
+    opset = conversion_config["opset"]
+    IR = conversion_config["IR"]
+    op = onnx.OperatorSetIdProto()
+    op.version = opset
+    if not os.path.exists("onnx"):
+        os.makedirs("onnx")
+    print("Exporting the main model version")
+    main_export(model_name_or_path=model_id, output="./",  opset=opset, trust_remote_code=True, task="feature-extraction", dtype="fp32")
+    if "fp32" in precision_to_filename_map:
+        print("Exporting the fp32 onnx file...")
+        shutil.copyfile('model.onnx', precision_to_filename_map["fp32"])
+        print("Done\n\n")
+    if "int8" in precision_to_filename_map:
+        print("Quantizing fp32 model to int8...")
+        quantize_dynamic("model.onnx",  precision_to_filename_map["int8"], weight_type=QuantType.QInt8)
+        print("Done\n\n")
+    if "uint8" in precision_to_filename_map:
+        print("Quantizing fp32 model to uint8...")
+        quantize_dynamic("model.onnx", precision_to_filename_map["uint8"], weight_type=QuantType.QUInt8)
+        print("Done\n\n")
+    os.remove("model.onnx")

onnx/model.onnx ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:865e3ab074ae342f1ddfc94f88faab304a7a18e12bd126d25a570291aad5d187
+size 1110158366

onnx/model_int8.onnx ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:69c054838d2d2b368e2fd823a505f6647019f791760afac78ee08e373ecba2a5
+size 278400127

onnx/model_uint8.onnx ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:b85476697945c3cf9595016472590002934afa65c87698602858b6fd93d7b795
+size 278400158

sentencepiece.bpe.model ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:cfc8146abe2a0488e9e2a0c56de7952f7c11ab059eca145a0a727afce0db2865
+size 5069051

special_tokens_map.json ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:8c785abebea9ae3257b61681b4e6fd8365ceafde980c21970d001e834cf10835
+size 964

test_local.py ADDED Viewed

	@@ -0,0 +1,49 @@

+import onnxruntime as rt
+from sentence_transformers.util import cos_sim
+from sentence_transformers import SentenceTransformer
+import transformers
+import gc
+import json
+with open('conversion_config.json') as json_file:
+    conversion_config = json.load(json_file)
+    model_id = conversion_config["model_id"]
+    number_of_generated_embeddings = conversion_config["number_of_generated_embeddings"]
+    precision_to_filename_map = conversion_config["precision_to_filename_map"]
+    sentences_1 = 'How is the weather today?'
+    sentences_2 = 'What is the current weather like today?'
+    print(f"Testing on cosine similiarity between sentences: \n'{sentences_1}'\n'{sentences_2}'\n\n\n")
+    tokenizer = transformers.AutoTokenizer.from_pretrained("./")
+    enc1 = tokenizer(sentences_1)
+    enc2 = tokenizer(sentences_2)
+    for precision, file_name in precision_to_filename_map.items():
+        onnx_session = rt.InferenceSession(file_name)
+        embeddings_1_onnx = onnx_session.run(None,     {"input_ids": [enc1.input_ids],
+             "attention_mask": [enc1.attention_mask]})[1][0]
+        embeddings_2_onnx = onnx_session.run(None,     {"input_ids": [enc2.input_ids],
+             "attention_mask": [enc2.attention_mask]})[1][0]
+        del onnx_session
+        gc.collect()
+        print(f'Cosine similiarity for ONNX model with precision "{precision}" is {str(cos_sim(embeddings_1_onnx, embeddings_2_onnx))}')
+    model = SentenceTransformer(model_id, trust_remote_code=True)
+    embeddings_1_sentence_transformer = model.encode(sentences_1, normalize_embeddings=True, trust_remote_code=True)
+    embeddings_2_sentence_transformer = model.encode(sentences_2, normalize_embeddings=True, trust_remote_code=True)
+    print('Cosine similiarity for original sentence transformer model is '+str(cos_sim(embeddings_1_sentence_transformer, embeddings_2_sentence_transformer)))

test_teradata.py ADDED Viewed

	@@ -0,0 +1,106 @@

+import sys
+import teradataml as tdml
+from tabulate import tabulate
+import json
+with open('conversion_config.json') as json_file:
+    conversion_config = json.load(json_file)
+    model_id = conversion_config["model_id"]
+    number_of_generated_embeddings = conversion_config["number_of_generated_embeddings"]
+    precision_to_filename_map = conversion_config["precision_to_filename_map"]
+    host = sys.argv[1]
+    username = sys.argv[2]
+    password = sys.argv[3]
+    print("Setting up connection to teradata...")
+    tdml.create_context(host = host, username = username, password = password)
+    print("Done\n\n")
+    print("Deploying tokenizer...")
+    try:
+        tdml.db_drop_table('tokenizer_table')
+    except:
+        print("Can't drop tokenizers table - it's not existing")
+    tdml.save_byom('tokenizer',
+                  'tokenizer.json',
+                  'tokenizer_table')
+    print("Done\n\n")
+    print("Testing models...")
+    try:
+        tdml.db_drop_table('model_table')
+    except:
+        print("Can't drop models table - it's not existing")
+    for precision, file_name in precision_to_filename_map.items():
+        print(f"Deploying {precision} model...")
+        tdml.save_byom(precision,
+                      file_name,
+                      'model_table')
+        print(f"Model {precision} is deployed\n")
+        print(f"Calculating embeddings with {precision} model...")
+        try:
+            tdml.db_drop_table('emails_embeddings_store')
+        except:
+            print("Can't drop embeddings table - it's not existing")
+        tdml.execute_sql(f"""
+            create volatile table emails_embeddings_store as (
+                select
+                    *
+            from mldb.ONNXEmbeddings(
+                    on emails.emails as InputTable
+                    on (select * from model_table where model_id = '{precision}') as ModelTable DIMENSION
+                    on (select model as tokenizer from tokenizer_table where model_id = 'tokenizer') as TokenizerTable DIMENSION
+                    using
+                        Accumulate('id', 'txt')
+                        ModelOutputTensor('sentence_embedding')
+                        EnableMemoryCheck('false')
+                        OutputFormat('FLOAT32({number_of_generated_embeddings})')
+                        OverwriteCachedModel('true')
+                ) a
+        ) with data on commit preserve rows
+        """)
+        print("Embeddings calculated")
+        print(f"Testing semantic search with cosine similiarity on the output of the model with precision '{precision}'...")
+        tdf_embeddings_store = tdml.DataFrame('emails_embeddings_store')
+        tdf_embeddings_store_tgt = tdf_embeddings_store[tdf_embeddings_store.id == 3]
+        tdf_embeddings_store_ref = tdf_embeddings_store[tdf_embeddings_store.id != 3]
+        cos_sim_pd = tdml.DataFrame.from_query(f"""
+            SELECT
+                dt.target_id,
+                dt.reference_id,
+                e_tgt.txt as target_txt,
+                e_ref.txt as reference_txt,
+                (1.0 - dt.distance) as similiarity
+            FROM
+                TD_VECTORDISTANCE (
+                    ON ({tdf_embeddings_store_tgt.show_query()}) AS TargetTable
+                    ON ({tdf_embeddings_store_ref.show_query()}) AS ReferenceTable DIMENSION
+                    USING
+                        TargetIDColumn('id')
+                        TargetFeatureColumns('[emb_0:emb_{number_of_generated_embeddings - 1}]')
+                        RefIDColumn('id')
+                        RefFeatureColumns('[emb_0:emb_{number_of_generated_embeddings - 1}]')
+                        DistanceMeasure('cosine')
+                        topk(3)
+                ) AS dt
+            JOIN emails.emails e_tgt on e_tgt.id = dt.target_id
+            JOIN emails.emails e_ref on e_ref.id = dt.reference_id;
+            """).to_pandas()
+        print(tabulate(cos_sim_pd, headers='keys', tablefmt='fancy_grid'))
+        print("Done\n\n")
+    tdml.remove_context()

tokenizer.json ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:3a56def25aa40facc030ea8b0b87f3688e4b3c39eb8b45d5702b3a1300fe2a20
+size 17082734

tokenizer_config.json ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:dfb4021b23969fc942e96b2c4ac906d94712b4b96ef7081cb66a0ea211896d51
+size 1177