Skip to content

Commit c2f6fd1

Browse files
Fix paraphrase minilm (#436)
* fix: Fix minilm paraphrase by adding it to pool models * tests: Updated minilm paraphrase canonical vector * chore: Added a warning message for updating the model * chore: Added version where model will be removed
1 parent b05877d commit c2f6fd1

4 files changed

Lines changed: 20 additions & 12 deletions

File tree

‎fastembed/text/onnx_embedding.py‎

Lines changed: 0 additions & 11 deletions
Original file line numberDiff line numberDiff line change
@@ -79,17 +79,6 @@
7979
},
8080
"model_file": "model_optimized.onnx",
8181
},
82-
{
83-
"model": "sentence-transformers/paraphrase-multilingual-MiniLM-L12-v2",
84-
"dim": 384,
85-
"description": "Text embeddings, Unimodal (text), Multilingual (~50 languages), 512 input tokens truncation, Prefixes for queries/documents: not necessary, 2019 year.",
86-
"license": "apache-2.0",
87-
"size_in_GB": 0.22,
88-
"sources": {
89-
"hf": "qdrant/paraphrase-multilingual-MiniLM-L12-v2-onnx-Q",
90-
},
91-
"model_file": "model_optimized.onnx",
92-
},
9382
{
9483
"model": "thenlper/gte-large",
9584
"dim": 1024,

‎fastembed/text/pooled_embedding.py‎

Lines changed: 11 additions & 0 deletions
Original file line numberDiff line numberDiff line change
@@ -40,6 +40,17 @@
4040
},
4141
"model_file": "onnx/model.onnx",
4242
},
43+
{
44+
"model": "sentence-transformers/paraphrase-multilingual-MiniLM-L12-v2",
45+
"dim": 384,
46+
"description": "Text embeddings, Unimodal (text), Multilingual (~50 languages), 512 input tokens truncation, Prefixes for queries/documents: not necessary, 2019 year.",
47+
"license": "apache-2.0",
48+
"size_in_GB": 0.22,
49+
"sources": {
50+
"hf": "qdrant/paraphrase-multilingual-MiniLM-L12-v2-onnx-Q",
51+
},
52+
"model_file": "model_optimized.onnx",
53+
},
4354
]
4455

4556

‎fastembed/text/text_embedding.py‎

Lines changed: 8 additions & 0 deletions
Original file line numberDiff line numberDiff line change
@@ -72,6 +72,14 @@ def __init__(
7272
UserWarning,
7373
stacklevel=2,
7474
)
75+
if model_name == "sentence-transformers/paraphrase-multilingual-MiniLM-L12-v2":
76+
warnings.warn(
77+
"The model 'sentence-transformers/paraphrase-multilingual-MiniLM-L12-v2' has been updated to "
78+
"include a mean pooling layer. Please ensure your usage aligns with the new functionality. "
79+
"Support for the previous version without mean pooling will be removed as of version 0.5.2.",
80+
UserWarning,
81+
stacklevel=2,
82+
)
7583
for EMBEDDING_MODEL_TYPE in self.EMBEDDINGS_REGISTRY:
7684
supported_models = EMBEDDING_MODEL_TYPE.list_supported_models()
7785
if any(model_name.lower() == model["model"].lower() for model in supported_models):

‎tests/test_text_onnx_embeddings.py‎

Lines changed: 1 addition & 1 deletion
Original file line numberDiff line numberDiff line change
@@ -32,7 +32,7 @@
3232
[-0.034478, 0.03102, 0.00673, 0.02611, -0.039362]
3333
),
3434
"sentence-transformers/paraphrase-multilingual-MiniLM-L12-v2": np.array(
35-
[0.0094, 0.0184, 0.0328, 0.0072, -0.0351]
35+
[0.0361, 0.1862, 0.2776, 0.2461, -0.1904]
3636
),
3737
"intfloat/multilingual-e5-large": np.array([0.0098, 0.0045, 0.0066, -0.0354, 0.0070]),
3838
"sentence-transformers/paraphrase-multilingual-mpnet-base-v2": np.array(

0 commit comments

Comments
 (0)