Feature Extraction
Transformers
Safetensors
German
xlm-roberta
Eval Results (legacy)
text-embeddings-inference
Instructions to use danielheinz/e5-base-sts-en-de with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Transformers
How to use danielheinz/e5-base-sts-en-de with Transformers:
# Use a pipeline as a high-level helper from transformers import pipeline pipe = pipeline("feature-extraction", model="danielheinz/e5-base-sts-en-de")# pip install -U transformers accelerate # Load model directly from transformers import AutoTokenizer, AutoModel tokenizer = AutoTokenizer.from_pretrained("danielheinz/e5-base-sts-en-de") model = AutoModel.from_pretrained("danielheinz/e5-base-sts-en-de", device_map="auto") - Inference
- Notebooks
- Google Colab
- Kaggle
|
Download README.md from danielheinz/e5-base-sts-en-de: direct link, hf CLI and curl.
- Browser
- Download file 1.24 kB
-
https://huggingface.co/danielheinz/e5-base-sts-en-de/resolve/main/README.md
- Command line
-
hf download hf://danielheinz/e5-base-sts-en-de/README.md
-
curl -L -o README.md https://huggingface.co/danielheinz/e5-base-sts-en-de/resolve/main/README.md
1.24 kB
metadata
license: mit
datasets:
- deutsche-telekom/ger-backtrans-paraphrase
- paws-x
- stsb_multi_mt
language:
- de
model-index:
- name: e5-base-sts-en-de
results:
- task:
type: semantic textual similarity
dataset:
type: stsb_multi_mt
name: stsb_multi_mt
metrics:
- type: spearmanr
value: 0.904
INFO: The model is being continuously updated.
The model is a multilingual-e5-base model fine-tuned with the task of semantic textual similarity in mind.
Model Training
The model has been fine-tuned on the German subsets of the following datasets:
The training procedure can be divided into two stages:
- training on paraphrase datasets with the Multiple Negatives Ranking Loss
- training on semantic textual similarity datasets using the Cosine Similarity Loss
Results
The model achieves the following results:
- 0.920 on stsb's validation subset
- 0.904 on stsb's test subset