I found this dataset (https://huggingface.co/datasets/nomic-ai/nomic-embed-v2-supervised-data) and that looks exactly like the one used for training nomic-ai/nomic-embed-text-v2-moe during fine-tuning. However, I cannot find any mentions or official comments about this.
Could you confirm that this is actually a real dataset (or its subset) used for Contrastive Finetuning described in https://arxiv.org/pdf/2502.07972
Best,
I found this dataset (https://huggingface.co/datasets/nomic-ai/nomic-embed-v2-supervised-data) and that looks exactly like the one used for training nomic-ai/nomic-embed-text-v2-moe during fine-tuning. However, I cannot find any mentions or official comments about this.
Could you confirm that this is actually a real dataset (or its subset) used for Contrastive Finetuning described in https://arxiv.org/pdf/2502.07972
Best,