A shared evaluation framework applies an embedding model to many datasets and task-specific metrics. Results are best read by task family because a model optimized for retrieval may not lead on classification or clustering. Dataset language, domain, and contamination also influence generalization.