Key Capabilities
- Pre-trained models for common use cases
- Batch processing for efficiency
- Automatic handling of tokenization and preprocessing
- Support for custom models
Documentation Index
Fetch the complete documentation index at: /llms.txt
Use this file to discover all available pages before exploring further.
Auto-generate embeddings for text, images, and structured data using pre-trained models. Required for UMAP visualizations and drift detection.
import pandas as pd
from arize.embeddings import EmbeddingGenerator, UseCases
# List available models
print(EmbeddingGenerator.list_pretrained_models())
# Create example data
df = pd.DataFrame({
"text": [
"The product quality is excellent.",
"Shipping was delayed by 3 days.",
"Customer service was very helpful.",
],
})
# Generate embeddings for NLP
generator = EmbeddingGenerator.from_use_case(
use_case=UseCases.NLP.SEQUENCE_CLASSIFICATION,
model_name="distilbert-base-uncased",
tokenizer_max_length=512,
batch_size=100,
)
df["text_vector"] = generator.generate_embeddings(text_col=df["text"])
| Use Case | Model Types |
|---|---|
UseCases.NLP.SEQUENCE_CLASSIFICATION | BERT, DistilBERT, RoBERTa |
UseCases.NLP.SUMMARIZATION | BART, T5, Pegasus |
UseCases.CV.IMAGE_CLASSIFICATION | ResNet, VGG, EfficientNet |
UseCases.CV.OBJECT_DETECTION | YOLO, Faster R-CNN |
UseCases.STRUCTURED.TABULAR_EMBEDDINGS | Custom tabular encoders |
Was this page helpful?
Suggestions