Embeddings wandeln Text in Vektoren um, die semantische Bedeutung erfassen. Verwende sie für Suche, Retrieval-Augmented Generation (RAG), Clustering, Empfehlungen, Deduplizierung und Ähnlichkeitsbewertung.
Der Embeddings-Endpunkt von Venice ist OpenAI-kompatibel. Sende einen einzelnen String oder ein Array von Strings an /embeddings und speichere anschließend die zurückgegebenen Vektoren in deiner Datenbank oder deinem Vektorindex.
Venice akzeptiert ausschließlich Text. Sende einen String oder ein Array von Strings. Token-ID-Arrays werden mit HTTP 400 abgelehnt. Bei LangChain OpenAIEmbeddings muss check_embedding_ctx_length=False gesetzt werden, sonst tokenisiert die Bibliothek lokal mit tiktoken und sendet Integer-Arrays.
Grundlegende Nutzung
Batch-Eingaben
Übergib ein Array von Strings, um mehrere Texte in einer einzigen Anfrage einzubetten. Jedes Element muss Text sein, kein Token-ID-Array:
Die Antwort behält die Reihenfolge der Eingaben bei. Speichere jeden Vektor zusammen mit der ID des Quelltexts, den Metadaten und der ID des Embedding-Modells.
Typischer Ablauf
- Teile die Ausgangsdokumente in Chunks auf.
- Erzeuge Embeddings für jeden Chunk.
- Speichere Vektoren und Metadaten in einer Vektordatenbank.
- Bette die Anfrage der Nutzer:innen ein.
- Rufe die nächstgelegenen Chunks ab.
- Sende den abgerufenen Kontext an ein Chat-Modell.
Eine vollständige Implementierung findest du unter Einen privaten RAG-Bot bauen.
Modellauswahl
Nutze die Seite Embedding-Modelle, um aktuelle Embedding-Modelle, Dimensionen und Preise zu vergleichen.
Verwende beim Indexieren und Abfragen dasselbe Embedding-Modell. Das Mischen von Modellen kann Ähnlichkeitswerte unzuverlässig machen, da Vektorräume nicht austauschbar sind.
Verwandte Ressourcen