Skip to main content
Embeddings wandeln Text in Vektoren um, die semantische Bedeutung erfassen. Verwende sie für Suche, Retrieval-Augmented Generation (RAG), Clustering, Empfehlungen, Deduplizierung und Ähnlichkeitsbewertung. Der Embeddings-Endpunkt von Venice ist OpenAI-kompatibel. Sende einen einzelnen String oder ein Array von Strings an /embeddings und speichere anschließend die zurückgegebenen Vektoren in deiner Datenbank oder deinem Vektorindex.
Venice akzeptiert ausschließlich Text. Sende einen String oder ein Array von Strings. Token-ID-Arrays werden mit HTTP 400 abgelehnt. Bei LangChain OpenAIEmbeddings muss check_embedding_ctx_length=False gesetzt werden, sonst tokenisiert die Bibliothek lokal mit tiktoken und sendet Integer-Arrays.

Grundlegende Nutzung

Batch-Eingaben

Übergib ein Array von Strings, um mehrere Texte in einer einzigen Anfrage einzubetten. Jedes Element muss Text sein, kein Token-ID-Array. Es gelten zwei Limits, die beide durchgesetzt werden, bevor die Anfrage ein Modell erreicht: Dimensioniere deine Ingest-Batches anhand der 2.048er-Obergrenze und teile lange Dokumente in Chunks unter 8.192 Tokens pro Eintrag auf. Der Request-Body ist außerdem strikt, sodass ein unbekanntes Feld einen 400 zurückgibt, statt ignoriert zu werden.
Die Antwort behält die Reihenfolge der Eingaben bei. Speichere jeden Vektor zusammen mit der ID des Quelltexts, den Metadaten und der ID des Embedding-Modells.

Typischer Ablauf

  1. Teile die Ausgangsdokumente in Chunks auf.
  2. Erzeuge Embeddings für jeden Chunk.
  3. Speichere Vektoren und Metadaten in einer Vektordatenbank.
  4. Bette die Anfrage der Nutzer:innen ein.
  5. Rufe die nächstgelegenen Chunks ab.
  6. Sende den abgerufenen Kontext an ein Chat-Modell.
Eine vollständige Implementierung findest du unter Einen privaten RAG-Bot bauen.

Modellauswahl

Nutze die Seite Embedding-Modelle, um aktuelle Embedding-Modelle, Dimensionen und Preise zu vergleichen.
Verwende beim Indexieren und Abfragen dasselbe Embedding-Modell. Das Mischen von Modellen kann Ähnlichkeitswerte unzuverlässig machen, da Vektorräume nicht austauschbar sind.

Verwandte Ressourcen