/embeddings und speichere anschließend die zurückgegebenen Vektoren in deiner Datenbank oder deinem Vektorindex.
Grundlegende Nutzung
Batch-Eingaben
Übergib ein Array von Strings, um mehrere Texte in einer einzigen Anfrage einzubetten. Jedes Element muss Text sein, kein Token-ID-Array. Es gelten zwei Limits, die beide durchgesetzt werden, bevor die Anfrage ein Modell erreicht:
Dimensioniere deine Ingest-Batches anhand der 2.048er-Obergrenze und teile lange Dokumente in Chunks unter 8.192 Tokens pro Eintrag auf. Der Request-Body ist außerdem strikt, sodass ein unbekanntes Feld einen
400 zurückgibt, statt ignoriert zu werden.
Typischer Ablauf
- Teile die Ausgangsdokumente in Chunks auf.
- Erzeuge Embeddings für jeden Chunk.
- Speichere Vektoren und Metadaten in einer Vektordatenbank.
- Bette die Anfrage der Nutzer:innen ein.
- Rufe die nächstgelegenen Chunks ab.
- Sende den abgerufenen Kontext an ein Chat-Modell.
Modellauswahl
Nutze die Seite Embedding-Modelle, um aktuelle Embedding-Modelle, Dimensionen und Preise zu vergleichen.Verwende beim Indexieren und Abfragen dasselbe Embedding-Modell. Das Mischen von Modellen kann Ähnlichkeitswerte unzuverlässig machen, da Vektorräume nicht austauschbar sind.