Skip to main content
Gli embedding convertono il testo in vettori che catturano il significato semantico. Usali per ricerca, generazione aumentata da recupero (RAG), clustering, raccomandazioni, deduplicazione e calcolo della similarità. L’endpoint embeddings di Venice è compatibile con OpenAI. Invia una singola stringa o un array di stringhe a /embeddings, quindi memorizza i vettori restituiti nel tuo database o indice vettoriale.
Venice accetta solo testo. Invia una stringa o un array di stringhe. Gli array di token ID vengono rifiutati con HTTP 400. OpenAIEmbeddings di LangChain deve impostare check_embedding_ctx_length=False, altrimenti tokenizza localmente con tiktoken e invia array di interi.

Utilizzo di Base

Input in Batch

Passa un array di stringhe per generare embedding di più testi in una singola richiesta. Ogni elemento deve essere testo, non un array di token ID:
La risposta preserva l’ordine dell’input. Memorizza ogni vettore insieme all’ID del testo di origine, ai metadati e all’ID del modello di embedding.

Flusso di Lavoro Tipico

  1. Suddividi i documenti di origine in chunk.
  2. Genera gli embedding per ogni chunk.
  3. Memorizza vettori e metadati in un database vettoriale.
  4. Genera l’embedding della query dell’utente.
  5. Recupera i chunk più vicini.
  6. Invia il contesto recuperato a un modello di chat.
Per un’implementazione completa, consulta Creare un Bot RAG Privato.

Scelta del Modello

Usa la pagina Modelli di Embedding per confrontare i modelli di embedding disponibili, le dimensioni e i prezzi.
Usa lo stesso modello di embedding per l’indicizzazione e per le query. Mescolare modelli diversi può rendere i punteggi di similarità inaffidabili perché gli spazi vettoriali non sono interscambiabili.

Risorse Correlate