/embeddings, puis stockez les vecteurs retournés dans votre base de données ou votre index vectoriel.
Utilisation de base
Entrées par lots
Passez un tableau de chaînes pour embarquer plusieurs textes en une seule requête. Chaque élément doit être du texte, pas un tableau d’ID de tokens. Deux limites s’appliquent, et toutes deux sont vérifiées avant que la requête n’atteigne un modèle :
Dimensionnez vos lots d’ingestion en fonction du plafond de 2 048 et découpez les documents longs en dessous de 8 192 tokens par entrée. Le corps de la requête est également strict : un champ non reconnu renvoie un
400 au lieu d’être ignoré.
Flux de travail courant
- Découpez les documents sources en fragments.
- Générez les embeddings pour chaque fragment.
- Stockez les vecteurs et les métadonnées dans une base de données vectorielle.
- Générez l’embedding de la requête utilisateur.
- Récupérez les fragments proches.
- Envoyez le contexte récupéré à un modèle de chat.
Choix du modèle
Consultez la page Modèles d’embeddings pour comparer les modèles d’embeddings actuels, leurs dimensions et leurs tarifs.Utilisez le même modèle d’embedding pour l’indexation et l’interrogation. Mélanger les modèles peut rendre les scores de similarité peu fiables car les espaces vectoriels ne sont pas interchangeables.