/embeddings y almacena los vectores devueltos en tu base de datos o índice vectorial.
Uso básico
Entradas por lotes
Pasa un arreglo de cadenas para generar embeddings de varios textos en una sola solicitud. Cada elemento debe ser texto, no un arreglo de IDs de tokens. Se aplican dos límites, y ambos se comprueban antes de que la solicitud llegue a un modelo:
Dimensiona tus lotes de ingesta según el tope de 2,048 y divide los documentos largos en fragmentos de menos de 8,192 tokens por entrada. El cuerpo de la solicitud también es estricto, por lo que un campo no reconocido devuelve un
400 en lugar de ignorarse.
Flujo de trabajo común
- Divide los documentos de origen en fragmentos.
- Genera embeddings para cada fragmento.
- Almacena los vectores y metadatos en una base de datos vectorial.
- Genera el embedding de la consulta del usuario.
- Recupera los fragmentos cercanos.
- Envía el contexto recuperado a un modelo de chat.
Selección de modelo
Utiliza la página de Modelos de Embeddings para comparar los modelos de embeddings actuales, sus dimensiones y precios.Usa el mismo modelo de embeddings para indexar y consultar. Mezclar modelos puede hacer que las puntuaciones de similitud no sean fiables porque los espacios vectoriales no son intercambiables.