Skip to main content
Embeddings convertem texto em vetores que capturam significado semântico. Use-os para busca, geração aumentada por recuperação (RAG), clusterização, recomendações, deduplicação e pontuação de similaridade. O endpoint de embeddings da Venice é compatível com OpenAI. Envie uma string ou um array de strings para /embeddings e armazene os vetores retornados no seu banco de dados ou índice vetorial.
A Venice aceita apenas texto. Envie uma string ou um array de strings. Arrays de IDs de tokens são rejeitados com HTTP 400. OpenAIEmbeddings do LangChain deve definir check_embedding_ctx_length=False, caso contrário ele tokeniza localmente com tiktoken e envia arrays de inteiros.

Uso Básico

Entradas em Lote

Passe um array de strings para gerar embeddings de vários textos em uma única requisição. Cada item deve ser texto, não um array de IDs de tokens:
A resposta preserva a ordem de entrada. Armazene cada vetor com o ID do texto de origem, os metadados e o ID do modelo de embedding.

Fluxo de Trabalho Comum

  1. Divida os documentos de origem em pedaços (chunks).
  2. Gere embeddings para cada pedaço.
  3. Armazene os vetores e metadados em um banco de dados vetorial.
  4. Gere o embedding da consulta do usuário.
  5. Recupere os pedaços mais próximos.
  6. Envie o contexto recuperado para um modelo de chat.
Para uma implementação completa, veja Construindo um Bot RAG Privado.

Seleção de Modelo

Use a página Modelos de Embedding para comparar os modelos de embedding atuais, dimensões e preços.
Use o mesmo modelo de embedding para indexação e consulta. Misturar modelos pode tornar as pontuações de similaridade não confiáveis, pois os espaços vetoriais não são intercambiáveis.

Recursos Relacionados