/embeddings 发送一个字符串或字符串数组,然后将返回的向量存入你的数据库或向量索引中。
基本用法
批量输入
传入字符串数组即可在一次请求中嵌入多段文本。每一项都必须是文本,而不是 token ID 数组。 有两条限制同时生效,且都在请求到达模型之前强制执行:
请依据 2,048 的上限规划你的摄取批次,并将长文档分块至每条低于 8,192 个 token。请求体也是严格校验的,因此无法识别的字段会返回
400 而不是被忽略。
常见工作流
- 将源文档切分为若干块。
- 为每个块生成嵌入向量。
- 将向量和元数据存入向量数据库。
- 嵌入用户的查询。
- 检索相邻的文本块。
- 将检索到的上下文发送给聊天模型。
模型选择
请使用 嵌入模型 页面比较当前可用的嵌入模型、维度和价格。索引和查询时请使用相同的嵌入模型。混用模型会导致相似度得分不可靠,因为不同模型的向量空间并不通用。