Skip to main content
POST
/api/v1/augment/text-parser
Esta es una API experimental. El formato de la solicitud y de la respuesta puede cambiar sin previo aviso.
Sube un archivo de documento mediante multipart/form-data utilizando el campo file, de hasta 25 MB. Los formatos admitidos van más allá del conjunto de documentos estructurados. El endpoint acepta:
  • Documentos — PDF, EPUB, DOCX, PPTX, XLSX, XLS
  • Texto plano y datos — texto plano, Markdown, CSV, JSON, YAML, TOML, XML y cualquier tipo MIME text/*
  • Código fuente — aproximadamente 140 extensiones reconocidas, incluidas .py, .ts, .js, .go, .rs, .c, .cpp, .java, .ps1, .sh, .sql, además de archivos sin extensión como Dockerfile y Makefile
Si tu entrada ya es texto o código, no es necesario convertirla primero a PDF.
Solo se admiten los formatos modernos de Office. Los formatos binarios heredados .doc y .ppt no se aceptan: conviértelos primero a .docx o .pptx. El formato heredado .xls se acepta.
Establece response_format en json (predeterminado) para obtener una salida estructurada con el texto extraído y el número de tokens, o en text para obtener el texto extraído sin procesar. Privacidad: el parseo de texto se ejecuta íntegramente en memoria en la infraestructura de Venice con cero retención de datos. Tus documentos se procesan y se descartan inmediatamente: no se almacena ni se registra ningún contenido. Precio: 0,01 $ por solicitud.

Ejemplo (cURL)


Autorizaciones

Authorization
string
header
requerido

Bearer authentication header of the form Bearer <token>, where <token> is your auth token.

Cuerpo

multipart/form-data
file
file
requerido

The document file to parse. Supported formats: PDF, DOCX, PPTX, XLSX, and plain text files. Maximum size: 25MB.

response_format
enum<string>
predeterminado:json

The format of the response output. "json" returns structured JSON with text and token count, "text" returns only the extracted text.

Opciones disponibles:
json,
text

Respuesta

Text extraction completed successfully

Text parser response containing extracted text and token count.

text
string
requerido

The extracted text content from the document.

tokens
number
requerido

The token count of the extracted text.