Skip to main content
POST
/api/v1/augment/text-parser
Cette API est expérimentale. Le format de la requête et de la réponse peut changer sans préavis.
Téléversez un fichier document via multipart/form-data en utilisant le champ file, jusqu’à 25 Mo. Les formats pris en charge vont au-delà des seuls documents structurés. L’endpoint accepte :
  • Documents — PDF, EPUB, DOCX, PPTX, XLSX, XLS
  • Texte brut et données — texte brut, Markdown, CSV, JSON, YAML, TOML, XML, et tout type MIME text/*
  • Code source — environ 140 extensions reconnues, dont .py, .ts, .js, .go, .rs, .c, .cpp, .java, .ps1, .sh, .sql, ainsi que les fichiers sans extension comme Dockerfile et Makefile
Si votre entrée est déjà du texte ou du code, il est inutile de la convertir d’abord en PDF.
Seuls les formats Office modernes sont pris en charge. Les anciens formats binaires .doc et .ppt ne sont pas acceptés — convertissez-les d’abord en .docx ou .pptx. L’ancien format .xls, lui, est accepté.
Définissez response_format sur json (par défaut) pour une sortie structurée avec le texte extrait et le nombre de tokens, ou sur text pour le texte brut extrait. Confidentialité : L’analyse de texte s’exécute entièrement en mémoire sur l’infrastructure de Venice avec zéro rétention de données. Vos documents sont traités puis immédiatement supprimés — aucun contenu n’est stocké ni enregistré. Tarification : 0,01 $ par requête.

Exemple (cURL)


Autorisations

Authorization
string
header
requis

Bearer authentication header of the form Bearer <token>, where <token> is your auth token.

Corps

multipart/form-data
file
file
requis

The document file to parse. Supported formats: PDF, DOCX, PPTX, XLSX, and plain text files. Maximum size: 25MB.

response_format
enum<string>
défaut:json

The format of the response output. "json" returns structured JSON with text and token count, "text" returns only the extracted text.

Options disponibles:
json,
text

Réponse

Text extraction completed successfully

Text parser response containing extracted text and token count.

text
string
requis

The extracted text content from the document.

tokens
number
requis

The token count of the extracted text.