Passer au contenu principal
L’API Text Parser extrait du texte d’un document sans exécuter d’inférence de modèle. Utilisez-la lorsque votre application doit inspecter, stocker, indexer ou réutiliser le contenu d’un document avant de l’envoyer à un modèle. Les entrées prises en charge incluent les fichiers PDF, DOCX, PPTX, XLSX et texte brut jusqu’à 25 Mo.

Analyser un document

Téléversez le fichier au format multipart/form-data :
Le format de réponse par défaut json renvoie le texte extrait et son décompte de tokens. Utilisez response_format=text lorsque vous n’avez besoin que du texte extrait.

Text Parser ou entrée de fichier dans le chat ?

Les deux fonctionnalités extraient le contenu d’un document, mais elles servent des flux différents :

Pipeline typique

1

Analyser le fichier

Téléversez le document source et demandez une réponse JSON.
2

Inspecter la sortie

Vérifiez le décompte de tokens par rapport à la fenêtre de contexte du modèle cible. Réduisez ou divisez les documents volumineux avant l’inférence.
3

Utiliser le texte

Ajoutez-le à un prompt de chat, générez des embeddings pour la récupération ou enregistrez-le dans votre propre magasin de données.
L’analyse s’exécute en mémoire sans conservation de données. Venice traite le document téléversé et le supprime immédiatement sans stocker ni journaliser son contenu.
L’API Text Parser est expérimentale. Son format de requête et de réponse peut changer sans préavis.

Ressources associées