Une facture scannée arrive par email. Quelqu'un ouvre le PDF, recopie le fournisseur, le numéro, les montants et l'échéance, puis vérifie que les totaux concordent. L'OCR peut supprimer une partie de cette saisie. Il ne dispense ni des contrôles métier ni d'une validation humaine lorsque le document est ambigu.
Mistral AI a publié OCR 4 le 23 juin 2026. Le modèle extrait le contenu d'un PDF ou d'une image en Markdown. Il peut aussi retourner les blocs de mise en page et des scores de confiance. Avec n8n, l'intégration passe par un noeud HTTP Request, puis par des règles déterministes avant toute écriture dans un logiciel comptable.
Ce que Mistral OCR 4 fournit
OCR 4 porte l'identifiant versionné mistral-ocr-4-0. L'alias recommandé par la documentation pour suivre la version courante est mistral-ocr-latest.
Une réponse contient notamment, pour chaque page :
- le texte extrait en Markdown ;
- les dimensions de la page ;
- les images éventuellement extraites ;
- les blocs de mise en page si
include_blocksvauttrue; - des scores de confiance si
confidence_scores_granularityvautpageouword.
Les blocs décrivent leur type et leurs coordonnées avec des champs comme top_left_x, top_left_y, bottom_right_x et bottom_right_y. Il ne faut donc pas bâtir le workflow sur un champ générique bbox ou sur un type paragraph qui ne figurent pas dans le contrat documenté.
Mistral annonce un score de 85,20 sur OlmOCRBench et une couverture de 170 langues. Ces résultats de fournisseur donnent un point de repère. Ils ne prédisent pas la qualité sur vos factures, vos scans ou vos tableaux. Un corpus représentatif reste nécessaire avant la mise en production.
Prix et choix d'hébergement
Le tarif public d'OCR 4 est de 4 dollars pour 1 000 pages, et de 5 dollars pour 1 000 pages avec annotations. Le coût d'un document dépend donc de son nombre de pages, avant les frais éventuels de stockage, d'orchestration et de revue.
Mistral propose aussi un déploiement auto-géré en conteneur unique dans son offre entreprise. Cela peut répondre à une contrainte d'hébergement, mais ce n'est pas un bouton gratuit. Il faut évaluer la licence, l'infrastructure, les mises à jour, la supervision et les exigences de sécurité.
Le prix par page ne suffit pas pour comparer des solutions. Testez le même jeu de documents chez les fournisseurs retenus et mesurez :
- la qualité du texte et des tableaux ;
- les champs métier correctement extraits ;
- le taux de dossiers envoyés en revue ;
- la latence observée sur vos volumes ;
- le coût total, y compris l'exploitation et les erreurs.
La nationalité d'un fournisseur ne suffit pas non plus à établir la conformité. Les données traitées, le contrat, la région de traitement, la conservation, les sous-traitants et les transferts doivent être examinés pour le cas réel.
Appeler l'API depuis n8n
Le workflow minimal est le suivant :
[Réception du document]
-> [HTTP Request vers Mistral OCR]
-> [Extraction et validations métier]
-> [Revue humaine si nécessaire]
-> [Logiciel cible]
Dans un noeud HTTP Request, configurez une requête POST vers https://api.mistral.ai/v1/ocr, avec une authentification Bearer et un corps JSON.
Pour un PDF accessible par URL :
{
"model": "mistral-ocr-latest",
"document": {
"type": "document_url",
"document_url": "https://stockage.example/facture.pdf"
},
"include_blocks": true,
"confidence_scores_granularity": "word"
}
Pour un PDF encodé en base64, la documentation utilise toujours le type document_url et une URL de données :
{
"model": "mistral-ocr-latest",
"document": {
"type": "document_url",
"document_url": "data:application/pdf;base64,{{ $json.base64 }}"
},
"include_blocks": true,
"confidence_scores_granularity": "word"
}
Une image emploie en revanche le type image_url. Cette différence est facile à manquer lorsque le document provient des données binaires d'un workflow n8n.
Si le PDF est stocké derrière une URL signée, donnez-lui une durée de validité suffisante pour l'appel et évitez de journaliser cette URL. Pour des documents confidentiels, limitez aussi ce que n8n conserve dans l'historique des exécutions.
Extraire des champs sans inventer de certitude
L'OCR produit du texte et une structure documentaire. Il ne livre pas automatiquement une facture comptable fiable. La couche suivante doit convertir le résultat en données métier et refuser les cas incohérents.
Pour une facture française, les contrôles peuvent inclure :
- le format du SIREN ou du SIRET et, si nécessaire, sa vérification auprès d'une source adaptée ;
- la présence d'un numéro de facture ;
- la cohérence entre date d'émission et date d'échéance ;
- la somme des lignes, de la TVA et du total TTC ;
- la devise et les séparateurs décimaux ;
- la détection d'un doublon avant création.
Un score de confiance n'est pas une probabilité universelle que la donnée soit correcte. Il doit être calibré sur vos documents. Commencez avec une revue humaine de tous les résultats, mesurez les erreurs par type de champ, puis définissez des seuils différents si les observations le justifient.
Par exemple, une raison sociale lisible peut être acceptée avec un contrôle léger, tandis qu'un IBAN modifié ou un montant qui déclenche un paiement doit rester soumis à une vérification forte. Le risque métier compte davantage qu'un seuil unique appliqué à tous les champs.
Trois usages raisonnables
Préremplir une facture fournisseur
n8n récupère la pièce jointe d'une boite dédiée, appelle OCR 4, puis prépare une fiche avec le fournisseur, le numéro, les dates et les montants. Le comptable compare cette fiche au PDF avant validation. Le workflow ne publie rien si les totaux ne concordent pas ou si un doublon est détecté.
Indexer des contrats
L'OCR rend des archives scannées consultables. Les droits d'accès, la durée de conservation et la suppression restent ceux du système documentaire. L'index ne doit pas devenir une copie ouverte à toute l'entreprise.
Traiter des justificatifs de frais
Les photos de reçus peuvent être extraites puis rapprochées d'une transaction. Une date illisible, une devise absente ou plusieurs montants candidats doivent envoyer le justificatif en revue plutôt que forcer un résultat.
Ce que l'OCR ne remplace pas
OCR 4 ne remplace pas une plateforme agréée ni un format structuré de facturation électronique. A compter du 1er septembre 2026, toutes les entreprises assujetties établies en France doivent pouvoir recevoir des factures électroniques. Les obligations d'émission commencent à cette date pour les grandes entreprises et les ETI, puis le 1er septembre 2027 pour les PME et micro-entreprises.
L'OCR reste utile pour les documents non structurés, les archives et les flux qui ne relèvent pas encore du dispositif. Pour le calendrier et les étapes de préparation, consultez l'article sur la facturation électronique en entreprise.
Sources consultées
- Mistral AI, annonce de Mistral OCR 4, 23 juin 2026.
- Mistral AI, fiche du modèle OCR 4, consultée le 13 août 2026.
- Mistral AI, documentation de l'API OCR, consultée le 13 août 2026.
- Mistral AI, tarifs, consultés le 13 août 2026.
- impots.gouv.fr, calendrier de la facturation électronique, consulté le 13 août 2026.
La bonne première version
La première version utile ne traite pas tous les documents. Elle cible une famille homogène, conserve le PDF source, extrait quelques champs, applique des contrôles simples et prévoit une file de revue.
Mesurez ensuite les erreurs et le temps réellement économisé. Si le workflow est fiable, vous pouvez étendre son périmètre. Pour le concevoir et le relier à vos outils, la page agents IA et automatisation détaillent l'accompagnement proposé par Kirako.
Existe aussi : Lire en anglais