Une journée avec Mistral AI : Vibe, GLM, Shieldstral et coût réel

·9 min de lecture

Le 22 septembre 2026, j'ai passé la journée dans l'environnement Mistral. J'ai confié à ses outils trois travaux différents : construire un workflow n8n, modérer des textes et des images, puis générer une page web. J'ai aussi regardé ce que l'abonnement Pro avait réellement consommé.

Je voulais savoir si je pouvais mener ces tâches jusqu'au bout, combien elles coûtaient et où je devais reprendre la main. Ce retour porte sur mes essais, avec leurs défauts de méthode. Il ne classe pas tous les modèles du marché et ne dit pas ce qui fonctionnerait dans chaque entreprise.

Un workflow n8n avec GLM 5.3 dans deux outils

Pour le premier essai, j'ai demandé un workflow simple de routage de leads dans n8n. J'ai utilisé le même modèle, GLM 5.3, servi par Mistral, dans deux outils : Mistral Vibe et Pi. GLM 5.3 est un modèle de Z.ai hébergé par Mistral, pas un modèle entraîné par Mistral.

Vibe a créé le workflow en 2 min 48 s et l'a publié en 4 min 15 s au total. Il comportait neuf noeuds. Deux erreurs relevées pendant les tests ont été corrigées, et le chemin demandé pour le webhook a été respecté. Pi a créé sa version en 2 min 27 s et l'a publiée en 9 min 28 s au total, avec huit noeuds. Il a testé quatre branches. Son chemin de webhook a dû changer, car celui de Vibe occupait déjà l'adresse prévue.

Sur cet essai, Vibe a donc livré plus vite. Le conflit de webhook a pénalisé Pi. Les deux outils n'ont pas suivi exactement le même chemin de publication, et un seul workflow ne permet pas de mesurer leur fiabilité générale. C'est une observation de terrain, pas un banc d'essai contrôlé.

Pour une entreprise, le temps de génération du JSON n'est d'ailleurs qu'une partie du travail. Il faut vérifier les branches, les erreurs, les données transmises et ce que le workflow fera quand un lead réel arrivera. J'explique cette répartition entre agent de code et automatisation durable dans l'article sur n8n et les agents de code.

Shieldstral ratait une partie du texte dans les images

Le deuxième travail portait sur Shieldstral 1.0, un modèle de modération que j'ai exécuté sur un GPU loué pour le test. J'ai préparé 40 cas, textes et images, et cinq politiques à évaluer pour chacun : violence, harcèlement, contenu sexuel ou inapproprié aux enfants, données personnelles et persuasion politique. Cela représente 200 décisions. Les métriques principales du premier test portent sur 31 cas clairs, soit 155 décisions ; neuf cas limites en sont exclus.

Au seuil retenu, le F1 macro était de 0,73, avec sept faux négatifs et aucun faux positif sur ces cas clairs. Le problème le plus visible concernait les affiches dont le sens dépendait du texte écrit dans l'image. Une affiche électorale explicite pouvait passer sous le seuil de détection.

J'ai alors refait la partie image du test avec deux chaînes de traitement. La première envoyait l'image directement à Shieldstral. La seconde envoyait d'abord l'image à OCR 4.1, puis uniquement le texte extrait à Shieldstral. Les mêmes 20 images et les mêmes cinq politiques ont été utilisées dans les deux chaînes. Après exclusion des quatre images classées comme cas limites, la comparaison principale porte sur 16 images, soit 80 décisions par chaîne.

Sur les 16 images claires Image seule OCR 4.1 puis Shieldstral
F1 macro 0,40 0,96
Faux négatifs 5 1
Faux positifs 0 0

L'OCR a récupéré le texte que Shieldstral exploitait mal dans l'image. Il reste un échec important : une affiche publique de l'Oncle Sam n'a toujours pas été reconnue comme persuasion politique après extraction du texte. Lire les mots ne suffit pas toujours à comprendre leur contexte.

Ces chiffres décrivent ce petit corpus, avec plusieurs images contrôlées, propres et faciles à lire. Ils ne sont pas un taux de performance attendu sur les documents ou les visuels d'une entreprise. Le seuil devrait être réglé sur un jeu indépendant avant toute mise en production. Si votre besoin porte sur l'extraction de factures et de documents, j'ai détaillé séparément l'intégration de Mistral OCR avec n8n.

Une landing page exploitable, après correction

J'ai aussi demandé à Mistral Medium 3.5 de générer une landing page SaaS à partir d'une référence visuelle obtenue via le connecteur 21st.dev. Medium 3.5 a produit une page complète et une base de travail utile. La première passe n'avait toutefois pas correctement configuré la chaîne CSS. Il a fallu une seconde passe pour obtenir le rendu attendu.

La page contenait surtout des arguments commerciaux inventés : "500 entreprises", une certification SOC 2 et un "SLA garanti". Aucun de ces éléments ne figurait dans le brief. Ils auraient été trompeurs sur un site publié.

Ce test ne mesure pas la qualité visuelle de Medium 3.5 face à tous les modèles récents. Mon jugement est plus restreint : je pouvais reprendre la page, mais je ne pouvais ni la publier telle quelle ni lui confier la rédaction de preuves commerciales. Pour un site d'entreprise, une phrase plausible et fausse est souvent plus dangereuse qu'un bouton mal aligné.

Vibe : le résultat compte, la prise en main aussi

Mistral Vibe a bien mené le workflow n8n jusqu'à sa publication. Son usage m'a pourtant laissé une impression de produit encore irrégulier. Lors d'une reprise de configuration MCP, l'agent a écrit un format que Vibe n'acceptait pas. Le redémarrage a échoué et j'ai utilisé Pi pour réparer la configuration.

J'ai également cru, au début, que Vibe ignorait les instructions globales. Après avoir ajouté manuellement mon fichier dans ~/.vibe/AGENTS.md, il l'a reconnu. La fonction est documentée. Mon reproche concerne sa découverte et l'aide apportée pendant la configuration, pas son absence.

Il serait tout aussi inexact de dire que Vibe a été abandonné : le dépôt publiait encore une version le 22 septembre. Mais une mise à jour régulière ne compense pas, pour l'utilisateur, une configuration qui empêche l'outil de redémarrer. Quand un agent agit sur son propre environnement, il devrait vérifier le format qu'il va écrire et laisser une voie de reprise claire.

Ce que la journée a coûté

Mon compte Mistral affichait un abonnement Pro à 17,99 € TTC par mois. Au moment du contrôle du 22 septembre, le tableau de bord montrait deux enveloppes mensuelles distinctes : 255 € d'usage Vibe Code et 25,50 € d'usage API et Studio. Ce sont des montants d'usage inclus, pas une somme versée sur un compte bancaire.

Le relevé de consommation consulté vers 16 h 54 affichait 276 requêtes et 4,96 € d'usage valorisé depuis minuit à Paris. Cette consommation entrait dans les enveloppes de l'abonnement. Elle n'était donc pas une facture supplémentaire de 4,96 €. Le relevé a été pris avant la fin de la journée : je ne le présente pas comme un total définitif.

J'ai comparé ce relevé aux journaux locaux de Vibe et de Pi. J'y ai retrouvé un peu plus de 11 millions de tokens cumulés pour les appels aux modèles servis par Mistral. Environ 80 % des tokens d'entrée étaient des lectures de contexte en cache. Ce nombre ne correspond ni à 11 millions de tokens nouveaux rédigés ou générés, ni à un quota mensuel garanti. Le tableau de bord de Mistral reste la référence pour le montant décompté.

Le GPU loué pour exécuter Shieldstral et tout autre abonnement à un outil tiers s'ajoutent à ce calcul. Le coût d'un test complet comprend aussi le temps passé à corriger une configuration, relire une page ou préparer un corpus. Pour choisir entre modèle ouvert, API et hébergement interne, je regarderais ces postes avant de comparer deux tarifs au million de tokens.

Ce que je testerais avant de choisir pour une entreprise

Cette journée m'a donné une méthode simple pour une PME qui veut évaluer une solution IA sur ses propres tâches :

  1. Choisir un travail borné, avec une sortie vérifiable. Un workflow de routage, une série de documents ou une page de test valent mieux qu'une démonstration libre.
  2. Définir avant l'essai ce qui compte comme une erreur. Pour un workflow, ce sont aussi les branches et les reprises ; pour une page, les affirmations publiques ; pour la modération, les faux négatifs et les cas limites.
  3. Mesurer la chaîne entière. Un bon modèle peut être freiné par un outil difficile à configurer. Un traitement peu cher par appel peut coûter davantage une fois ajoutés le GPU, la supervision et la revue humaine.
  4. Garder un point de validation avant une action visible ou difficile à annuler. Je n'aurais pas publié la landing page avec ses chiffres inventés. Je ne mettrais pas davantage ce filtre de modération en production à partir de 16 images claires. Le placement de ces contrôles est détaillé dans l'article sur la validation humaine des agents IA.

Mistral a des modèles maison utiles et héberge aussi des modèles ouverts tiers comme GLM 5.3. À mes yeux, sa plus grande marge de progrès se trouve dans la cohérence de l'environnement de travail : un CLI fiable, des réglages compréhensibles et des usages inclus faciles à suivre. Vibe existe déjà sur plusieurs interfaces ; mon souhait porte sur leur qualité commune, pas sur l'annonce d'une interface supplémentaire.

Si je devais recommencer dans une entreprise, je partirais d'un premier processus dont on connaît les erreurs possibles et la personne responsable de la validation. C'est aussi le point de départ proposé dans notre guide pour choisir un premier chantier IA et dans le travail de Kirako sur les agents IA en entreprise.

Sources et portée des résultats

Les observations sur le workflow n8n, Shieldstral, Shieldstral avec OCR et la landing page ont été publiées le jour des essais. Les deux tests de modération disposent de rapports locaux, avec corpus, paramètres et résultats par décision. Le coût provient du tableau de bord de mon compte consulté le 22 septembre et des journaux locaux ; il n'est pas un tarif universel.

Les caractéristiques des produits et modèles ont été recoupées avec les fiches officielles GLM 5.3, Medium 3.5, OCR 4.1, le cookbook Shieldstral et les versions de Vibe, vérifiés le 23 septembre 2026. Les jugements sur l'ergonomie et la direction du produit sont les miens.

Existe aussi : Lire en anglais