Architecture · 2026
Presque toutes les équipes qui disent « notre agent est auto-hébergé » envoient encore chaque prompt et chaque document vers l’API d’un tiers. Ce n’est pas un reproche, c’est souvent le bon choix. Mais il faut savoir lequel on a acheté.
La phrase qui recadre tout le projet
Auto-héberger l’agent et auto-héberger le modèle sont deux décisions différentes. L’une est gratuite. L’autre démarre à 574,87 € par mois avant la première requête.
En un paragraphe
Le modèle mental
C'est la distinction qui règle la plupart des débats sur l'auto-hébergement, et elle est rarement posée explicitement.
| Couche | Ce qu’elle fait | Hébergeable ? | Coût de l’héberger |
|---|---|---|---|
| Orchestration | La boucle, les déclencheurs, les intégrations | Oui, facilement | Une petite VM, quelques dizaines d’euros |
| Modèle | Le raisonnement | Oui, avec un GPU | À partir de 574,87 € par mois |
| Données | Vos documents, votre base | Oui, c’est déjà le cas | Déjà dans votre budget |
Héberger les couches une et trois coûte peu et vaut presque toujours le coup. Héberger la couche deux coûte un ordre de grandeur de plus, et c'est celle que les gens désignent quand ils disent « IA auto-hébergée ».
Le malentendu coûteux
Le montage qu'on nous demande le plus souvent d'auditer ressemble à ceci : n8n installé sur le serveur de l'entreprise, les workflows dans sa base, les journaux dans son infrastructure, et un nœud AI Agent pointant vers l'API d'un modèle hébergé.
Tout cela est raisonnable. L'orchestration est réellement auto-hébergée, ce qui est un vrai gain de sécurité et de conformité, traité dans notre évaluation de n8n pour les agents IA.
Les équipes le découvrent au pire moment, c'est-à-dire pendant une revue de sécurité ou un questionnaire client, une fois le système en production. À ce stade la correction est architecturale, pas un réglage.
Être précis
| Architecture | Prompts | Documents | Journaux | Plancher mensuel |
|---|---|---|---|---|
| Plateforme hébergée, modèle hébergé | sortent | sortent | sortent | Abonnement plateforme |
| Orchestration auto-hébergée, modèle hébergé | sortent | sortent | restent | Une petite VM |
| Idem, avec accord de rétention zéro | sortent, non conservés | sortent, non conservés | restent | Une petite VM |
| Orchestration et modèle auto-hébergés | restent | restent | restent | 574,87 € |
Remarquez la troisième ligne. C'est celle où la plupart des équipes devraient se trouver, et celle dont presque personne ne connaît l'existence.
Le levier non tiré
La page d'Anthropic sur le traitement des données commerciales, mise à jour le 1er juillet 2026, indique que pour les utilisateurs de l'API les entrées et les sorties sont automatiquement supprimées du back-end sous 30 jours après réception ou génération. Les exceptions sont listées clairement : les services à rétention plus longue sous votre propre contrôle comme l'API Files, les obligations légales, l'application de la politique d'usage, et les cas où vous et eux en avez convenu autrement.
Pour une charge juridique, RH ou de santé, cela change matériellement la discussion. Trente jours de conservation passent souvent avec les bons documents ; la rétention zéro supprime l'objection presque entièrement, et elle ne coûte qu'une conversation avec un commercial.
Elle ne règle ni la question du transfert, ni le contrat de sous-traitance, ni vos propres obligations. L'ensemble de ce qu'il faut obtenir par écrit, fournisseur par fournisseur, est dans RGPD et agents IA.
Le vrai chiffre
C'est ici que l'auto-hébergement cesse d'être gratuit. Un modèle a besoin d'un GPU, et un GPU doit tourner que quelqu'un l'utilise ou non.
| Instance | GPU | RAM | À l’heure | Par mois, en continu |
|---|---|---|---|---|
| L4-1-24G | 1 | 48 Go | 0,79 € | ~574,87 € |
| L4-2-24G | 2 | 96 Go | 1,58 € | ~1 149,75 € |
| L4-4-24G | 4 | 192 Go | 3,15 € | ~2 299,50 € |
| L4-8-24G | 8 | 384 Go | 6,30 € | ~4 599 € |
Lisez la première ligne attentivement, car c'est un plancher et pas une configuration courante. 574,87 € par mois achètent une carte de 24 Go, qui fait tourner confortablement des petits modèles ou des modèles quantifiés, et pas du tout les modèles de raisonnement actuels. Atteindre la qualité que votre équipe attend suppose en général la troisième ou la quatrième ligne.
Et c'est avant ce que personne ne budgète : quelqu'un pour maintenir le serveur d'inférence, les mises à jour de modèles, le dimensionnement pour les requêtes simultanées, et le fait qu'un GPU au repos se facture exactement comme un GPU occupé. Le service se fait habituellement avec vLLM ou Ollama, tous deux gratuits, et aucun des deux ne se gère tout seul.
Comparez honnêtement avec le côté API. Pour les volumes que génère une entreprise de taille moyenne, le coût en tokens se situe généralement bien en dessous du plancher GPU, et la mise en cache le réduit encore. Le calcul complet est dans le prix de l'API Claude en entreprise.
Quand payer
Il existe des cas où la facture GPU est simplement le prix du droit d'exercer.
| Situation | Pourquoi l’hébergé ne suffit pas |
|---|---|
| Données de santé sous certification HDS | L’hébergement lui-même est certifié et audité ; un appel d’API sort de ce périmètre |
| Secret professionnel de l’avocat | L’obligation est personnelle et ne se transfère pas à un sous-traitant par contrat seul |
| Défense, souveraineté, classifié | L’exigence est l’isolement réseau, pas une clause contractuelle |
| Contrat client interdisant tout tiers | Écrit dans l’accord, pas négociable par vous |
| Volume très élevé et régulier | À partir d’un certain nombre de tokens, le GPU est réellement moins cher |
Les deux premiers sont ceux qu'on rencontre en pratique. Le cas santé a son architecture propre, traitée dans agent IA et données de santé sous HDS. Le cas juridique est plus subtil que ne l'admettent la plupart des prestataires, et nous l'avons écrit dans IA en cabinet d'avocats et secret professionnel.
Notez ce qui ne figure pas dans cette liste : « nos données sont sensibles », « nous sommes une entreprise européenne » et « le conseil d'administration est inquiet ». Ce sont des préoccupations légitimes, et la troisième ligne du tableau précédent y répond généralement mieux que l'achat de GPU.
La partie inconfortable
La plupart des demandes d'agent entièrement auto-hébergé que nous recevons viennent d'un ressenti, pas d'une contrainte. Ce ressenti est légitime et la réponse coûte généralement moins cher qu'un GPU.
Trois questions tranchent. Existe-t-il une règle écrite, dans un contrat, une certification ou un texte, qui interdit un sous-traitant ? Un accord de rétention zéro satisferait-il la personne qui s'inquiète ? Votre volume mensuel de tokens dépasse-t-il le plancher GPU ? Si les trois réponses sont non, vous vous apprêtez à payer 575 € par mois et à accepter un modèle plus faible pour résoudre un problème que vous n'avez pas.
Le dire nous coûte du travail, parce que le montage entièrement auto-hébergé est le plus gros projet. Nous le disons parce que l'alternative est un système cher, plus lent, et abandonné dans dix-huit mois.
Notre position
Pour la plupart de nos clients en secteur réglementé, l'architecture qui survit à une revue de sécurité ressemble à ceci :
C'est ce que nous construisons en agents IA sur mesure, et notre façon de travailler en tant qu' agence n8n. La checklist de mise en production qui va avec est dans déployer un agent IA en production, et la surface de risque dans sécurité des agents IA.
FAQ
Guides liés
La couche orchestration, évaluée honnêtement.
Ce qu’il faut obtenir par écrit de chaque fournisseur avant d’envoyer quoi que ce soit.
Le seul secteur où l’hébergement lui-même est certifié.
Ce qu’un agent peut atteindre, et ce que ça implique quand il se trompe.
Liens vérifiés à la publication. Les textes réglementaires évoluent : reportez-vous toujours à la source officielle.
Une question, un projet, une idee ? On vous repond sous 24h. Audit gratuit, sans engagement.