Architecture · 2026

Agent IA auto-hébergé : ce qui reste vraiment chez vous

Presque toutes les équipes qui disent « notre agent est auto-hébergé » envoient encore chaque prompt et chaque document vers l’API d’un tiers. Ce n’est pas un reproche, c’est souvent le bon choix. Mais il faut savoir lequel on a acheté.

Zakaria El Asri13 min

La phrase qui recadre tout le projet

Auto-héberger l’agent et auto-héberger le modèle sont deux décisions différentes. L’une est gratuite. L’autre démarre à 574,87 € par mois avant la première requête.

En un paragraphe

La réponse courte

« Agent IA auto-hébergé » recouvre trois architectures différentes. Dans la plus répandue, l'orchestration tourne sur votre serveur et le modèle reste un appel d'API : vos données sortent à chaque requête. Dans la deuxième, vous ajoutez un accord de rétention zéro, et les données sortent sans être conservées. Dans la troisième, le modèle tourne sur votre propre GPU et rien ne sort. Seule la troisième correspond à ce que la plupart des gens imaginent, et c'est la seule qui coûte réellement de l'argent.

Le modèle mental

Un agent a trois couches, et on peut les héberger séparément

C'est la distinction qui règle la plupart des débats sur l'auto-hébergement, et elle est rarement posée explicitement.

CoucheCe qu’elle faitHébergeable ?Coût de l’héberger
OrchestrationLa boucle, les déclencheurs, les intégrationsOui, facilementUne petite VM, quelques dizaines d’euros
ModèleLe raisonnementOui, avec un GPUÀ partir de 574,87 € par mois
DonnéesVos documents, votre baseOui, c’est déjà le casDéjà dans votre budget
Chiffre GPU issu des tarifs d'instances L4 de Scaleway, zone Paris, consultés le 8 octobre 2026.

Héberger les couches une et trois coûte peu et vaut presque toujours le coup. Héberger la couche deux coûte un ordre de grandeur de plus, et c'est celle que les gens désignent quand ils disent « IA auto-hébergée ».

Le malentendu coûteux

Un n8n auto-hébergé qui appelle une API n’est pas un agent auto-hébergé

Le montage qu'on nous demande le plus souvent d'auditer ressemble à ceci : n8n installé sur le serveur de l'entreprise, les workflows dans sa base, les journaux dans son infrastructure, et un nœud AI Agent pointant vers l'API d'un modèle hébergé.

Tout cela est raisonnable. L'orchestration est réellement auto-hébergée, ce qui est un vrai gain de sécurité et de conformité, traité dans notre évaluation de n8n pour les agents IA.

Mais à chaque tour de la boucle, le prompt sort. Et il contient ce que l'agent vient de lire : le contrat, le dossier patient, le CV, le mail client. Le résultat de l'outil sort avec lui, puisqu'il est ajouté à la conversation.

Les équipes le découvrent au pire moment, c'est-à-dire pendant une revue de sécurité ou un questionnaire client, une fois le système en production. À ce stade la correction est architecturale, pas un réglage.

Être précis

Ce qui sort, et ce qui ne sort pas

ArchitecturePromptsDocumentsJournauxPlancher mensuel
Plateforme hébergée, modèle hébergésortentsortentsortentAbonnement plateforme
Orchestration auto-hébergée, modèle hébergésortentsortentrestentUne petite VM
Idem, avec accord de rétention zérosortent, non conservéssortent, non conservésrestentUne petite VM
Orchestration et modèle auto-hébergésrestentrestentrestent574,87 €
Plancher de la dernière ligne d'après Scaleway L4-1-24G, 0,79 € de l'heure, chiffré par le fournisseur à environ 574,87 € par mois en continu, consulté le 8 octobre 2026.

Remarquez la troisième ligne. C'est celle où la plupart des équipes devraient se trouver, et celle dont presque personne ne connaît l'existence.

Le levier non tiré

L’accord que personne ne pense à demander

La page d'Anthropic sur le traitement des données commerciales, mise à jour le 1er juillet 2026, indique que pour les utilisateurs de l'API les entrées et les sorties sont automatiquement supprimées du back-end sous 30 jours après réception ou génération. Les exceptions sont listées clairement : les services à rétention plus longue sous votre propre contrôle comme l'API Files, les obligations légales, l'application de la politique d'usage, et les cas où vous et eux en avez convenu autrement.

Cette dernière exception joue dans les deux sens, car l'une des choses dont on peut convenir est précisément un accord de rétention zéro. Il est nommé dans leur propre documentation comme un arrangement disponible. La plupart des équipes qui construisent sur l'API ne l'ont jamais demandé.

Pour une charge juridique, RH ou de santé, cela change matériellement la discussion. Trente jours de conservation passent souvent avec les bons documents ; la rétention zéro supprime l'objection presque entièrement, et elle ne coûte qu'une conversation avec un commercial.

Elle ne règle ni la question du transfert, ni le contrat de sous-traitance, ni vos propres obligations. L'ensemble de ce qu'il faut obtenir par écrit, fournisseur par fournisseur, est dans RGPD et agents IA.

Le vrai chiffre

Ce que coûte réellement un modèle privé

C'est ici que l'auto-hébergement cesse d'être gratuit. Un modèle a besoin d'un GPU, et un GPU doit tourner que quelqu'un l'utilise ou non.

InstanceGPURAMÀ l’heurePar mois, en continu
L4-1-24G148 Go0,79 €~574,87 €
L4-2-24G296 Go1,58 €~1 149,75 €
L4-4-24G4192 Go3,15 €~2 299,50 €
L4-8-24G8384 Go6,30 €~4 599 €
Tarifs des instances GPU Scaleway, zone PAR-1, consultés le 8 octobre 2026. Les montants mensuels sont les approximations affichées par le fournisseur pour un fonctionnement continu.

Lisez la première ligne attentivement, car c'est un plancher et pas une configuration courante. 574,87 € par mois achètent une carte de 24 Go, qui fait tourner confortablement des petits modèles ou des modèles quantifiés, et pas du tout les modèles de raisonnement actuels. Atteindre la qualité que votre équipe attend suppose en général la troisième ou la quatrième ligne.

Et c'est avant ce que personne ne budgète : quelqu'un pour maintenir le serveur d'inférence, les mises à jour de modèles, le dimensionnement pour les requêtes simultanées, et le fait qu'un GPU au repos se facture exactement comme un GPU occupé. Le service se fait habituellement avec vLLM ou Ollama, tous deux gratuits, et aucun des deux ne se gère tout seul.

Comparez honnêtement avec le côté API. Pour les volumes que génère une entreprise de taille moyenne, le coût en tokens se situe généralement bien en dessous du plancher GPU, et la mise en cache le réduit encore. Le calcul complet est dans le prix de l'API Claude en entreprise.

Quand payer

Quand l’auto-hébergement complet est justifié

Il existe des cas où la facture GPU est simplement le prix du droit d'exercer.

SituationPourquoi l’hébergé ne suffit pas
Données de santé sous certification HDSL’hébergement lui-même est certifié et audité ; un appel d’API sort de ce périmètre
Secret professionnel de l’avocatL’obligation est personnelle et ne se transfère pas à un sous-traitant par contrat seul
Défense, souveraineté, classifiéL’exigence est l’isolement réseau, pas une clause contractuelle
Contrat client interdisant tout tiersÉcrit dans l’accord, pas négociable par vous
Volume très élevé et régulierÀ partir d’un certain nombre de tokens, le GPU est réellement moins cher

Les deux premiers sont ceux qu'on rencontre en pratique. Le cas santé a son architecture propre, traitée dans agent IA et données de santé sous HDS. Le cas juridique est plus subtil que ne l'admettent la plupart des prestataires, et nous l'avons écrit dans IA en cabinet d'avocats et secret professionnel.

Notez ce qui ne figure pas dans cette liste : « nos données sont sensibles », « nous sommes une entreprise européenne » et « le conseil d'administration est inquiet ». Ce sont des préoccupations légitimes, et la troisième ligne du tableau précédent y répond généralement mieux que l'achat de GPU.

La partie inconfortable

Quand ça ne l’est pas, c’est-à-dire le plus souvent

La plupart des demandes d'agent entièrement auto-hébergé que nous recevons viennent d'un ressenti, pas d'une contrainte. Ce ressenti est légitime et la réponse coûte généralement moins cher qu'un GPU.

Trois questions tranchent. Existe-t-il une règle écrite, dans un contrat, une certification ou un texte, qui interdit un sous-traitant ? Un accord de rétention zéro satisferait-il la personne qui s'inquiète ? Votre volume mensuel de tokens dépasse-t-il le plancher GPU ? Si les trois réponses sont non, vous vous apprêtez à payer 575 € par mois et à accepter un modèle plus faible pour résoudre un problème que vous n'avez pas.

Le dire nous coûte du travail, parce que le montage entièrement auto-hébergé est le plus gros projet. Nous le disons parce que l'alternative est un système cher, plus lent, et abandonné dans dix-huit mois.

Notre position

Ce que nous déployons réellement

Pour la plupart de nos clients en secteur réglementé, l'architecture qui survit à une revue de sécurité ressemble à ceci :

  • Orchestration auto-hébergée. n8n sur leur infrastructure, ou notre propre code, avec la base des workflows et les journaux dans leur réseau.
  • Données auto-hébergées. Documents, magasin de faits et piste d'audit ne sortent jamais. C'est aussi ce qui rend les décisions explicables après coup.
  • Modèle par API, avec les documents en règle. Contrat de sous-traitance, durées de conservation documentées, et accord de rétention zéro quand le secteur l'exige.
  • Une étape de pseudonymisation avant l'appel quand c'est faisable, pour que les identifiants n'atteignent jamais le prompt.
  • Un modèle privé seulement si une règle écrite l'impose, budgété honnêtement, avec l'arbitrage de qualité posé avant toute signature.

C'est ce que nous construisons en agents IA sur mesure, et notre façon de travailler en tant qu' agence n8n. La checklist de mise en production qui va avec est dans déployer un agent IA en production, et la surface de risque dans sécurité des agents IA.

FAQ

Questions sur les agents IA auto-hébergés

En général non. Dans les faits, « agent auto-hébergé » désigne presque toujours une orchestration qui tourne sur votre infrastructure, typiquement n8n auto-hébergé ou votre propre code, pendant que le modèle reste appelé par API. Vos prompts et vos documents sortent donc de votre réseau à chaque requête. Auto-héberger le modèle est une décision distincte, et beaucoup plus coûteuse.

Guides liés

À lire ensuite

Sources

Liens vérifiés à la publication. Les textes réglementaires évoluent : reportez-vous toujours à la source officielle.

Parlons de votre projet

Une question, un projet, une idee ? On vous repond sous 24h. Audit gratuit, sans engagement.

Nos coordonnees