Analyse · Ingénierie · 2026
Une équipe construit un agent sur un modèle de pointe. Il fonctionne en démonstration, puis commence à produire des erreurs incompréhensibles. Le réflexe est de dire « il nous faut un meilleur modèle ». C'est presque toujours le mauvais diagnostic.
La thèse
La capacité brute d'un modèle est générale. Votre métier ne l'est pas. Aucune intelligence ne compense une information absente.
Le symptôme
Le test qui tranche prend cinq minutes. Reprenez un cas d'erreur, et fournissez manuellement au modèle tout ce qu'un collaborateur compétent aurait eu sous les yeux. S'il répond juste, le sujet est le contexte. Ce test évite des semaines de migration de modèle sans effet.
| Symptôme observé | Le réflexe qui ne marche pas | Ce qu’il faut regarder |
|---|---|---|
| L'agent invente une procédure interne | Prendre un modèle plus puissant | Lui donner la procédure — elle n'était nulle part dans son contexte |
| Il applique une règle périmée | Ajouter une consigne « sois à jour » | Corriger la source : un document obsolète est toujours indexé |
| Il répond juste sur 8 cas et faux sur le 9e | Réécrire tout le prompt | Identifier ce que le 9e cas exige et qui manque au contexte |
| Il se dégrade sur les longues conversations | Élargir la fenêtre de contexte | Structurer ce qu'on garde : une fenêtre plus grande dilue autant qu'elle aide |
| Il cite un client pour un autre | Renforcer les instructions de prudence | Cloisonner les données par client au niveau des accès, pas du prompt |
Le bon modèle mental
La comparaison la plus utile n'est pas celle du cerveau, c'est celle de l'intégration d'un nouvel arrivant. Vous n'attendez pas d'une recrue brillante qu'elle devine votre grille tarifaire, vos exceptions commerciales ou le nom du client qu'il ne faut pas relancer le vendredi. Vous le lui dites, vous lui donnez accès aux bons outils, et vous relisez son travail au début.
Un agent est dans la même situation, avec deux différences : il ne demande jamais de précision quand il manque quelque chose, et il ne montre aucun signe d'hésitation. Là où une recrue vient poser une question, l'agent comble le vide. C'est exactement pour cela qu'un contexte incomplet produit des erreurs assurées plutôt que des demandes de clarification.
État de l'art
La taille des fenêtres de contexte progresse vite. En août 2026, Pokee AI a publié Pokee-Isaac 28B, un modèle agentique de 28 milliards de paramètres annoncé avec une fenêtre allant jusqu'à 10 millions de tokens, et présenté comme exécutable sur un GPU unique de type RTX 4090. L'argument commercial affiché est explicite : tourner à l'intérieur du périmètre du client.
Précision nécessaire : les résultats de contexte long communiqués — de l'ordre de 95 sur le test RULER entre 256K et 4M tokens — proviennent d'évaluations internes au fournisseur, publiées dans son propre rapport technique. Nous n'avons pas connaissance de reproduction indépendante. C'est une revendication, pas un fait vérifié, et cet article ne la reprend pas comme telle.
L'intérêt pour une entreprise européenne n'est pas le chiffre. C'est la combinaison taille modeste plus contexte très long plus exécution locale : elle rend crédible un scénario qui ne l'était pas il y a un an, celui d'un agent qui raisonne sur un volume documentaire important sans que ces documents quittent votre infrastructure. Pour les secteurs où les données ne peuvent pas sortir, c'est plus déterminant que n'importe quel point de benchmark.
Attention toutefois au raccourci « grande fenêtre donc plus de sélection à faire ». Envoyer tout votre corpus à chaque requête coûte cher, allonge le temps de réponse et dilue le signal utile. Une architecture sérieuse sélectionne, quelle que soit la fenêtre — c'est ce que nous détaillons dans notre guide RAG en entreprise.
Le vrai enjeu
Un agent qui a accès à tous les dossiers clients pour « être plus utile » peut citer un client à un autre. La réponse n'est pas d'ajouter une consigne de discrétion dans le prompt — une instruction en langue naturelle n'est pas un contrôle d'accès. Le cloisonnement se fait au niveau des permissions et de la requête, en amont du modèle.
Le même raisonnement vaut pour le contenu entrant : un document déposé par un tiers entre dans le contexte et peut contenir des instructions. C'est le mécanisme d'injection traité dans notre analyse périmètre et permissions des agents IA.
Méthode
C'est le cœur de notre travail : brancher un agent sur les bonnes sources, avec le bon cloisonnement, en hébergement européen. Voir nos agents IA sur mesure et, sur le choix des modèles auto-hébergeables, notre comparatif des meilleurs LLM open source.
FAQ
Guides liés
Comment sélectionner la bonne information avant de la donner au modèle.
Les modèles auto-hébergeables, classés par licence vérifiée.
L'autre face du contexte : ce que l'agent peut divulguer et modifier.
Liens vérifiés à la publication. Les textes réglementaires évoluent : reportez-vous toujours à la source officielle.
Une question, un projet, une idee ? On vous repond sous 24h. Audit gratuit, sans engagement.