Analyse · Ingénierie · 2026

Le contexte, pas le modèle, limite votre agent IA

Une équipe construit un agent sur un modèle de pointe. Il fonctionne en démonstration, puis commence à produire des erreurs incompréhensibles. Le réflexe est de dire « il nous faut un meilleur modèle ». C'est presque toujours le mauvais diagnostic.

Zakaria El Asri9 min

La thèse

La capacité brute d'un modèle est générale. Votre métier ne l'est pas. Aucune intelligence ne compense une information absente.

Le symptôme

Pourquoi « changer de modèle » ne corrige presque rien

Quand un agent se trompe sur votre métier, la cause est rarement une insuffisance de raisonnement. C'est que l'information nécessaire n'était pas devant lui : la procédure n'a jamais été indexée, la fiche client n'est pas accessible, le document de référence date de deux ans. Un modèle plus puissant produira la même erreur, formulée avec plus d'assurance.

Le test qui tranche prend cinq minutes. Reprenez un cas d'erreur, et fournissez manuellement au modèle tout ce qu'un collaborateur compétent aurait eu sous les yeux. S'il répond juste, le sujet est le contexte. Ce test évite des semaines de migration de modèle sans effet.

Symptôme observéLe réflexe qui ne marche pasCe qu’il faut regarder
L'agent invente une procédure internePrendre un modèle plus puissantLui donner la procédure — elle n'était nulle part dans son contexte
Il applique une règle périméeAjouter une consigne « sois à jour »Corriger la source : un document obsolète est toujours indexé
Il répond juste sur 8 cas et faux sur le 9eRéécrire tout le promptIdentifier ce que le 9e cas exige et qui manque au contexte
Il se dégrade sur les longues conversationsÉlargir la fenêtre de contexteStructurer ce qu'on garde : une fenêtre plus grande dilue autant qu'elle aide
Il cite un client pour un autreRenforcer les instructions de prudenceCloisonner les données par client au niveau des accès, pas du prompt
Grille de diagnostic issue de nos déploiements. Lumyniq, 2026.

Le bon modèle mental

Un agent s'intègre comme une nouvelle recrue

La comparaison la plus utile n'est pas celle du cerveau, c'est celle de l'intégration d'un nouvel arrivant. Vous n'attendez pas d'une recrue brillante qu'elle devine votre grille tarifaire, vos exceptions commerciales ou le nom du client qu'il ne faut pas relancer le vendredi. Vous le lui dites, vous lui donnez accès aux bons outils, et vous relisez son travail au début.

Un agent est dans la même situation, avec deux différences : il ne demande jamais de précision quand il manque quelque chose, et il ne montre aucun signe d'hésitation. Là où une recrue vient poser une question, l'agent comble le vide. C'est exactement pour cela qu'un contexte incomplet produit des erreurs assurées plutôt que des demandes de clarification.

État de l'art

La course à la fenêtre de contexte, et ce qu'elle change

La taille des fenêtres de contexte progresse vite. En août 2026, Pokee AI a publié Pokee-Isaac 28B, un modèle agentique de 28 milliards de paramètres annoncé avec une fenêtre allant jusqu'à 10 millions de tokens, et présenté comme exécutable sur un GPU unique de type RTX 4090. L'argument commercial affiché est explicite : tourner à l'intérieur du périmètre du client.

Précision nécessaire : les résultats de contexte long communiqués — de l'ordre de 95 sur le test RULER entre 256K et 4M tokens — proviennent d'évaluations internes au fournisseur, publiées dans son propre rapport technique. Nous n'avons pas connaissance de reproduction indépendante. C'est une revendication, pas un fait vérifié, et cet article ne la reprend pas comme telle.

L'intérêt pour une entreprise européenne n'est pas le chiffre. C'est la combinaison taille modeste plus contexte très long plus exécution locale : elle rend crédible un scénario qui ne l'était pas il y a un an, celui d'un agent qui raisonne sur un volume documentaire important sans que ces documents quittent votre infrastructure. Pour les secteurs où les données ne peuvent pas sortir, c'est plus déterminant que n'importe quel point de benchmark.

Attention toutefois au raccourci « grande fenêtre donc plus de sélection à faire ». Envoyer tout votre corpus à chaque requête coûte cher, allonge le temps de réponse et dilue le signal utile. Une architecture sérieuse sélectionne, quelle que soit la fenêtre — c'est ce que nous détaillons dans notre guide RAG en entreprise.

Le vrai enjeu

Le contexte est aussi une frontière de sécurité

Ce qui entre dans le contexte d'un agent définit deux choses simultanément : ce qu'il peut savoir, et ce qu'il peut divulguer. Ce sont les deux faces du même choix d'architecture, et elles sont trop souvent traitées par deux équipes différentes.

Un agent qui a accès à tous les dossiers clients pour « être plus utile » peut citer un client à un autre. La réponse n'est pas d'ajouter une consigne de discrétion dans le prompt — une instruction en langue naturelle n'est pas un contrôle d'accès. Le cloisonnement se fait au niveau des permissions et de la requête, en amont du modèle.

Le même raisonnement vaut pour le contenu entrant : un document déposé par un tiers entre dans le contexte et peut contenir des instructions. C'est le mécanisme d'injection traité dans notre analyse périmètre et permissions des agents IA.

Méthode

Que faire concrètement

  • Faites le test des cinq minutes sur trois erreurs réelles avant d'envisager tout changement de modèle.
  • Écrivez la fiche de poste de l'agent : ce qu'il doit savoir, où c'est stocké, qui le maintient à jour.
  • Traquez les sources périmées. Un document obsolète encore indexé fait plus de dégâts qu'une absence de document.
  • Cloisonnez par les accès, jamais par le prompt.
  • Mesurez sur vos propres cas. Les benchmarks publics ne disent rien de votre métier ; vingt cas réels annotés en disent beaucoup.

C'est le cœur de notre travail : brancher un agent sur les bonnes sources, avec le bon cloisonnement, en hébergement européen. Voir nos agents IA sur mesure et, sur le choix des modèles auto-hébergeables, notre comparatif des meilleurs LLM open source.

FAQ

Questions fréquentes — contexte et agents IA

C'est le travail consistant à décider quelle information se trouve devant le modèle au moment où il répond : documents récupérés, historique conservé, données métier injectées, outils accessibles, et instructions. On l'oppose souvent au prompt engineering, qui ne concerne que la formulation des consignes. La distinction est utile parce qu'elle déplace l'effort au bon endroit : sur la plupart des agents d'entreprise qui déçoivent, le prompt est correct et c'est le contexte qui est vide, périmé ou mal cloisonné.

Guides liés

À lire ensuite

Sources

Liens vérifiés à la publication. Les textes réglementaires évoluent : reportez-vous toujours à la source officielle.

Parlons de votre projet

Une question, un projet, une idee ? On vous repond sous 24h. Audit gratuit, sans engagement.

Nos coordonnees