Un modèle de langage ne connaît pas vos contrats. Il n’a jamais lu vos procédures, ni vos comptes rendus d’intervention, ni la note de service de mars dernier.
Le RAG est la technique qui corrige ça.
C’est le mot que vous entendrez dans tous les devis d’assistant interne. Et celui que personne ne vous explique avant de vous le facturer. Il tient pourtant en une phrase.
Qu’est-ce que le RAG, en une phrase ?
Le RAG, Retrieval Augmented Generation, génération augmentée par récupération, fait chercher le modèle dans vos documents avant de le laisser répondre. Et il l’oblige à citer le passage qui justifie sa réponse.
Ce n’est pas de l’intelligence en plus. C’est une laisse.
Sans RAG, vous posez une question à un modèle qui répond avec ce qu’il a lu pendant son entraînement : le web, des livres, du code. Vos conditions de résiliation n’y sont pas. Il répondra quand même, avec aplomb, en inventant ce qui manque.
Le RAG répond, il n’agit pas. Ce qui écrit et déclenche à votre place est un agent IA, une autre brique.
Avec RAG, la même question déclenche d’abord une recherche dans vos fichiers. Le modèle reçoit les passages trouvés et n’a le droit de rédiger qu’à partir d’eux. La réponse arrive avec sa référence : article 8, contrat Martin, page 4.
La différence n’est pas la qualité de la réponse. C’est que vous pouvez la vérifier.
Cette brique-là reste rare. En 2025, 8,8 % des entreprises européennes de dix salariés ou plus employaient une technologie qui génère du texte ou du code. Elles étaient 11,8 % à en employer une qui analyse du texte écrit (Eurostat, 2025). Ce sont les deux moitiés du RAG. L’IA qui lit et qui répond concerne donc moins d’une entreprise sur dix, loin des 20 % d’adoption de l’IA tous usages confondus.
Comment l’assistant retrouve-t-il le bon passage ?
En quatre temps. Trois d’entre eux sont l’endroit où les projets échouent. Aucun ne concerne le modèle.
Découper. Vos documents sont coupés en passages de quelques centaines de mots. Un contrat de trente pages devient soixante morceaux.
Indexer. Chaque passage est transformé en une suite de nombres qui situe son sens : son plongement, ou embedding. Deux passages qui parlent de la même chose avec des mots différents se retrouvent voisins. L’ensemble vit dans une base vectorielle.
Retrouver. Votre question subit le même traitement. On compare, on remonte les cinq ou dix passages les plus proches.
Rédiger. Le modèle reçoit votre question et ces passages, avec une consigne : répondre à partir d’eux, ou dire qu’il ne sait pas.
Le modèle n’intervient qu’à la dernière étape. Tout ce qui précède est de la mécanique documentaire. Et c’est là que se joue le résultat.
Pourquoi pas un simple moteur de recherche ?
Parce qu’un moteur cherche des mots quand vos salariés cherchent des réponses.
Tapez « préavis » dans votre serveur de fichiers : vous obtenez douze documents qui contiennent le mot. Il reste à les ouvrir, à trouver la clause, à vérifier qu’elle s’applique bien à ce client-là.
Le RAG remonte le passage qui répond, même quand il ne contient aucun des mots de votre question. Une clause intitulée « fin de collaboration » répond à une question sur le préavis, parce que les deux occupent le même voisinage de sens.
Le gain réel se mesure là, pas dans la conversation : ce n’est pas le temps de lecture qu’on économise, c’est le temps de recherche. Un assistant qui répond en trois secondes à une question dont la réponse dormait dans un dossier partagé depuis quatre ans ne fait rien d’intelligent. Il fait ce que personne n’avait le temps de faire.
Où le RAG se trompe-t-il, exactement ?
Un seul des trois endroits concerne le modèle. Le point de départ vient du droit. En 2025, le RegLab de Stanford a publié dans le Journal of Empirical Legal Studies l’évaluation de trois outils juridiques professionnels construits en RAG, tous vendus comme exempts d’hallucination. Ils se trompent de 17 % à 33 % du temps, contre 43 % pour GPT-4 seul, mesuré dans le même protocole (Magesh et al., Hallucination-Free? Assessing the Reliability of Leading AI Legal Research Tools, JELS, 2025).
Ces deux nombres disent tout. Ils se lisent ensemble.
Le RAG divise les erreurs par deux et demi. Il n’en supprime aucune.
Reste à savoir où la chaîne casse, parce que ce n’est presque jamais là qu’on regarde.
| Où ça casse | Ce que vous voyez | Ce qui le corrige |
|---|---|---|
| À la découpe | Une réponse fausse avec une source juste : la clause et son exception sont tombées dans deux morceaux | Redécouper en suivant la structure du document, pas un nombre de mots |
| À la récupération | Une réponse plausible, qui ignore le document qui comptait | Remonter plus de passages, ou réindexer autrement |
| À la rédaction | Un contresens sur un passage pourtant remonté | Changer de modèle. Le cas le plus rare. Et le seul dont tout le monde parle |
Sur les assistants qu’on a mis en place, les deux premières lignes expliquent la quasi-totalité des réponses fausses. La troisième, presque jamais.
D’où une conséquence qui surprend : prendre le modèle le plus cher ne règle rien. Nos fiches modèles donnent les tarifs, pas une garantie de justesse.
Pourquoi un assistant qui marche en démonstration déçoit-il ensuite ?
Parce qu’il existe un quatrième endroit où ça casse. Aucune recette ne le teste. En juillet 2026, npj Health Systems a publié la mesure d’un assistant clinique en RAG. 5 % de réponses fausses à la première question, 40 % après dix échanges dans la même conversation (Jung et al., npj Health Systems, 2026). Même requête, rejouée cent fois par longueur d’historique.
Huit fois plus d’erreurs, pour la même question, selon ce qui la précède.
Retenez la conséquence pratique : votre démonstration se fera dans les conditions où l’assistant ment le moins. On pose trois questions, ça marche, on valide. Personne ne travaille comme ça une fois l’outil en service.
Qu’est-ce que le RAG ne répare pas ?
Ce qu’il ne répare pas se voit le jour de la mise en service.
Un document faux. Le RAG cite fidèlement la procédure de 2021 que personne n’a mise à jour. Il ne sait pas qu’elle est périmée. Il la servira avec la même assurance que la bonne.
Un chiffre qui vit dans un tableur. Un assistant lit très bien du texte libre. Dès qu’on lui demande une somme, une marge ou un encours, il répond sur ce qu’on lui a donné. En février 2025, Gartner interrogeait 248 responsables de la donnée : 63 % n’ont pas les pratiques de gestion adaptées à l’IA, ou ignorent s’ils les ont (Gartner, Lack of AI-Ready Data Puts AI Projects at Risk, 2025). L’incertitude est une réponse en soi. Les chiffres relèvent d’un autre chantier : structurer les données de l’entreprise.
Des droits d’accès que personne n’a posés. Un corpus indexé sans filtre expose la grille des salaires à toute l’entreprise, le premier jour, à la première question. Ça n’arrive pas par malveillance : ça arrive parce que le dossier était dans le périmètre. C’est la version interne du problème que pose déjà le Shadow AI, vu de l’autre côté.
Le RAG rend visible l’état réel de votre documentation. C’est souvent le premier service qu’il rend. Rarement celui qu’on avait commandé.
Quelles questions poser à qui vous vend du RAG ?
Elles se posent avant le devis, jamais après.
Sur quel corpus, exactement ? Un dossier nommé, un public nommé, une question type. Pas « vos documents ». Un périmètre flou est la première cause de projet qui triple.
Que répond l’assistant quand il ne sait pas ? La seule bonne réponse est qu’il le dit. Un assistant qui répond toujours est un assistant qui invente parfois.
Comment on mesure que ça marche ? Une liste de trente questions réelles, leurs réponses attendues, écrites avant la mise en service. C’est la recette. Elle se rédige avec ceux qui poseront les questions.
L’avez-vous testé en conversation longue ? Pas trois questions à froid : vingt questions d’affilée, comme un salarié le fera. C’est là que les taux d’erreur se réveillent.
Qui met le corpus à jour, à quelle fréquence ? C’est le coût que personne n’annonce. Un assistant branché sur une documentation figée se périme à la vitesse de votre activité.
Chez Bienfait, on livre un premier périmètre documentaire en trois à six semaines, avec sa recette écrite d’avance. Et on vous dit franchement quand une requête bien écrite ferait le même travail. C’est ce que couvre notre brique IA appliquée à vos données.
En bref
Le RAG ne rend pas l’IA infaillible. Mais il rend ses erreurs visibles.
Quatre temps : découper, indexer, retrouver, rédiger. Un seul concerne le modèle. Les trois autres décident du résultat. Et ce sont eux qu’on néglige.
Ce qu’il ne répare pas tient en une ligne : un document faux reste faux, un chiffre dans un tableur reste un chiffre dans un tableur, un droit d’accès oublié se paie le premier jour.
Chez Bienfait, on commence par regarder ce que vos documents disent déjà avant de parler de modèle. Les délais, les usages qui tiennent et le budget sont dans notre guide sur l’IA appliquée aux données d’entreprise.
Alors la question n’est peut-être pas de savoir si le RAG fonctionne. Quelle question coûte le plus cher chez vous ? Et combien de personnes connaissent déjà la réponse ?
Les sources
Les chiffres de cet article viennent des sources suivantes, consultées le 21 septembre 2026.
- Varun Magesh, Faiz Surani, Matthew Dahl, Mirac Suzgun, Christopher D. Manning et Daniel E. Ho, Hallucination-Free? Assessing the Reliability of Leading AI Legal Research Tools, Journal of Empirical Legal Studies, vol. 22, p. 216-242, 23 avril 2025. Évaluation préenregistrée de trois outils juridiques construits en RAG, avec GPT-4 seul comme témoin dans le même protocole. https://onlinelibrary.wiley.com/doi/abs/10.1111/jels.12413
- HyoJe Jung, Kyusok Cho, Tae Joon Jun et Young-Hak Kim, RAG in clinical practice: a cautionary tale of AI ‘Truthfulness’, npj Health Systems, 3 juillet 2026. Une requête standardisée, rejouée cent fois par longueur d’historique, sur un RAG de décision clinique. https://pmc.ncbi.nlm.nih.gov/articles/PMC13354189/
- Eurostat, Use of artificial intelligence in enterprises, collecte 2025, publié le 11 décembre 2025. Enquête communautaire, 27 États membres, entreprises de 10 salariés et plus hors secteur financier. https://ec.europa.eu/eurostat/statistics-explained/index.php?title=Use_of_artificial_intelligence_in_enterprises
- Gartner, Lack of AI-Ready Data Puts AI Projects at Risk, 26 février 2025. Enquête auprès de 248 responsables de la donnée, troisième trimestre 2024. https://www.gartner.com/en/newsroom/press-releases/2025-02-26-lack-of-ai-ready-data-puts-ai-projects-at-risk
- CNIL, IA et RGPD : la CNIL publie ses nouvelles recommandations pour accompagner une innovation responsable, 7 février 2025. https://www.cnil.fr/fr/ia-et-rgpd-la-cnil-publie-ses-nouvelles-recommandations-pour-accompagner-une-innovation-responsable
Si votre question a une réponse unique et exacte, qu'une requête la sort en trois secondes, le RAG ajoute une couche d'incertitude sur un résultat déjà certain. Il vaut quand la réponse est écrite en langage libre, éparpillée dans des documents que personne ne sait plus où chercher. Et quand on accepte de vérifier la source citée. Combien d'heures par mois passe-t-on chez vous à chercher une réponse qui existe déjà quelque part ? C'est la seule mesure qui décide.
Le RAG ne rend pas l'IA infaillible. Il rend ses erreurs visibles en dix secondes, ce qui est la seule chose qui compte quand la réponse engage l'entreprise.
Questions fréquentes
Que veut dire l'acronyme RAG ?
Retrieval Augmented Generation, soit génération augmentée par récupération. Trois mots pour trois temps : on récupère les passages pertinents dans vos documents, on les donne au modèle, il rédige à partir d'eux. L'ordre compte. La récupération vient avant la génération. Et c'est tout le principe.
Quelle différence entre le RAG et un moteur de recherche interne ?
Un moteur cherche des mots et rend une liste de documents. Le RAG cherche du sens et rend une phrase. Demandez « quel est le préavis chez Martin » : le moteur remonte douze fichiers contenant le mot préavis, le RAG répond trois mois et cite l'article 8, page 4.
Faut-il entraîner un modèle sur mes données ?
Presque jamais. Le réentraînement coûte cher, se refait à chaque changement de document, ne cite aucune source. Le RAG laisse vos documents là où ils sont et les consulte à la question. Pour une base documentaire qui bouge, c'est la seule approche qui reste juste le lendemain.
Combien de documents faut-il pour que le RAG serve ?
La question n'est pas le nombre mais la dispersion. Cinquante procédures que trois personnes connaissent par cœur ne justifient rien. Deux mille comptes rendus d'intervention dont personne ne sait ce qu'ils contiennent, oui. Le bon signal, c'est le temps passé à chercher, pas le volume.
Mes documents partent-ils chez le fournisseur du modèle ?
Les passages retrouvés partent avec la question, sauf modèle hébergé chez vous. Vos fichiers, eux, restent dans votre index. La CNIL a publié ses recommandations sur l'IA et le RGPD le 7 février 2025 : le sujet se traite au cadrage, avec le choix d'hébergement, pas après la mise en service.