4 min de lecture

RAG en entreprise : un assistant qui cite ses sources

Découpage, recherche hybride, citations, garde-fous et tests : ce qu'il faut pour qu'un assistant IA réponde à partir de vos documents sans inventer.

IARAGAgents IADocumentation
Piles de dossiers papier annotés de marque-pages jaunes dans un bureau

Un assistant IA branché sur les documents de l'entreprise est l'un des usages les plus demandés : retrouver une clause dans des centaines de contrats, répondre aux questions internes à partir des procédures, aider le support avec la base de connaissances. La technique qui permet cela s'appelle le RAG, pour « génération augmentée par la recherche ».

Le principe tient en une phrase : avant de répondre, l'assistant cherche les passages pertinents dans vos documents et s'appuie uniquement sur eux. La mise en œuvre, elle, fait toute la différence entre un outil fiable et une démonstration qui invente des réponses.

1. Pourquoi un modèle seul ne suffit pas

Un modèle de langage ne connaît ni vos contrats, ni vos procédures, ni votre catalogue. Si on l'interroge sans contexte, il répond à partir de ses connaissances générales, et peut produire une réponse plausible mais fausse. Le RAG corrige ce défaut en lui fournissant, à chaque question, les extraits de vos documents qui y répondent.

2. Préparer les documents : le découpage

Les documents sont découpés en passages, puis indexés. C'est l'étape la plus sous-estimée. Un découpage naïf, tous les 500 mots par exemple, coupe une clause en deux ou sépare un tableau de son titre. Un découpage qui suit la structure du document (titres, articles, sections) donne des passages qui se suffisent à eux-mêmes, et donc des réponses bien meilleures.

Il faut aussi conserver pour chaque passage sa source : nom du document, section, page. C'est ce qui permettra de citer.

3. Retrouver les bons passages : la recherche hybride

Chaque passage est transformé en vecteur (un embedding) qui représente son sens, et stocké dans une base vectorielle. Pour une base de taille modeste, une extension de base de données comme pgvector suffit ; au-delà, un moteur dédié comme Qdrant prend le relais.

La recherche par le sens a une faiblesse : elle retrouve mal les termes exacts, comme une référence produit, un numéro d'article ou un nom propre. La solution consiste à combiner recherche par le sens et recherche par mots-clés, puis à reclasser les résultats pour ne garder que les plus pertinents. Cette recherche hybride est souvent ce qui fait passer un assistant de « parfois juste » à « presque toujours juste ».

4. Citer ses sources et savoir dire « je ne sais pas »

Deux règles transforment un assistant en outil de confiance :

  • Chaque réponse cite ses sources : l'extrait utilisé et le document d'où il vient, pour que l'utilisateur puisse vérifier en un clic.

  • L'assistant refuse de répondre quand l'information n'est pas dans la base, au lieu de combler le vide avec ses connaissances générales.

Ce refus explicite réduit fortement les réponses inventées. Un « je ne trouve pas cette information dans les documents » vaut mieux qu'une réponse fausse présentée avec assurance.

5. Les garde-fous

Un assistant branché sur des documents internes doit être protégé :

  • Données personnelles : détecter et filtrer ce qui ne doit pas sortir, en entrée comme en sortie.

  • Injections de consignes : un document ou une question peut contenir des instructions cachées destinées à détourner l'assistant ; elles doivent être neutralisées.

  • Droits d'accès : un collaborateur ne doit retrouver que les documents qu'il a le droit de consulter.

  • Périmètre : les questions hors sujet reçoivent un refus poli, pas une improvisation.

6. Tester comme du logiciel

Un assistant IA évolue : nouveaux documents, prompts ajustés, changement de modèle. Chaque modification peut améliorer un cas et en dégrader un autre. La bonne pratique consiste à maintenir un jeu de questions de référence, avec les réponses attendues, et à le rejouer à chaque changement. Les prompts sont versionnés comme du code : une modification qui casse des cas testés ne part pas en production.

7. Où tourne le modèle ?

Le modèle qui rédige la réponse peut être appelé par une API commerciale ou hébergé sur votre propre infrastructure. Pour des documents sensibles, comme les dossiers d'un cabinet tenu au secret professionnel, héberger un modèle open-weight en Europe évite de faire sortir les extraits de vos documents : le guide pour héberger un modèle d'IA en Europe détaille les choix possibles. Dans tous les cas, le suivi des coûts par usage permet de garder le budget sous contrôle.

8. Par où commencer

Le bon premier projet est étroit et mesurable : une base documentaire précise (procédures internes, contrats types, documentation produit), une population d'utilisateurs identifiée, et une vingtaine de questions réelles pour évaluer les réponses. On élargit ensuite, une fois la qualité prouvée.

C'est la démarche du développement d'agent IA ELVACloud : des assistants branchés à vos documents et à vos outils, qui citent leurs sources, avec un modèle qui peut être hébergé en Europe. Vous avez un cas d'usage en tête ? Parlons-en : on commence par cadrer les questions auxquelles l'assistant doit savoir répondre.

Réalisation associée

Agents IA - création & gestion

Agents Claude et GPT mis en production : chatbots métier branchés aux outils internes, assistants RAG sourcés, garde-fous et coûts observables.

Voir la réalisation complète →

Un sujet à creuser ensemble ?

Audit gratuit, devis adapté à votre contexte, sans engagement.