06oct.

Retrouvez Korbyx au webinaire de la Fédération Française de la Franchise

Base de connaissances interne (RAG)

Tout le savoir de votre entreprise, interrogeable en une question.

Le RAG, pour génération augmentée par récupération, permet à une IA de répondre à partir de vos propres documents plutôt que de ses connaissances générales. Vos procédures, vos contrats, vos comptes rendus et vos fiches produits deviennent une base de connaissances interrogeable en français, et chaque réponse cite ses sources. Le RAG est aujourd’hui le cas d’usage de l’IA générative le plus demandé par les entreprises de taille moyenne. Il fait aussi partie des rares dont les avantages se voient tout de suite, parce qu’il exploite des données qu’elles possèdent déjà. Cette page explique comment fonctionne un système RAG en entreprise, ce qu’il exige de vos données, quels résultats en attendre, quels risques il faut cadrer et ce que cette IA change au quotidien pour vos équipes.

  • Hébergé en Europe
  • Aucun outil à remplacer
  • Validation humaine
Deux collègues cherchant ensemble une information sur un poste de travail, en open space
Documents indexés4 800

12 services connectés2 documents périmés

KorbyxEn direct

Quel est le préavis du contrat cadre transport ?

Trois mois, par lettre recommandée (article 11.2). Un avenant de 2025 le ramène à deux mois pour les lots régionaux.

Ouvrir la source
  • 1 heure par jourc’est le temps que l’IA générative fait gagner en moyenne sur les tâches répétitives (étude Adecco, 35 000 salariés, 27 pays, 2024). La recherche d’information interne en représente une bonne part. Le RAG s’attaque directement à ce poste, et ses résultats se mesurent dès les premières semaines
  • Chaque réponse sourcéeles systèmes RAG ne devinent pas. Le moteur retrouve les passages pertinents dans vos données internes, puis rédige une réponse en citant les sources. Cette traçabilité distingue le RAG des modèles généralistes et rend son usage acceptable dans les entreprises où la qualité de l’information engage
  • Sans réentrainementle RAG n’exige aucun entraînement de modèle sur vos données internes, ce qui réduit la complexité du chantier. La base documentaire se met à jour et les réponses suivent le jour même. Pour une PME, le RAG devient ainsi le cas d’usage le plus accessible de l’IA générative, et celui dont le déploiement est le plus rapide

Ils pilotent avec Korbyx

Recherche d’information dispersée entre plusieurs outils dans une entreprise

Le problème

L’information existe, personne ne la retrouve.

Dans une PME de cinquante personnes, la réponse à presque toutes les questions internes existe déjà quelque part, dans une procédure, un compte rendu, un contrat ou un fil de discussion. La difficulté tient moins à produire l’information qu’à la retrouver au moment où on en a besoin. Exploiter ce qui existe déjà est presque toujours plus rentable que de produire du neuf.

La recherche par mots-clés, celle de votre serveur de fichiers ou de votre messagerie, échoue parce qu’elle cherche des mots et ignore le sens. Une personne qui demande « quel est le délai de rétractation sur nos contrats de maintenance » ne trouvera rien si le document parle de « faculté de renonciation ». La connaissance de l’entreprise reste donc dans la tête de trois personnes, et chaque départ en emporte une partie. Les données existent, mais elles ne sont pas exploitables.

Le RAG, ou génération augmentée par récupération, résout exactement ce problème. L’IA fait une recherche avant de répondre, et n’utilise que ce qu’elle a trouvé. Le système cherche par le sens plutôt que par les mots, retrouve les passages pertinents dans votre base documentaire, et rédige une réponse en langage naturel à partir de ces seules sources. Vos équipes posent leur question comme elles la poseraient à un collègue, et obtiennent une réponse fiable avec le lien vers le document d’origine. En trois ans, cette recherche sémantique a beaucoup gagné en qualité.

  • La recherche par mots-clés cherche des mots, le RAG cherche du sens dans vos données
  • La réponse est rédigée à partir de vos documents, pas inventée
  • Chaque réponse cite ses sources, vérifiables en un clic
  • La base se met à jour, les réponses suivent sans réentrainement

Comment ça marche

Le RAG en cinq temps.

Un système RAG fonctionne en cinq étapes. Les trois premières construisent la base de données documentaire, les deux suivantes traitent chaque question posée. Aucune ne relève de la magie, ce qui devrait rassurer celui qui aura à en répondre.

  • Collecte
  • Découpage
  • Indexation
  • Récupération
  • Génération
  • 1. La collecte

    On rassemble les documents internes (procédures, contrats, fiches produits, comptes rendus, fichiers PDF). Ces documents internes sont la seule matière que le RAG utilise, et ils doivent donc être mis à jour. Ils restent où ils sont, car le système RAG se branche dessus par API, sans déplacer vos données ni changer vos habitudes de gestion.

  • 2. Le découpage

    Chaque document est découpé en passages de taille utile. Un contrat de trente pages, souvent un PDF, devient une centaine de fragments, chacun gardant son rattachement à sa source, sa page et sa date. La qualité de ce découpage commande la précision des réponses, et quand les résultats déçoivent, on commence par l’améliorer.

    • Passages de taille homogène
    • Rattachement à la source conservé
    • Métadonnées de date et de droits
  • 3. L’indexation

    Chaque passage est transformé en une représentation numérique de son sens, stockée dans une base de données vectorielle. Cette étape de la technologie RAG permet une recherche par le sens plutôt que par les mots exacts, et donne des résultats là où une recherche classique ne rend rien.

  • 4. La récupération

    Quand une question arrive, l’IA retrouve rapidement les passages les plus proches de son sens, en respectant les droits d’accès de la personne qui interroge. Cette phase constitue la partie récupération de la génération augmentée ; elle détermine la pertinence de tout ce qui suit.

  • 5. La génération

    L’IA rédige alors une réponse en langage naturel à partir de ces seuls passages, et sait citer ses sources. Dans cette partie génération du RAG, le contexte fourni garantit la pertinence de l’information rendue, et la réponse reste traçable.

  • Ce que le RAG n’est pas

    Réentrainer un modèle sur vos données est une opération lourde et coûteuse en termes de délai comme de coûts, et inutile ici. Le RAG laisse les modèles intacts et leur fournit le contexte au moment de la question. L’approche est plus simple, plus rapide à déployer, et vos données restent à jour sans intervention. Ces systèmes se mettent en service en quelques semaines.

Les trois approches

Trois manières de faire répondre une IA sur vos données.

Le RAG n’est pas la seule approche pour faire répondre une intelligence artificielle sur vos données. Le tableau présente les trois solutions possibles, leurs coûts et ce qu’elles valent dans les entreprises que nous accompagnons.

ApprochePrincipeCe qu’il faut savoir
Copier-coller manuelon colle le document dans le chatGratuit et immédiat, mais aucune sécurité, aucune trace, et non tenable à grande échelle
RAGle système retrouve les passages utiles et les fournit au modèleMise en place rapide, mise à jour immédiate, réponses sourcées et fiables
Réentrainement du modèleon spécialise le modèle sur vos donnéesCoûteux, long, non nécessaire dans la plupart des cas, et à refaire à chaque évolution

Les prérequis

La qualité des réponses est celle de vos documents.

Tout projet de RAG en entreprise obéit à une règle. Un système RAG ne peut pas être meilleur que la base de données documentaire qu’on lui donne. Des procédures obsolètes produisent des réponses obsolètes, puisque l’IA ne fait que restituer ce qu’on lui fournit, et personne ne le remarque avant qu’un client s’en plaigne.

Le premier prérequis est donc la mise à jour. Il faut savoir quels documents font foi, lesquels sont périmés, et qui décide. Une information fiable suppose une gestion documentaire, pas seulement une technologie. Cette étape n’a rien de technique et c’est pourtant celle qui prend le plus de temps dans un projet d’IA. La plupart des entreprises découvrent à cette occasion qu’elles ont trois versions d’une même procédure, dont deux circulent encore. Ce problème de qualité existait avant le RAG, qui se contente de le rendre visible, et cela aide déjà l’entreprise à s’améliorer.

Le deuxième est celui des droits d’accès. Une base de connaissances interne contient des informations sensibles, qu’il s’agisse de contrats, de données du personnel ou d’éléments financiers. En termes de sécurité, aucun point n’est plus surveillé dans un déploiement d’IA. Le système RAG doit respecter, question par question, ce que chaque personne a le droit de consulter, car les utilisateurs n’ont pas tous accès aux mêmes informations. Il faut pour cela brancher les systèmes d’interrogation sur votre annuaire, un travail d’intégration décrit sur l’intégration de l’IA.

Le troisième est la conformité. Vos données partent vers un modèle de langage, et il faut savoir où elles sont traitées, combien de temps les échanges sont conservés, et si ces informations servent à entraîner quoi que ce soit. Nos garanties sur ce terrain figurent sur la sécurité du socle et sur la conformité de l’IA.

  • Une base documentaire à jour, dont on sait ce qui fait foi
  • Des droits d’accès respectés question par question
  • Un hébergement conforme, cloisonné, sans entraînement sur vos données
  • Un responsable de la base, qui arbitre ce qui entre et ce qui sort
Ordinateur portable posé sur une pile d’ouvrages ouverts
Équipes d’une PME utilisant la base de connaissances interne de l’entreprise

À quoi ça sert

Six usages d’une base de connaissances RAG.

Une même base documentaire rend huit services dans tous les secteurs de l’entreprise, autant d’exemples de ce qu’une IA générative bien cadrée apporte. Le RAG est rentable parce que le travail d’indexation des données, payé une fois, sert ensuite à tous les utilisateurs.

  • Support
  • Intégration
  • Commercial
  • RH
  • Technique
  • Conformité
  • Le support client

    Les conseillers obtiennent rapidement la réponse exacte et sourcée, sans chercher dans dix outils. L’IA les aide sans jamais parler au client à leur place. Le délai de réponse baisse et les écarts entre conseillers disparaissent, puisque tous s’appuient sur les mêmes informations.

  • L’arrivée d’un nouveau

    Les nouvelles recrues posent leurs questions à l’IA plutôt qu’à leurs collègues. Le temps d’intégration se raccourcit nettement. Le RAG les aide à devenir autonomes, et les personnes expérimentées de l’entreprise retrouvent leurs journées.

    • Moins d’interruptions pour les anciens
    • Autonomie plus rapide
    • Mêmes réponses pour tous
  • L’aide au commercial

    Retrouver une clause négociée l’an dernier, une grille de remise, une offre technique. Le commercial répond au client pendant le rendez-vous au lieu de promettre de revenir vers lui. Peu d’outils changent autant la relation.

  • Les questions internes

    Congés, notes de frais, procédures RH internes. Ce sont les questions les plus répétitives d’une PME, et celles qui mobilisent le plus de temps administratif pour le moins de valeur. Un RAG interne les traite sans se lasser, par exemple sur les demandes de congés.

  • La documentation technique

    Notices, schémas, historiques d’intervention. Un technicien sur le terrain interroge le RAG depuis son téléphone, grâce à une simple page web plutôt que d’appeler le bureau, et obtient en temps réel une réponse avec la page exacte du manuel.

  • La veille réglementaire

    Textes applicables, obligations, échéances. Le RAG répond en citant l’article exact, ce qui est indispensable dès qu’une réponse engage la responsabilité de l’entreprise.

  • La réponse aux appels d’offres

    Retrouver ce qui a déjà été répondu, dans quel dossier, avec quelles références. Un système RAG bien alimenté divise par deux le temps de constitution d’un dossier, et améliore la qualité des réponses.

  • Le pilotage des données

    Une base RAG ne se limite pas aux textes. Elle peut couvrir des tableaux et des bases de données structurées, et fournir des informations chiffrées fiables aux équipes de gestion, en temps réel, pour éclairer leurs décisions.

La plateforme Korbyx

Korbyx vous dit où regarder.

Plusieurs écrans, une seule base de données. Chaque écran répond à une question que vous vous posez déjà.

Toutes vos agences, comparées entre elles

Chaque agence est comparée à la médiane de ses pairs, dans votre propre réseau. Vous voyez lesquelles tournent bien, lesquelles décrochent, et de combien.

app.korbyx.fr

Devis transformés, trois derniers moisMédiane du réseau · 43 %

  • Bordeaux Lac58 %
  • Rennes Ouest51 %
  • Tours Nord47 %
  • Nantes Sud44 %
  • Dijon Centre39 %
  • Lyon Est29 %

Lyon Est est à 29 %, soit 14 points sous la médiane. Plan d’action proposé.

Résultat

3 agences à traiter, détectées ce matin

médiane du réseau
43 %médiane du réseau
écart le plus fort
−14 ptsécart le plus fort
agences sous la médiane
3 / 60agences sous la médiane
de consolidation évitées
6 hde consolidation évitées
  • Plan d’action proposé pour Lyon Est
  • Animateur prévenu, visite jeudi

Des questions en langage courant

La réponse cite la mesure, la période et la source. Quand la donnée manque, Korbyx le dit.

app.korbyx.fr

Combien a-t-on facturé en septembre, par région ?

2,1 M€, dont 38 % pour la région Ouest. Le Sud-Est recule de 9 % sur un an, surtout à Lyon Est et Dijon Centre.

Mesure : CA facturé, v3Période : septembre 2026Source : ERP

Et la marge ?

La marge par région n’est pas encore connectée. Je peux vous montrer le chiffre d’affaires ou la marge du réseau entier.

Résultat

2,1 M€ facturés en septembre

  • Ouest38 %
  • Île-de-France24 %
  • Sud-Est18 %
  • Nord12 %
  • Est8 %
  • Réponse en 4 secondes, source citée
  • Sud-Est : −9 % sur un an, à suivre

Il écrit dans vos outils

Relance préparée, tâche créée dans le CRM. Vous validez, l’action part.

app.korbyx.fr

CRM · Nouvelle tâchepréparée par Korbyx

Relancer M. Garnier, devis n° 2026-118 (14 200 €)

Bonjour Monsieur Garnier, je reviens vers vous au sujet de notre proposition du 2 septembre…

Échéance jeudi · C. DurandValiderValidée

Journal des actions

  • Tâche écrite dans le CRM, 09:42
  • Responsable prévenue, 09:42
  • Point de suivi prévu vendredi

Résultat

Cette semaine, sur vos relances

relances envoyées
14relances envoyées
clients ont répondu
6clients ont répondu
devis signés
3devis signés
encaissés ou signés
42,6 k€encaissés ou signés
  • Toutes validées par un humain
  • Écrites dans le CRM, rien à ressaisir

Données d’illustration.

Votre base

Ce que vos documents savent déjà, et que personne ne retrouve.

En une séance de 60 minutes, un fondateur recense avec vous vos sources, regarde dans quel état elles sont et estime le temps que vos équipes passent à chercher.

  • 60 minutes
  • Avec un fondateur
  • Sans engagement
Vérification d’une réponse RAG en ouvrant le document source cité

La fiabilité

Les hallucinations, et comment le RAG les réduit.

Une intelligence artificielle générative interrogée sans contexte invente parfois une réponse plausible et fausse, ce qu’on appelle les hallucinations. On lui en fait le reproche principal, à juste titre. Le RAG réduit fortement ces hallucinations, sans les supprimer complètement.

Le mécanisme n’a rien de compliqué. En fournissant au modèle les passages pertinents de vos documents, on lui donne de quoi répondre au lieu de le laisser puiser dans ses connaissances générales. Le RAG repose entièrement sur ce principe, qui fait sa fiabilité. La génération de la réponse s’appuie alors sur des sources vérifiables, et la personne qui la lit peut ouvrir le document d’origine en un clic. Dans nos déploiements, ce seul mécanisme fait passer la fiabilité perçue d’inutilisable à exploitable au quotidien, car une réponse vérifiable devient une réponse fiable.

Le risque résiduel tient à deux situations. Quand la base ne contient pas la réponse, un système mal réglé complète de lui-même. Il faut donc apprendre à cette IA à dire qu’elle ne sait pas, ce qui se paramètre. Les bonnes pratiques sont connues et se vérifient en recette. Et quand la base contient deux versions contradictoires, il en choisit une, ce qui ramène au prérequis de mise à jour. La pertinence des réponses se mesure, se suit dans le temps et s’améliore par des ajustements successifs. L’amélioration d’un système RAG demande donc un travail de fond, et l’on continue d’ajuster bien après la mise en service.

  • Répondre uniquement à partir des passages retrouvés
  • Dire « je ne sais pas » quand la base ne contient rien
  • Citer systématiquement les sources, avec le lien vers le document
  • Mesurer la pertinence dans la durée, sur des questions de contrôle
« Le RAG ne range pas vos documents à votre place. Il montre juste, au bout d’une semaine, que trois procédures se contredisent. C’est désagréable et c’est le meilleur service qu’il vous rende. »
Nicolas Saumont, fondateur de Korbyx
Nicolas Saumont, fondateur de Korbyx

La mise en place

Comment on s’y prend, en quatre étapes.

Un RAG d’entreprise se déploie en six à dix semaines sur un périmètre bien choisi, quel que soit le secteur d’activité. Notre démarche tient en quatre étapes, avec pour chacune ce qu’elle demande de votre côté.

  • Cadrage
  • Base
  • Recette
  • Ouverture
  • Le cadrage

    Quelles questions l’IA doit traiter, pour qui, à partir de quelles sources. On liste vingt questions réelles, du type « est-ce que ce contrat prévoit des pénalités de retard ? », et on s’y tient, car la recette du système RAG se fera sur elles.

  • La base documentaire

    Collecte, tri, mise à jour, découpage, indexation. Cette étape est la plus longue et la moins technique de tout le déploiement. Vos équipes y participent, puisque personne d’autre ne sait quelles informations font foi.

    • Tri de ce qui fait foi
    • Découpage et indexation
    • Droits d’accès par source
  • La recette

    On rejoue les vingt questions du cadrage, on mesure la pertinence, on ajuste le découpage et les réglages. Deux ou trois passes suffisent en général à atteindre des résultats utilisables au quotidien.

  • L’ouverture

    Ouverture à un premier groupe d’utilisateurs, formation courte, recueil des retours pendant un mois. Cette période fait apparaître les questions auxquelles personne n’avait pensé, et l’on enrichit alors les bases documentaires en fonction des besoins réels.

FAQ

Questions fréquentes sur le RAG en entreprise.

Qu’est-ce que le RAG ?

RAG signifie génération augmentée par récupération. Cette technologie permet d’utiliser une intelligence artificielle générative pour répondre à partir de documents précis plutôt que de ses seules connaissances générales. Le système récupère d’abord les passages pertinents dans votre base documentaire, puis l’étape de génération rédige une réponse à partir de ce contexte, en citant ses sources. La précision obtenue dépend directement de cette étape de récupération.

Quelle différence avec un modèle entraîné sur nos données ?

Le réentrainement modifie le modèle lui-même, ce qui prend du temps, coûte cher et doit être recommencé à chaque évolution de vos documents. Le RAG laisse le modèle intact et lui fournit le contexte au moment de la question. La mise à jour est immédiate, le coût sans commune mesure, et les sources restent citables. Pour la plupart des entreprises, le RAG est la bonne solution, et la seule qui tienne dans le temps, puisque ce format est aussi le mieux adapté aux bases qui bougent.

Combien de temps pour mettre en place un RAG ?

Six à dix semaines sur un périmètre bien choisi, du cadrage à l’ouverture à un premier groupe. La compatibilité avec vos délais se vérifie dès le cadrage. Le développement du RAG ne pèse qu’une petite part de ce délai, l’essentiel tenant à la mise en ordre de la base documentaire et à la recette avec vos équipes. Un périmètre trop large reste la cause d’échec la plus fréquente, et mieux vaut réduire l’ambition initiale pour élargir ensuite.

Combien coûte un système RAG ?

Entre 8 000 et 25 000 € de mise en service pour un RAG interne, plus un coût de fonctionnement mensuel qui suit le volume de questions. Le nombre de bases à raccorder est le premier facteur de prix, devant le nombre d’utilisateurs. Ces coûts de fonctionnement varient avec le volume de questions posées. Les ordres de grandeur, détaillés sur le prix d’un projet d’IA, placent une solution RAG parmi les moins chères à déployer.

Nos données sont-elles envoyées à un fournisseur ?

Les passages retrouvés sont transmis au modèle de langage pour qu’il rédige la réponse, d’où l’importance du choix de l’hébergement. Par défaut, nous travaillons sur une infrastructure européenne, cloisonnée par client, et vos contenus ne servent à entraîner aucun modèle. Des solutions hébergées chez vous sont possibles quand les données interdisent toute sortie, grâce à des modèles ouverts désormais très capables.

Le RAG fonctionne-t-il sur des documents scannés ?

Oui, à condition de les passer d’abord par une lecture automatique. L’OCR par l’IA s’en charge, en transformant une image en texte exploitable par le RAG. Beaucoup de bases de connaissances commencent d’ailleurs par là, puisque les procédures les plus anciennes n’existent souvent qu’en papier. La qualité de la numérisation conditionne alors celle du RAG.

Combien de documents faut-il pour que ce soit utile ?

Moins qu’on ne l’imagine. Une base de deux cents documents bien tenus est déjà un outil quotidien, là où dix mille fichiers mal rangés produisent des réponses médiocres. La qualité et la fraîcheur des informations comptent bien davantage que la taille de la base. Tout dépend de ce que vos équipes cherchent vraiment, et des secteurs de l’entreprise concernés.

Que se passe-t-il quand la réponse n’existe pas ?

Un système bien réglé le dit, et propose éventuellement les documents les plus proches. Ce comportement relève d’un paramétrage explicite du RAG, sans lequel le modèle complète de lui-même et produit une réponse plausible mais fausse. Nous le vérifions pendant la recette, sur des questions volontairement hors périmètre. Un RAG honnête vaut mieux qu’un système bavard, car la confiance se gagne ou se perd en temps réel, question après question.

Secteurs et cas d’usage

Secteur par secteur, métier par métier.

Vos agences, vos chantiers, vos tournées, vos établissements : ce que Korbyx change, dans votre métier.

Rendons votre savoir interne accessible en une question.

Vous posez vos sources documentaires sur la table, un fondateur les examine avec vous pendant 60 minutes, et vous repartez avec un périmètre écrit. Sans engagement.

Retour en haut