Horizon

De la Terre à votre point de vue.

Lumière localeParismétéo indisponible
Choisir une villeParis · par défaut

La recherche validée est transmise au service de géocodage ; une position approximative est transmise au service météo. Le fournisseur est indiqué avec ses données. Votre choix est mémorisé dans ce navigateur pendant 30 jours, si le stockage est disponible.

Pour la descente, les tuiles cartographiques de la région choisie sont demandées à la NASA par notre serveur. La position choisie est arrondie au dixième de degré.

Défilez pour descendre · Remontez pour revenir · ↓ ↑ au clavier

Composite d’août 2004 · source native ≈ 500 mNASA · Blue Marble
TerreVotre région

Le site fonctionne sans mesure d’audience. Vous pouvez autoriser une mesure agrégée par Google Analytics, ou poursuivre sans elle. Le récit, les routes et Horizon restent les mêmes.

Conservé dans ce navigateur lorsque son stockage est disponible.

Google Analytics : pages consultées et navigation agrégée. Ce choix est facultatif et réversible.

Lire la confidentialité

Le fil du voyage

Votre lumièreParis, ancrage de la maison Météo indisponible · lumière solaire calculée.

La recherche validée est transmise au service de géocodage ; une position approximative est transmise au service météo. Le fournisseur est indiqué avec ses données. Votre choix est mémorisé dans ce navigateur pendant 30 jours, si le stockage est disponible.

Retour au blog
LLMs & IA Générative

RAG en entreprise : Guide pratique pour exploiter vos documents avec les LLMs

Comment mettre en place un système RAG (Retrieval-Augmented Generation) pour permettre à vos équipes d'interroger vos documents en langage naturel.

Publié le 1 décembre 2024Mis à jour le 6 septembre 202615 minNeuroVista

Introduction

Les LLMs ne connaissent pas automatiquement vos données internes. Le RAG (Retrieval-Augmented Generation) relie un modèle à une base documentaire afin de construire des réponses à partir de passages retrouvés et de leurs références.

Qu'est-ce que le RAG ?

Le RAG combine deux étapes :

  1. Retrieval : Rechercher les passages pertinents dans votre base documentaire
  2. Generation : Utiliser un LLM pour générer une réponse basée sur ces passages

Cette approche peut réduire les réponses non étayées si la recherche, les sources fournies au modèle et l'évaluation sont conçues ensemble. Elle ne remplace pas la vérification des réponses qui ont un effet important.

Le principe est présenté dans la publication Lewis et al., Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks (2020). Cette référence décrit une méthode de recherche ; elle ne garantit ni l'exactitude d'une réponse ni les performances d'un déploiement particulier.

Architecture d'un système RAG

1. Ingestion des documents

  • Extraction du texte (PDF, Word, PowerPoint, HTML)
  • Découpage en chunks (paragraphes, sections)
  • Nettoyage et normalisation

2. Vectorisation

  • Conversion des chunks en embeddings (vecteurs numériques)
  • Stockage dans une base vectorielle (Pinecone, Weaviate, Qdrant)

3. Recherche

  • Conversion de la question utilisateur en embedding
  • Recherche des chunks les plus similaires
  • Ranking et filtrage

4. Génération

  • Construction du prompt avec les chunks récupérés
  • Appel au LLM pour génération de la réponse
  • Post-traitement et citations

Bonnes pratiques

Chunking intelligent

  • Découpez selon la structure logique des documents (titres, paragraphes, tableaux et annexes).
  • Choisissez taille et recouvrement à partir de tests de recherche sur des questions représentatives.
  • Mesurez l'effet sur la qualité des passages retrouvés, la latence et la taille de l'index avant de généraliser un réglage.

Prompt engineering

  • Instructions claires pour utiliser uniquement les sources fournies
  • Demander des citations explicites
  • Gérer les cas où l'information n'est pas disponible

Évaluation continue

  • Métriques de qualité des réponses
  • Feedback utilisateurs
  • Tests automatisés sur des questions types

Conclusion

Le RAG est adapté lorsque des sources évoluent et que l'utilisateur doit pouvoir les retrouver. Une architecture utile commence par un corpus autorisé, des droits d'accès appliqués à la recherche, des évaluations sur des questions réelles et une réponse explicite lorsque la source manque.

FAQ

Le RAG est-il sécurisé pour des données sensibles ?

Il peut s'inscrire dans une architecture adaptée, mais cela dépend des droits d'accès, du chiffrement, des journaux, des contrats du fournisseur et des flux de données. Vérifiez ces points pour le périmètre réellement déployé.

Quelle est la différence entre RAG et fine-tuning ?

Le fine-tuning adapte le comportement du modèle ; le RAG fournit du contexte à chaque requête. Le RAG facilite la mise à jour des sources, mais les deux approches doivent être évaluées sur la qualité, la latence et les coûts complets.

Combien de documents peut gérer un système RAG ?

La capacité dépend du découpage, des métadonnées, de la dimension des embeddings, du débit de requêtes et de la rétention. Chargez un corpus représentatif, mesurez la qualité et la latence, puis dimensionnez indexation, stockage et recherche.

Initier un dialogue ?

La maison peut mettre ces concepts au travail chez vous.

Nous contacter