RAG hybride en entreprise : quand combiner recherche lexicale et sémantique ?
La recherche lexicale retrouve les identifiants et expressions exactes. La recherche sémantique comprend mieux les paraphrases. Un RAG hybride combine les deux, mais il ajoute une indexation, une fusion et des métriques à maîtriser.
Dans un système de retrieval-augmented generation (RAG), le modèle ne peut répondre correctement que si le retriever lui transmet les bons passages. La recherche lexicale, souvent fondée sur BM25, repère bien les termes exacts. La recherche sémantique, fondée sur des vecteurs, rapproche les paraphrases et les concepts voisins. Un RAG hybride exécute les deux recherches puis fusionne leurs candidats. Il est pertinent lorsque le corpus mélange jargon, identifiants, synonymes et questions formulées de plusieurs façons. Il n'est pas automatiquement meilleur dans tous les contextes.
Réponse en bref
Commencez par un RAG hybride si vos utilisateurs recherchent à la fois des codes, versions, noms propres ou références exactes et des concepts exprimés avec des synonymes. Faites tourner BM25 et le dense en parallèle, fusionnez les rangs avec une méthode comme Reciprocal Rank Fusion (RRF), puis évaluez la récupération par famille de requêtes. Gardez un retriever lexical seul lorsque le vocabulaire est stable et la précision des termes prioritaire. Gardez le dense seul lorsque les requêtes sont très paraphrastiques et que les identifiants exacts ne sont pas critiques.

Schéma Nexxom. Les deux retrievers produisent des candidats indépendants. La fusion et le reranking précèdent la sélection des passages envoyés au modèle.
Lexical, sémantique ou hybride : de quoi parle-t-on ?
Recherche lexicale
La recherche lexicale compare les termes de la requête avec ceux des documents. BM25 pondère notamment la fréquence des termes et la longueur des documents. Cette approche est adaptée aux codes d'erreur, références contractuelles, numéros de version, noms de produits et expressions réglementaires. Elle est aussi explicable : une équipe peut inspecter les termes qui ont contribué au résultat.
Sa limite est connue : une requête qui utilise « remboursement différé » peut moins bien retrouver un passage qui dit « restitution après délai » si le corpus ne contient pas les mêmes mots et si aucun enrichissement lexical n'est prévu.
Recherche sémantique
La recherche sémantique transforme requêtes et passages en représentations vectorielles. Elle rapproche des formulations qui partagent une intention, même si les mots diffèrent. Les travaux sur Dense Passage Retrieval ont montré l'intérêt de représentations denses pour certaines tâches de questions ouvertes. La réplication indépendante de cette approche rappelle cependant que la performance dépend du corpus, du protocole et du réglage du baseline lexical.
La recherche vectorielle peut en revanche perdre un identifiant rare, une chaîne exacte ou une version. Un vecteur encode une proximité sémantique, pas une garantie de correspondance caractère par caractère.
Recherche hybride
La recherche hybride lance une requête lexicale et une requête vectorielle sur le même corpus, puis réunit les listes de résultats. Les documentations d'Azure, OpenSearch et Pinecone décrivent ce schéma comme une manière de couvrir des échecs complémentaires. Il faut toutefois vérifier l'effet sur votre corpus : deux retrievers qui renvoient les mêmes passages ajoutent du coût sans apporter de couverture.
| Type de requête | Lexical | Sémantique | Hybride |
|---|---|---|---|
| Code d'erreur ou SKU exact | Très adapté | Risque de voisin sémantique incorrect | Adapté si le terme exact reste prioritaire |
| Question paraphrasée | Peut manquer le vocabulaire | Très adapté | Adapté si le corpus contient aussi des noms propres |
| Nom de contrat ou de norme | Adapté, surtout avec champs pondérés | Peut rapprocher des documents voisins | Adapté avec filtre lexical et fusion contrôlée |
| Requête courte et ambiguë | Facile à diagnostiquer | Peut surinterpréter l'intention | Utile seulement avec reranking et tests d'ambiguïté |
| Corpus très homogène et petit | Souvent suffisant | Peut être superflu | Coût supplémentaire à justifier |
Quand le RAG hybride apporte une vraie valeur
Les corpus mélangent langage naturel et identifiants
Une base de support peut contenir des descriptions libres, des numéros de version et des messages d'erreur. Les requêtes réelles alternent entre « comment activer la synchronisation ? » et « erreur E-1042 sur v4.8 ». Un retriever dense aide la première formulation. BM25 protège la seconde.
Les utilisateurs emploient des synonymes différents des documents
Les équipes métier, support et juridique n'emploient pas toujours le même vocabulaire. Une recherche sémantique peut récupérer un passage pertinent malgré la paraphrase. La branche lexicale conserve une trace des mots importants et des termes obligatoires.
La traçabilité compte autant que la couverture
Pour un RAG d'entreprise, il faut expliquer pourquoi un passage a été sélectionné. La branche lexicale fournit souvent un signal inspectable. La branche dense peut compléter cette couverture. La décision finale doit conserver les rangs, les identifiants de retrievers, la version de l'index et le passage envoyé au modèle.
Quand ne pas ajouter une deuxième branche
Un pipeline hybride n'est pas une assurance gratuite. Il double parfois les index, les embeddings, les appels de recherche et les contrôles de cohérence. Un corpus de procédures courtes, avec des termes stables et des requêtes proches des titres, peut être correctement servi par un moteur lexical bien configuré. À l'inverse, un corpus narratif avec très peu d'identifiants peut commencer par le dense.
Ne choisissez pas l'hybride pour compenser un mauvais découpage, des métadonnées absentes ou des documents obsolètes. Un deuxième retriever ne répare pas une source mal classée. Corrigez d'abord la qualité, la fraîcheur et la structure des passages.
Comment construire le pipeline hybride
1. Indexer les mêmes unités de connaissance
Le document, le passage, les métadonnées et les droits doivent être cohérents dans les deux branches. Si BM25 interroge le document complet tandis que le vecteur représente un fragment différent, la fusion peut favoriser des résultats qui ne sont pas comparables. Conservez un identifiant de passage stable et appliquez les filtres d'accès avant d'envoyer le contexte au modèle.
2. Récupérer plus de candidats que nécessaire
Chaque retriever doit produire une liste de candidats. Le nombre exact dépend de la taille du corpus, du coût et du taux de bruit. Il doit être déterminé par une évaluation, pas par une constante copiée d'un exemple. Un reranker peut ensuite analyser la liste fusionnée, mais il ne récupère pas un document absent des deux premières listes.
3. Fusionner les rangs, pas des scores incomparables
Un score BM25 et une similarité vectorielle n'ont généralement pas la même échelle. La documentation Azure recommande Reciprocal Rank Fusion pour combiner les rangs de plusieurs requêtes. RRF attribue une contribution selon la position d'un résultat dans chaque liste. Cette méthode réduit le besoin de calibrer deux scores bruts, mais ses paramètres et le nombre de candidats restent à tester.
4. Reranker seulement si le gain justifie le coût
Un reranker examine plus finement la relation entre la requête et les candidats. Il peut améliorer la précision du contexte, mais ajoute de la latence et un coût de calcul. Mesurez son effet sur les requêtes difficiles, pas uniquement sur la moyenne. Si le reranker change souvent le premier résultat, examinez la qualité du chunking et des métadonnées avant d'ajouter une couche supplémentaire.
5. Journaliser la décision de récupération
Conservez la requête normalisée, les filtres, la version des index, les candidats de chaque branche, la fusion, le reranking, le contexte final et la réponse. Ces traces permettent de distinguer une absence de document, un mauvais classement et une erreur de génération. La sécurité et les droits d'accès doivent être évalués avant la fusion, pas après l'envoi au modèle.
Quel protocole d'évaluation utiliser ?
Les benchmarks publics comme BEIR sont utiles pour comprendre les familles de retrievers, mais ils ne remplacent pas un jeu de requêtes représentatif de votre entreprise. Constituez des requêtes annotées par catégories : termes exacts, paraphrases, questions multi-étapes, noms propres, versions, requêtes sans réponse et contenus soumis à des droits.
| Mesure | Question | Pourquoi elle compte |
|---|---|---|
| Recall@k | Le passage utile apparaît-il dans les k premiers ? | Détecte les documents perdus avant la génération |
| Precision@k | Quelle part des candidats est réellement utile ? | Mesure le bruit transmis au reranker et au modèle |
| nDCG@k ou MRR | Le bon passage est-il bien placé ? | Compare le classement, pas seulement la présence |
| Taux de réponse fondée | La réponse reste-t-elle soutenue par les passages ? | Relie récupération et génération |
| Latence et coût | Quel est le coût par requête ? | Empêche un gain de pertinence non exploitable |
| Accès et fraîcheur | Le résultat respecte-t-il les droits et la dernière version ? | Évite une réponse pertinente mais non autorisée ou obsolète |
Comparez au minimum trois configurations sur le même jeu de requêtes : lexical seul, dense seul et hybride. Publiez les versions d'embedding, les paramètres de chunking, les tailles de listes, la méthode de fusion et les seuils. Sans ce protocole, un gain moyen peut masquer une régression sur les requêtes réglementaires ou les identifiants.
Matrice de décision pour une équipe produit
| Votre corpus et vos requêtes | Point de départ conseillé | Signal de passage à l'hybride |
|---|---|---|
| Procédures courtes, vocabulaire stable, nombreux codes | Lexical avec champs et filtres bien définis | Les paraphrases manquent régulièrement le bon passage |
| Questions naturelles, peu d'identifiants, corpus narratif | Dense avec évaluation de couverture | Les termes obligatoires ou noms propres sont perdus |
| Documentation technique, tickets, versions et synonymes | Hybride avec RRF et métadonnées | Les deux branches renvoient des ensembles complémentaires |
| Corpus très sensible ou soumis à des droits fins | Choisir le moteur le plus contrôlable | L'hybride est acceptable si les filtres sont identiques et testés |
| Latence stricte et faible volume | Le pipeline le plus simple qui atteint le seuil | Un gain mesuré compense le coût de la seconde branche |
Erreurs fréquentes
- Fusionner les scores BM25 et vectoriels sans normalisation ni méthode documentée.
- Utiliser des filtres d'accès différents selon la branche.
- Envoyer au modèle des passages issus de documents obsolètes parce qu'ils sont sémantiquement proches.
- Multiplier le nombre de candidats sans mesurer le bruit et la latence.
- Ajouter un reranker avant d'avoir un jeu de requêtes annoté.
- Comparer deux systèmes avec des embeddings, chunks ou versions d'index différents.
- Confondre un bon classement de passages avec une réponse correcte et fondée.
Questions fréquentes
Le RAG hybride est-il toujours meilleur que le dense ?
Non. Il peut couvrir des échecs complémentaires, mais son intérêt dépend du corpus, des requêtes, des filtres, de la qualité des chunks et du budget de latence. Mesurez les trois configurations sur vos requêtes.
RRF remplace-t-il un reranker ?
Non. RRF fusionne des rangs de premières listes. Un reranker réévalue ensuite la relation entre la requête et les candidats. Le second peut améliorer la précision, mais il ajoute du coût et ne retrouve pas un passage absent des listes initiales.
Faut-il créer deux bases de données ?
Pas nécessairement. Plusieurs moteurs stockent index lexical et vecteur dans une même collection. Le choix dépend des contraintes de sécurité, d'exploitation, de coût, de migration et des fonctionnalités disponibles. L'identifiant et les filtres doivent rester cohérents.
Quelle métrique choisir en premier ?
Commencez par Recall@k pour vérifier que le passage utile est récupéré, puis mesurez le classement et la réponse fondée. Ajoutez latence, coût, fraîcheur et respect des droits pour la décision de production.
Conclusion
La recherche lexicale et la recherche sémantique ne répondent pas à la même question. BM25 protège les termes exacts, les identifiants et l'explicabilité. Le dense rapproche les paraphrases et les intentions. Un RAG hybride est justifié lorsque ces forces sont réellement complémentaires. La bonne méthode consiste à établir un jeu de requêtes d'entreprise, comparer lexical, dense et hybride, fusionner les rangs avec une méthode explicite, puis vérifier la pertinence, la fondation, la latence, le coût et les droits. La simplicité reste le meilleur choix tant qu'une deuxième branche ne produit pas un gain mesuré.
Pour prolonger la décision, consultez notre guide de choix d'un modèle d'IA pour l'entreprise et notre méthode de sélection d'un processus agentique.
Sources primaires vérifiées le 11 août 2026
- Microsoft Learn, Hybrid search in Azure DocumentDB
- Microsoft Learn, Hybrid search scoring and Reciprocal Rank Fusion
- OpenSearch documentation, Hybrid query
- Pinecone documentation, Hybrid search
- BEIR, A Heterogeneous Benchmark for Zero-shot Evaluation of Information Retrieval Models
- Dense Passage Retrieval for Open-Domain Question Answering
- A Replication Study of Dense Passage Retriever
- HYRR, Hybrid Infused Reranking for Passage Retrieval
Les performances dépendent des données, des versions de modèles, du découpage et des paramètres d'index. Aucun résultat public ne remplace une évaluation sur les requêtes et les droits de votre entreprise.

