🏆 Meilleur résultat absolu

BAAI/bge-multilingual-gemma2 · BM25 0.3 · top_k=25 · avec reranker bge-reranker-v2-m3

0.6769
MAP@10
0.8333
Recall@10
+26.3%
vs BM25 seul (BM25 1)
0.6769
vs gemma2 best

Configuration commune

Dataset:Scifact (test set)
Requêtes:300
Top K:50
Top K Reranker:25
Reranker:api-reranker.ailab.infocepo.com
Modèle:ai-default (openwebui)
BAAI/bge-m3 — top_k=20, hybrid=0, sans reranker
K (top_k) NDCG MAP Recall Precision
10.52670.50070.50070.5267
30.60300.57460.65730.2400
50.62410.58890.71110.1580
100.64550.59990.77080.0873
150.65510.60300.80580.0607
200.65900.60400.80900.0490
1000.65580.60340.80760.0092
NDCG@K — Évolution (bge-m3, hybrid=0, sans reranker)
0.66 0.63 0.60 0.57 0.527 0.603 0.624 0.646 0.655 0.659 0.656 1 3 5 10 15 20 100

📝 Analyse (bge-m3, embedding seul, hybrid=0, sans reranker)

Configuration : top_k=20, recherche_hybrid=0 (embeddings uniquement), pas de reranker. Les scores montrent la performance pure de l'embedding bge-m3.

NDCG@20 = 0.6590 — légèrement supérieur à NDCG@10 (0.6455), le plateau est atteint. MAP à K=20 : 0.6040.

Recall à K=20 : 0.8090 — 80.9% des documents pertinents sont récupérés dans les 20 premiers résultats.

Precision : chute attendue de 0.5267 (K=1) à 0.0490 (K=20). À K=20, 4.9% des 20 résultats sont pertinents en moyenne par requête.

Comparaison hybride : bge-m3 embedding seul MAP@10 = 0.6040 (K=20) vs hybride BM25 0.3/0.4/0.5 MAP@10 = 0.5878. L'embedding seul surpasse l'hybridation légère de ~0.016. Mais le reranker pousse l'hybrid à 0.6571, donc reranker + hybride reste le meilleur.

Comparaison bge-m3 vs bge-multilingual-gemma2
BAAI/bge-m3
MAP@10 meilleur (avec reranker)0.6571
MAP@10 meilleur (sans reranker)0.5878
Gain reranker+0.0693 (+11.8%)
NDCG@1000.6487
Recall@1000.8176
BM25 poids optimal0 (embedding seul)
BAAI/bge-multilingual-gemma2
MAP@10 meilleur (avec reranker)0.6769
MAP@10 meilleur (sans reranker)0.6363
Gain reranker+0.0406 (+6.4%)
Recall@10 (meilleur)0.8333
BM25 poids optimal0.3
Top K optimal25
BAAI/bge-m3 — MAP@10
Configuration BM25 0 BM25 0.2 BM25 0.3 BM25 0.4 BM25 0.5 BM25 1
sans reranker 0.5719 ↓ 0.5878 ★ 0.5878 ★ 0.5878 ★ 0.5878 ★ 0.5498 ↓↓
avec reranker 0.6571 ★ 0.6535 0.6569 0.6569 0.6569 0.5931 ↓
NDCG@K — Évolution (bge-m3, BM25 0.3/0.4/0.5)
BM25 0.3
BM25 0.4
BM25 0.5
0.65 0.62 0.59 0.56 0.507 0.587 0.616 0.639 0.646 0.649 1 3 5 10 15 100 3 courbes superposées (écart 0.0000)

📝 Analyse (bge-m3)

Sans reranker : BM25 0.2–0.5 sont stables à 0.5878. BM25 0 chute à 0.5719 — la sémantique pure n'est pas optimale. BM25 1 chute à 0.5498 — le BM25 seul est insuffisant.

Avec reranker : MAP@10 atteint 0.6571 à BM25 0, et 0.6569 pour 0.3–0.5. Le reranker apporte un gain de +7.7 MAP.

Constat : Les runs BM25 0.3/0.4/0.5 sont strictement identiques. Le paramètre HYBRID_BM25_WEIGHT semble ignoré par OpenWebUI.

Interprétation : Le reranker external (TOP_K_RERANKER=25) réorganise les 50 résultats, rendant le poids BM25 marginal. BGE-M3 est suffisamment discriminant pour que le score BM25 n'ajoute rien de significatif.

BAAI/bge-multilingual-gemma2

MAP@10 — Comparaison BM25 weights avec/sans reranker

Configuration BM25 0 BM25 0.2 BM25 0.3 BM25 0.4 BM25 0.5 BM25 1
top_k=50 0.5906 R@10: 0.7688 0.6360 R@10: 0.7688 0.6360 ★ 0.6357 0.6358 0.5793 ↓↓
top_k=25 0.6309 R@10: 0.8147 — 0.639 ★ — 0.6363 —
Configuration BM25 0 BM25 0.2 BM25 0.3 BM25 0.4 BM25 0.5 BM25 1
top_k=50 — — 0.6645 ★ — 0.6645 ★ —
top_k=25 — — 0.6769 ★ — — —

📝 Analyse (bge-multilingual-gemma2)

Avec reranker : MAP@10 atteint 0.6769 avec BM25 0.3 et top_k=25. Le gain par rapport au sans-reranker est de +4 MAP.

Sans reranker : BM25 0.2–0.5 stables à ~0.636. BM25 0 (0.5906) et BM25 1 (0.5793) nettement inférieurs.

Comparaison bge-m3 vs gemma2 : Le gemma2 avec reranker (0.6769) surpasse bge-m3 avec reranker (0.6571) — écart de +0.020 (+3.0%). Le reranker est plus efficace avec gemma2.

Recommandations

✅ Meilleure configuration recommandée

Modèle : BAAI/bge-multilingual-gemma2

BM25 weight : 0.3 (hybridation optimale)

Top K : 25 (plus efficace que 50)

Reranker : bge-reranker-v2-m3 activé (api-reranker.ailab.infocepo.com)

Résultat : MAP@10 = 0.6769, Recall@10 = 0.8333

⚠️ Points d'attention

HYBRID_BM25_WEIGHT ignoré : Les runs 0.3/0.4/0.5 sont strictement identiques pour bge-m3. Vérifier que le paramètre est bien propagé à l'engine de recherche OpenWebUI.

Reranker neutre l'effet BM25 : Avec TOP_K_RERANKER=25, le reranker réorganise les 50 résultats, rendant le poids BM25 marginal. Test en (1) sans reranker, (2) BM25 seul, (3) valeurs extrêmes 0.0/1.0 pour confirmer.

Top K=25 vs 50 : Pour gemma2, top_k=25 donne un MAP supérieur (0.6769 vs 0.6645) — la précision prime sur le rappel. Pour bge-m3, les deux sont identiques.