Les embeddings transforment du texte, des images ou d'autres données en vecteurs numériques qui capturent le sens. Ils sont au cœur de la recherche sémantique et du RAG.
Points clés
- Saisir le principe de la représentation vectorielle
- Mesurer la similarité et l'utiliser
- Choisir et évaluer un modèle d'embeddings
Saisir le principe de la représentation vectorielle
Un embedding projette une donnée dans un espace vectoriel où la proximité géométrique reflète la similarité de sens. Faites visualiser que roi - homme + femme se rapproche de reine pour illustrer la sémantique capturée. Expliquez la dimensionnalité (souvent 384, 768 ou 1536) et le fait que des textes proches ont des vecteurs proches. Ce principe fonde toute la recherche sémantique moderne.
Mesurer la similarité et l'utiliser
Introduisez la similarité cosinus comme mesure standard de proximité entre vecteurs, et la distance euclidienne. Montrez comment cela permet la recherche sémantique : trouver des documents par le sens plutôt que par mots-clés exacts. Faites manipuler sentence-transformers (modèles comme all-MiniLM) pour encoder des phrases et comparer leurs scores. La pratique rend le concept tangible.
Choisir et évaluer un modèle d'embeddings
Comparez les options : modèles open source via sentence-transformers et Hugging Face, ou API comme OpenAI. Présentez le benchmark MTEB pour choisir selon la langue et la tâche, en privilégiant les modèles multilingues pour le français. Abordez le coût, la latence et la dimension des vecteurs. Un bon choix de modèle conditionne la qualité d'un RAG ou d'un moteur de recherche.
En pratique
Scénario. Sur une demi-journée (3h30), les apprenants encodent un corpus de 50 articles avec sentence-transformers, calculent les similarités cosinus, puis construisent un mini moteur de recherche sémantique en Python. Ils visualisent les embeddings réduits en 2D avec UMAP dans un notebook Jupyter. Livrable : un notebook de recherche sémantique et une visualisation des clusters thématiques.
Questions fréquentes
Embeddings ou recherche par mots-clés ?
Les embeddings capturent le sens et tolèrent les synonymes et reformulations, là où les mots-clés exigent une correspondance exacte. Une recherche hybride combine souvent les deux pour de meilleurs résultats.
Quel modèle d'embeddings pour le français ?
Privilégiez un modèle multilingue performant comme ceux de la famille sentence-transformers multilingue. Le benchmark MTEB aide à comparer les performances par langue.
Pour aller plus loin
Pour approfondir : Aborder l ethique des donnees · Aborder l ia generative d images. Et le reste de nos ressources pour les écoles, OF et formateurs.
Besoin d'un formateur expert ou envie de transmettre ?
tonformateur connecte les écoles et organismes de formation avec des intervenants experts du terrain.
Voir les cours à pourvoir Explorer l'annuaire d'outils →