spaCy est une bibliothèque Python de traitement du langage naturel rapide et prête pour la production, idéale pour enseigner les fondamentaux du NLP de façon concrète.
Points clés
- Découvrir le pipeline de traitement spaCy
- Exploiter la reconnaissance d'entités et le matching
- Situer spaCy face aux LLM et à Hugging Face
Découvrir le pipeline de traitement spaCy
spaCy traite un texte à travers un pipeline : tokenisation, étiquetage morphosyntaxique (POS tagging), lemmatisation, analyse de dépendances et reconnaissance d'entités nommées (NER). Faites charger un modèle français (fr_core_news_sm) et observer chaque annotation sur une phrase. Cette approche structurée rend les concepts du NLP tangibles et immédiatement visibles. L'objet Doc et ses tokens sont le cœur de la bibliothèque.
Exploiter la reconnaissance d'entités et le matching
La NER identifie automatiquement personnes, lieux, organisations et dates dans un texte. Faites extraire ces entités d'articles de presse pour un cas concret. Présentez le Matcher et le PhraseMatcher pour repérer des motifs personnalisés à base de règles, complémentaires aux modèles statistiques. Cette combinaison règles plus apprentissage reflète les pratiques réelles. L'apprenant construit un extracteur d'information utile.
Situer spaCy face aux LLM et à Hugging Face
Positionnez spaCy honnêtement : rapide, léger, déterministe et excellent pour des tâches structurées en production, là où les LLM via Hugging Face sont plus puissants mais plus lourds et coûteux. Montrez qu'on peut combiner spaCy pour le prétraitement et des transformers pour la compréhension fine. Abordez aussi l'entraînement d'un modèle NER personnalisé. Ce panorama aide à choisir le bon outil.
En pratique
Scénario. Sur une journée (6h), les apprenants construisent un extracteur d'information sur un corpus d'articles de presse français : tokenisation, NER avec le modèle fr_core_news, et règles personnalisées avec le Matcher pour repérer des produits. Ils visualisent avec displaCy. Livrable : un notebook d'extraction d'entités et un tableau récapitulant les entités détectées par catégorie.
Questions fréquentes
spaCy ou un LLM pour le NLP en formation ?
spaCy est idéal pour comprendre les fondamentaux du NLP de façon visible et rapide. Les LLM viennent ensuite pour des tâches de compréhension plus complexes.
spaCy gère-t-il bien le français ?
Oui, spaCy fournit des modèles français entraînés pour la tokenisation, le POS, la lemmatisation et la NER. Le modèle large offre une meilleure précision que le petit.
Pour aller plus loin
Pour approfondir : Aborder l ethique des donnees · Aborder l ia generative d images. Et le reste de nos ressources pour les écoles, OF et formateurs.
Besoin d'un formateur expert ou envie de transmettre ?
tonformateur connecte les écoles et organismes de formation avec des intervenants experts du terrain.
Voir les cours à pourvoir Explorer l'annuaire d'outils →