Programme

La formation est organisée en quatre modules répartis sur les quatre séances, formant une progression cohérente : on part de la manipulation de tableaux de données (Séance 1), on l'étend au texte brut (Séance 2), puis à la structure relationnelle des données (Séance 3), et enfin à l'interaction avec des modèles de langage ancrés dans un corpus (Séance 4). Chaque séance réutilise, autant que possible, les jeux de données et les acquis des séances précédentes.

Séance 1 : Introduction et démarrage en douceur (23/09/2026)

L'objectif de cette première séance est de comprendre la logique du langage Python et de se familiariser avec les notebooks Jupyter en apprenant à manipuler un jeu de données structuré de type dataframe. Nous verrons en particulier comment :
  • Manipuler un dataframe avec la bibliothèque panda;
  • Utiliser des fonctions statistiques de base pour explorer des données quantitatives et qualitatives;
  • Tenir compte des données manquantes;
  • Visualiser les données avec matplotlib, seaborn, et plotly; 
  • Comparer différents types de visualisations et leur usages.  
Cette séance d'appuiera sur un jeu de données historiques de 400 étudiants, leur parcours de formation et leur emploi, construit à partir d'un annuaire historique de l'American University Club of Shanghai (1936). 

Télécharger le notebook et l'exercice

A l'issue de la séance, testez vos acquis avec ce QCM

Séance 2 : Analyses de corpus (07/10/2026)

Cette séance a pour objectif d’apprendre à traiter des données non structurées (texte brut) et de se familiariser avec les principales méthodes d’analyse issues de la linguistique de corpus et du traitement automatique des langues. 

À partir d’un corpus de presse historique centré sur les jeux olympiques, nous explorerons différentes approches: n-grams, analyse de fréquences, concordances, co-occurrences, modélisation thématique et reconnaissance d’entités nommées. 

Pour cela, nous utiliserons à la fois des bibliothèques classiques comme nltk, ainsi que des outils plus avancés tels que bertopic.

Télécharger le notebook

Séance 3 : Analyse et visualisation de réseaux et cartes (14/10/2026)

Cette séance est divisée en deux parties principales. La première introduira les principaux concepts et méthodes de l’analyse formelle de réseaux à travers l’étude de réseaux simples et bipartites. Nous aborderons les mesures globales (ordre, diamètre, densité), les mesures locales de centralité (degré, intermédiarité), la détection de communautés, ainsi que l’analyse des liens (poids, attributs). Cette partie de la séance s'appuiera  principalement sur la bibliothèque networkx et pyvis (pour les réseaux interactifs). Nous réutiliserons le jeu de données (auc) introduit lors de la première séance. 

La seconde partie s'intéressera à la dimension spatiale de ces mêmes données. Nous verrons comment construire des cartes de distribution (choroplètes), de points, de distance et des flux. Cette partie d'appuiera sur les bibliothèques geopandas, folium et geopy.

Télécharger le notebook et l'exercice

Séance 4 : Introduction aux Grands Modèles de Langage avec Ollama (04/11/2026)

Dans la dernière séance, nous verrons comment utiliser un grand modèle de langage (LLM) en local avec Ollama et comment construire construire un système de génération augmentée par récupération (RAG) sur le corpus de presse olympique introduit en séance 2. 

Télécharger le notebook


Commentaires

Posts les plus consultés de ce blog

Bienvenue !