4.3 · Data Science : NumPy, pandas, Matplotlib

Niveau 4 · Spécialisations (Web, Data, IA, Automatisation)

4.3Data Science : NumPy, pandas, Matplotlib

Objectif : manipuler, analyser et visualiser des données.
Temps estimé : 16 min

Python est le langage roi de la science des données. Trois bibliothèques forment le trio incontournable : NumPy (calcul numérique rapide sur des tableaux), pandas (manipulation de données tabulaires, le « tableur programmable ») et Matplotlib (visualisation). Ensemble, elles permettent de charger, nettoyer, analyser et représenter des données réelles.

Le cœur de pandas est le DataFrame, une table à lignes et colonnes qu'on interroge, filtre, agrège en quelques lignes — là où un tableur montre vite ses limites. C'est la compétence data la plus demandée sur le marché.

Vocabulaire de la section

NumPy
Bibliothèque de calcul numérique : le tableau ndarray, très rapide (écrit en C), base de tout l'écosystème scientifique.
pandas
Bibliothèque d'analyse de données tabulaires. Structure clé : le DataFrame.
DataFrame
Table de données à lignes et colonnes nommées, façon feuille de tableur, manipulable en Python.
Matplotlib
Bibliothèque de visualisation : courbes, histogrammes, nuages de points. Souvent complétée par seaborn.
Nettoyage de données
Étape (souvent la plus longue) de correction des valeurs manquantes, doublons et incohérences avant analyse.
Vérifiez votre compréhension

Quelle structure est au cœur de pandas pour l'analyse de données ?

Data Science : NumPy, pandas, Matplotlib
Vidéo hébergée sur YouTube — ouvrir dans un nouvel onglet ↗
Corey Schafer — série « pandas »
Cliquer pour voir les résultats à jour ↗

En pratique — Analyser un jeu de données avec pandas

  1. Installez le trio (pip install numpy pandas matplotlib). Chargez un fichier CSV dans un DataFrame : df = pd.read_csv("donnees.csv").
  2. Explorez : df.head(), df.info(), df.describe(). Repérez les colonnes et les valeurs manquantes.
  3. Filtrez et agrégez : sélectionnez des lignes selon une condition, groupez avec groupby() et calculez une moyenne par catégorie.
  4. Visualisez : tracez un histogramme ou une courbe avec df.plot() / matplotlib, et interprétez le résultat.
Vous chargez, explorez, filtrez, agrégez et visualisez un vrai jeu de données avec pandas et Matplotlib : le socle du métier de data analyst.

Points clés à retenir

  • Le trio data : NumPy (calcul), pandas (tables), Matplotlib (graphiques).
  • Le DataFrame de pandas est un tableur programmable, puissant sur de gros volumes.
  • read_csv, head, describe, groupby : les gestes de base de l'analyse.
  • Le nettoyage des données est souvent l'étape la plus longue — et la plus importante.

Questions fréquentes

pandas remplace-t-il Excel ?

Pour l'analyse sérieuse, souvent oui : pandas gère des millions de lignes, automatise des traitements reproductibles et se connecte à toutes les sources. Excel reste pratique pour de petits volumes et un usage visuel ponctuel. Beaucoup d'analystes utilisent les deux, selon le besoin.

Faut-il être bon en maths pour la data science avec Python ?

Pour l'analyse et la visualisation de données (ce chapitre), des bases de statistiques suffisent. Les maths avancées deviennent utiles pour le machine learning (section suivante). On peut donc démarrer la data avec pandas sans être mathématicien.

Autres ressources