4.3Data Science : NumPy, pandas, Matplotlib
Python est le langage roi de la science des données. Trois bibliothèques forment le trio incontournable : NumPy (calcul numérique rapide sur des tableaux), pandas (manipulation de données tabulaires, le « tableur programmable ») et Matplotlib (visualisation). Ensemble, elles permettent de charger, nettoyer, analyser et représenter des données réelles.
Le cœur de pandas est le DataFrame, une table à lignes et colonnes qu'on interroge, filtre, agrège en quelques lignes — là où un tableur montre vite ses limites. C'est la compétence data la plus demandée sur le marché.
Vocabulaire de la section
- NumPy
- Bibliothèque de calcul numérique : le tableau ndarray, très rapide (écrit en C), base de tout l'écosystème scientifique.
- pandas
- Bibliothèque d'analyse de données tabulaires. Structure clé : le DataFrame.
- DataFrame
- Table de données à lignes et colonnes nommées, façon feuille de tableur, manipulable en Python.
- Matplotlib
- Bibliothèque de visualisation : courbes, histogrammes, nuages de points. Souvent complétée par seaborn.
- Nettoyage de données
- Étape (souvent la plus longue) de correction des valeurs manquantes, doublons et incohérences avant analyse.
Quelle structure est au cœur de pandas pour l'analyse de données ?
En pratique — Analyser un jeu de données avec pandas
- Installez le trio (pip install numpy pandas matplotlib). Chargez un fichier CSV dans un DataFrame : df = pd.read_csv("donnees.csv").
- Explorez : df.head(), df.info(), df.describe(). Repérez les colonnes et les valeurs manquantes.
- Filtrez et agrégez : sélectionnez des lignes selon une condition, groupez avec groupby() et calculez une moyenne par catégorie.
- Visualisez : tracez un histogramme ou une courbe avec df.plot() / matplotlib, et interprétez le résultat.
Points clés à retenir
- Le trio data : NumPy (calcul), pandas (tables), Matplotlib (graphiques).
- Le DataFrame de pandas est un tableur programmable, puissant sur de gros volumes.
- read_csv, head, describe, groupby : les gestes de base de l'analyse.
- Le nettoyage des données est souvent l'étape la plus longue — et la plus importante.
Questions fréquentes
pandas remplace-t-il Excel ?
Pour l'analyse sérieuse, souvent oui : pandas gère des millions de lignes, automatise des traitements reproductibles et se connecte à toutes les sources. Excel reste pratique pour de petits volumes et un usage visuel ponctuel. Beaucoup d'analystes utilisent les deux, selon le besoin.
Faut-il être bon en maths pour la data science avec Python ?
Pour l'analyse et la visualisation de données (ce chapitre), des bases de statistiques suffisent. Les maths avancées deviennent utiles pour le machine learning (section suivante). On peut donc démarrer la data avec pandas sans être mathématicien.