Il programma
Le prime cinquanta ore sono il linguaggio: sintassi, liste, tuple, dizionari e set, le funzioni e i moduli, la lettura dei file e del formato JSON, la programmazione a oggetti. La cassetta degli attrezzi con cui poi si lavora sui dati.
Poi si passa ai dati veri. NumPy per gli array e le operazioni vettoriali, Pandas per i DataFrame — pulire, aggregare, unire tabelle, raggruppare — e Matplotlib con Seaborn per i grafici. Qui impari l'analisi esplorativa: guardare un dataset che non conosci e capire cosa ha da dire prima di costruirci sopra un modello.
Il cuore è scikit-learn. Costruisci pipeline complete — preprocessing, addestramento, valutazione, messa a punto — con alberi decisionali, Random Forest, SVM, KNN e K-Means. Impari a leggere accuracy, precision, recall e ROC-AUC, e a usare la cross-validation e GridSearchCV per l'ottimizzazione.
Le ultime trenta ore sono un progetto end-to-end su un dataset reale: dalla raccolta alla pulizia, dal modello alla valutazione. Il modello poi lo metti in servizio con un'API Flask, ti affacci su TensorFlow e Keras, e impari a spiegare le decisioni del modello con la feature importance e i valori SHAP.