ID:
509071
Durata (ore):
44
CFU:
6
SSD:
STATISTICA
Anno:
2026
Dati Generali
Periodo di attività
Primo Semestre (21/09/2026 - 18/12/2026)
Syllabus
Obiettivi Formativi
Il corso offre un percorso formativo sull’analisi e la modellizzazione dei dati, integrando la prospettiva del Machine Learning, focalizzata su algoritmi capaci di apprendere dai dati a fini predittivi, e quella dello Statistical Learning, che pone particolare attenzione alla modellizzazione statistica, all’interpretazione dei risultati e alla valutazione dell’incertezza. Gli studenti impareranno a formulare, stimare e valutare modelli, affrontando strumenti quali la regressione lineare semplice e multipla, l’analisi dei residui, la selezione del modello, gli alberi decisionali e la cluster analysis. La trattazione teorica è affiancata da numerose esercitazioni in ambiente R su dati reali e simulati.
I risultati di apprendimento attesi possono essere sintetizzati come segue:
- Conoscenza e capacità di comprensione: lo studente conoscerà i principi teorici dei principali algoritmi di Machine Learning trattati nel corso, i criteri per la valutazione delle relative performance e le principali tecniche di selezione e validazione dei modelli.
- Capacità di applicare conoscenza e comprensione: lo studente sarà in grado di implementare algoritmi di Machine Learning in ambiente R, in particolare di importare e gestire i dati, addestrare e validare i modelli mediante tecniche quali train-test split e cross-validation, valutarne le performance ed effettuare previsioni su nuovi dati.
- Autonomia di giudizio: lo studente acquisirà la capacità di valutare criticamente e selezionare i modelli e le tecniche più idonee allo specifico problema analizzato, con particolare attenzione al trade-off tra complessità, interpretabilità e accuratezza predittiva, nonché di interpretare correttamente i parametri stimati e le metriche di performance.
- Abilità comunicative: lo studente saprà sintetizzare e motivare le scelte metodologiche effettuate, anche con riferimento al codice R implementato, e argomentare in modo chiaro e rigoroso i risultati quantitativi derivanti dall’applicazione dei modelli.
- Capacità di apprendere: lo studente svilupperà la capacità di affrontare con un crescente grado di autonomia problemi di analisi dei dati, anche attraverso attività in formato hackathon, trasferendo le conoscenze teoriche e le competenze applicative acquisite a nuovi contesti e dataset.
I risultati di apprendimento attesi possono essere sintetizzati come segue:
- Conoscenza e capacità di comprensione: lo studente conoscerà i principi teorici dei principali algoritmi di Machine Learning trattati nel corso, i criteri per la valutazione delle relative performance e le principali tecniche di selezione e validazione dei modelli.
- Capacità di applicare conoscenza e comprensione: lo studente sarà in grado di implementare algoritmi di Machine Learning in ambiente R, in particolare di importare e gestire i dati, addestrare e validare i modelli mediante tecniche quali train-test split e cross-validation, valutarne le performance ed effettuare previsioni su nuovi dati.
- Autonomia di giudizio: lo studente acquisirà la capacità di valutare criticamente e selezionare i modelli e le tecniche più idonee allo specifico problema analizzato, con particolare attenzione al trade-off tra complessità, interpretabilità e accuratezza predittiva, nonché di interpretare correttamente i parametri stimati e le metriche di performance.
- Abilità comunicative: lo studente saprà sintetizzare e motivare le scelte metodologiche effettuate, anche con riferimento al codice R implementato, e argomentare in modo chiaro e rigoroso i risultati quantitativi derivanti dall’applicazione dei modelli.
- Capacità di apprendere: lo studente svilupperà la capacità di affrontare con un crescente grado di autonomia problemi di analisi dei dati, anche attraverso attività in formato hackathon, trasferendo le conoscenze teoriche e le competenze applicative acquisite a nuovi contesti e dataset.
Prerequisiti
Non ci sono prerequisiti specifici. Tuttavia, è consigliabile seguire il corso dopo aver seguito il corso di Statistica.
Metodi didattici
Lezioni teoriche e sessioni di programmazione in R
Verifica Apprendimento
La verifica dell'apprendimento avviene tramite una prova in ambiente R (svolta sul proprio laptop), di durata compresa tra 75 e 90 minuti a seconda della complessità del dataset e dei quesiti proposti, valutata in trentesimi (0 - 30 punti). La prova è suddivisa in due parti:
1) Analisi Dati guidata (max 20 punti complessivi distribuiti tra 4 sezioni, ciascuna articolata in esercizi applicativi e quesiti di interpretazione e/o teorico-metodologici): lo studente lavora su un dataset fornito dal docente per svolgere un'analisi guidata che combina l'applicazione di modelli, l'interpretazione dei risultati e la risposta a quesiti metodologici e teorici.
2) Data Hackathon (max 10 punti): lo studente affronta un problema predittivo individuale su dati forniti dal docente, sviluppando in autonomia il processo di analisi e modellizzazione. La valutazione terrà conto della qualità metodologica dell’analisi (max 4 punti), delle performance predittive ottenute rispetto a valori di riferimento definiti (max 3 punti) e della correttezza e riproducibilità del codice R implementato (max 3 punti).
Soglia per il superamento e criteri di valutazione:
- Per superare l’esame occorre un punteggio finale non inferiore a 18/30, ottenuto dalla somma dei punteggi delle due parti.
- Il punteggio finale tiene conto della conoscenza delle basi teoriche dei modelli, dell’appropriatezza delle scelte metodologiche, della capacità di interpretare correttamente i risultati ottenuti, nonché della chiarezza e riproducibilità del codice.
1) Analisi Dati guidata (max 20 punti complessivi distribuiti tra 4 sezioni, ciascuna articolata in esercizi applicativi e quesiti di interpretazione e/o teorico-metodologici): lo studente lavora su un dataset fornito dal docente per svolgere un'analisi guidata che combina l'applicazione di modelli, l'interpretazione dei risultati e la risposta a quesiti metodologici e teorici.
2) Data Hackathon (max 10 punti): lo studente affronta un problema predittivo individuale su dati forniti dal docente, sviluppando in autonomia il processo di analisi e modellizzazione. La valutazione terrà conto della qualità metodologica dell’analisi (max 4 punti), delle performance predittive ottenute rispetto a valori di riferimento definiti (max 3 punti) e della correttezza e riproducibilità del codice R implementato (max 3 punti).
Soglia per il superamento e criteri di valutazione:
- Per superare l’esame occorre un punteggio finale non inferiore a 18/30, ottenuto dalla somma dei punteggi delle due parti.
- Il punteggio finale tiene conto della conoscenza delle basi teoriche dei modelli, dell’appropriatezza delle scelte metodologiche, della capacità di interpretare correttamente i risultati ottenuti, nonché della chiarezza e riproducibilità del codice.
Testi
James, G., Witten, D., Hastie, T., & Tibshirani, R. (2021). An Introduction to Statistical Learning: with Applications in R (2nd ed.). Springer. ISBN 978-1-0716-1418-1.
Contenuti
- Analisi esplorativa univariata
- Analisi esplorativa multivariata
- Modello lineare semplice
- Modello lineare multiplo
- Analisi dei residui
- Confronto fra modelli e scelta del modello migliore
- Alberi decisionali
- Cluster analysis
I metodi presentati verranno implementati con l'ausilio del linguaggio di programmazione R.
- Analisi esplorativa multivariata
- Modello lineare semplice
- Modello lineare multiplo
- Analisi dei residui
- Confronto fra modelli e scelta del modello migliore
- Alberi decisionali
- Cluster analysis
I metodi presentati verranno implementati con l'ausilio del linguaggio di programmazione R.
Lingua Insegnamento
INGLESE
Corsi
Corsi
ECONOMIA
Laurea
3 anni
No Results Found
Persone
Persone
No Results Found