Deep learning e apprendimento per rinforzo: differenze, studi ed esempi concreti
Il deep learning utilizza reti neurali con più livelli per apprendere rappresentazioni dei dati. L’apprendimento per rinforzo insegna a un agente a scegliere azioni in funzione delle ricompense ottenute. Possono lavorare insieme: quando il rinforzo usa reti neurali profonde si parla di deep reinforcement learning. Questa distinzione emerge dalla rassegna di LeCun, Bengio e Hinton sul deep learning e dal lavoro di Mnih e colleghi sul deep reinforcement learning.
La domanda «È meglio il deep learning o l’apprendimento per rinforzo?» contiene quindi un piccolo equivoco. Mette sullo stesso piano il tipo di modello e il modo in cui lo addestriamo. È un po’ come chiedere se per imparare a cucinare sia meglio avere una cucina attrezzata oppure fare pratica: le due cose possono convivere.
Per capire la differenza, partiamo da una fabbrica. Un sistema guarda la fotografia di un componente e segnala un difetto. Un altro deve imparare come muovere un braccio robotico per afferrare quel componente senza danneggiarlo. Sono due problemi diversi. E aiutano a mettere ordine nelle sigle.
Che cos’è il deep learning
Il deep learning, o apprendimento profondo, è una famiglia di metodi di machine learning basati su reti neurali articolate in più livelli. Durante l’addestramento il sistema modifica i propri parametri per apprendere rappresentazioni utili al compito.
Nel riconoscimento delle immagini, per esempio, queste rappresentazioni possono combinare caratteristiche visive semplici in strutture più complesse. “Profondo” si riferisce alla struttura del modello: non significa che la macchina rifletta profondamente sulle cose.
Il riferimento scientifico è la rassegna “Deep learning”, pubblicata nel 2015 su Nature da Yann LeCun, Yoshua Bengio e Geoffrey Hinton. Gli autori descrivono i progressi ottenuti, tra gli altri ambiti, nel riconoscimento delle immagini e del parlato. Scheda e abstract dello studio su PubMed.
Esempio illustrativo: riconoscere un componente difettoso
Immaginiamo di raccogliere fotografie di pezzi integri e difettosi, ciascuna con l’etichetta corretta. Addestriamo una rete a distinguere le due categorie e la valutiamo su fotografie che non ha visto durante l’addestramento.
In questo esempio combiniamo deep learning e apprendimento supervisionato. Il primo indica la famiglia di modelli; il secondo indica che forniamo esempi accompagnati dalla risposta desiderata.
Il sistema deve riconoscere una condizione. Non gli abbiamo ancora chiesto di scegliere una sequenza di azioni per modificarla.
Che cos’è l’apprendimento per rinforzo
L’apprendimento per rinforzo, in inglese reinforcement learning o RL, affronta il problema di imparare un comportamento attraverso azioni e conseguenze. L’obiettivo è massimizzare la ricompensa cumulativa attesa, considerando anche gli effetti futuri delle decisioni.
Gli elementi essenziali sono:
- Agente: il sistema che prende decisioni.
- Ambiente: ciò con cui interagisce, anche in simulazione.
- Osservazione: l’informazione disponibile per decidere.
- Azione: ciò che l’agente può fare.
- Ricompensa: il segnale numerico che valuta l’esito.
- Politica: la strategia con cui sceglie le azioni.
Un’introduzione accessibile è il quadro del reinforcement learning di Hugging Face.
Esempio illustrativo: insegnare a un robot ad afferrare un oggetto
Immaginiamo ora un braccio robotico in un simulatore. Può muoversi, aprire la pinza e chiuderla. Assegniamo una ricompensa quando afferra l’oggetto; penalizziamo cadute e collisioni.
La strategia deve tenere conto delle conseguenze: avvicinarsi velocemente può far risparmiare tempo ma aumentare il rischio di urto. Una buona azione iniziale può essere utile soltanto perché rende possibile una presa riuscita dopo diversi passaggi.
Questo è un esempio didattico, non il resoconto di un’implementazione specifica. Serve a capire perché una decisione possa essere valutata attraverso il risultato di un’intera sequenza.
Deep learning e apprendimento per rinforzo: tabella delle differenze
| Aspetto | Deep learning | Apprendimento per rinforzo |
|---|---|---|
| Che cosa descrive | Una famiglia di modelli basati su reti neurali profonde | Un paradigma di apprendimento orientato ad azioni e ricompense |
| Domanda centrale | Come rappresentare ed elaborare i dati? | Come scegliere azioni che producano buoni risultati nel tempo? |
| Rete neurale profonda | È l’elemento caratterizzante | È possibile, ma non obbligatoria |
| Segnale di addestramento | Dipende dal metodo con cui si addestra la rete | Comprende le ricompense e le conseguenze delle azioni |
| Esempio guida | Riconoscere un difetto in una fotografia | Imparare una strategia di presa |
| Relazione tra i due | Può fornire il modello usato dall’agente | Può addestrare un agente basato su deep learning |
La tabella sintetizza la distinzione illustrata dalla rassegna sul deep learning e dall’introduzione di Hugging Face al deep RL.
Quando si incontrano: il deep reinforcement learning
Un agente può dover prendere decisioni partendo da input complessi, come le immagini di un videogioco. Le reti neurali profonde consentono di elaborare questi input e di stimare quali azioni convengano.
È il punto d’incontro tra i due approcci: una rete neurale entra nel sistema che impara a ottenere ricompense. Vediamo tre casi documentati, con il risultato e il limite da tenere presente.
1. Atari: imparare a giocare osservando lo schermo
Nel 2015 Volodymyr Mnih e colleghi pubblicarono su Nature “Human-level control through deep reinforcement learning”. Il sistema, chiamato deep Q-network o DQN, apprendeva strategie per videogiochi Atari utilizzando immagini dello schermo e segnali di ricompensa.
Il valore del lavoro sta nell’unire percezione e azione: elaborare i pixel diventava parte dell’apprendimento di una strategia di gioco. I risultati variarono tra i giochi; non dimostravano una capacità universale di risolvere qualunque problema. Studio originale sul DQN.
2. AlphaGo Zero: migliorare giocando contro sé stesso
Nel 2017 David Silver e colleghi presentarono AlphaGo Zero, un sistema che imparava il Go mediante partite contro sé stesso, senza usare esempi di partite umane nell’addestramento descritto. Combinava rete neurale, ricerca delle mosse e reinforcement learning.
Il lavoro “Mastering the game of Go without human knowledge” documentò una vittoria per 100 a 0 contro la precedente versione di AlphaGo indicata nello studio. È un risultato impressionante, ma relativo a un gioco con regole ed esito definiti. Paper su AlphaGo Zero.
“Senza conoscenza umana” va letto con attenzione: gli esseri umani avevano comunque progettato il sistema e fornito le regole del gioco. Inoltre, vincere a Go non equivale a saper gestire una riunione condominiale. Per quella, il segnale di ricompensa è decisamente più ambiguo.
3. Fusione: controllare il plasma in un tokamak
Nel 2022 Jonas Degrave e colleghi pubblicarono su Nature “Magnetic control of tokamak plasmas through deep reinforcement learning”. Il gruppo sviluppò un controllore basato su RL e ne verificò sperimentalmente il funzionamento sul tokamak TCV, in collaborazione con lo Swiss Plasma Center dell’EPFL.
Il sistema imparava a comandare il controllo magnetico del plasma. Qui il rinforzo affrontava un problema fisico concreto, oltre i videogiochi. Il risultato riguardava il controllo del plasma: non dimostrava che l’AI avesse risolto la produzione commerciale di energia da fusione. Studio scientifico.
La spiegazione del progetto pubblicata da Google DeepMind descrive anche il passaggio dall’addestramento in simulazione alla verifica sul dispositivo reale.
E i modelli linguistici? Il caso del feedback umano
Un riferimento utile è “Training language models to follow instructions with human feedback”, di Long Ouyang e colleghi, pubblicato nel 2022. Il lavoro su InstructGPT descrive un percorso in cui un modello linguistico viene affinato prima con esempi supervisionati e poi con apprendimento per rinforzo basato sul feedback umano, o RLHF.
Le persone confrontano risposte e indicano quelle preferite. Questi giudizi servono ad addestrare un modello di ricompensa, poi utilizzato per orientare l’ottimizzazione del modello linguistico.
Nelle valutazioni descritte, le risposte di InstructGPT erano preferite a quelle del modello di partenza. Gli autori segnalavano però che il sistema continuava a commettere errori. Una risposta apprezzata non è automaticamente una risposta vera. Paper su InstructGPT e RLHF.
Il caso mostra come supervisionato, deep learning e rinforzo possano comparire nello stesso percorso. Non è una descrizione esaustiva dell’addestramento di ogni chatbot attuale, né significa che ogni correzione scritta in chat aggiorni immediatamente i parametri del modello.
Tre esempi aziendali per orientarsi
Le situazioni seguenti sono ipotesi illustrative, utili per impostare un progetto. Non sono casi aziendali verificati né indicazioni che il reinforcement learning sia necessariamente la soluzione migliore.
| Situazione | Problema da risolvere | Domanda utile prima di scegliere la tecnologia |
|---|---|---|
| Controllo qualità | Individuare difetti nelle immagini dei prodotti | Abbiamo immagini rappresentative e un modo affidabile per misurare gli errori? |
| Magazzino | Scegliere una sequenza di movimenti o assegnazioni | Possiamo confrontare le strategie in simulazione e misurare ritardi, collisioni e consumi? |
| Assistenza clienti | Migliorare le risposte suggerite agli operatori | Chi valuta la qualità e come distinguiamo cortesia, correttezza e risoluzione del problema? |
Il mio consiglio è partire da queste domande prima di chiedere al fornitore quale algoritmo utilizza. Per il magazzino, per esempio, vorrei vedere un confronto con una soluzione di ottimizzazione tradizionale. Per l’assistenza clienti chiederei esempi degli errori residui, oltre a quelli delle risposte riuscite.
La ricompensa sbagliata: un problema molto umano
Facciamo un esperimento mentale. Progettiamo un sistema per l’assistenza clienti e lo premiamo soltanto per il numero di ticket chiusi. Che cosa impedisce che favorisca chiusure premature? Se premiamo esclusivamente la velocità di un robot, dove abbiamo rappresentato la sicurezza?
Sono esempi ipotetici di un errore di progettazione: scegliere una misura comoda e scambiarla per l’obiettivo completo. Il reinforcement learning rende questa domanda particolarmente visibile, perché richiede di definire che cosa viene ricompensato.
Per un progetto concreto proporrei tre controlli:
- Scrivere l’obiettivo in linguaggio ordinario. Che cosa dovrebbe migliorare per clienti, operatori o azienda?
- Cercare il modo più furbo di ottenere il punteggio facendo un pessimo lavoro. È un buon esercizio anche senza AI.
- Definire vincoli e verifiche indipendenti. Il risultato va valutato oltre la sola metrica usata per addestrare il sistema.
L’algoritmo può essere sofisticato. L’obiettivo può restare scritto male.
Domande frequenti
Il reinforcement learning richiede sempre il deep learning?
No. I due concetti sono distinti. Quando l’agente utilizza reti neurali profonde, la combinazione prende il nome di deep reinforcement learning. Per approfondire, si può partire dal corso introduttivo di Hugging Face.
AlphaGo Zero è un esempio di entrambi?
Sì. Il lavoro combina reti neurali profonde e apprendimento per rinforzo, insieme alla ricerca delle mosse. È proprio per questo che contrapporre rigidamente i due termini porta fuori strada. Fonte: Silver e colleghi, 2017.
Che cosa dovrebbe chiedere un’azienda prima di avviare un progetto?
Suggerisco di chiedere quale problema viene risolto, come si misura il successo, quali dati servono, quanto costano gli errori e rispetto a quale alternativa si dimostra un miglioramento. “Usiamo il deep reinforcement learning” è l’inizio della spiegazione, non il risultato del progetto.
Vuoi capire come applicare questi concetti al lavoro, distinguendo opportunità concrete e promesse commerciali? Scrivimi per un percorso di formazione o consulenza sull’intelligenza artificiale.
Scrivimi per organizzare un evento o un corso sull’intelligenza artificiale generativa
Mandami un WhatsApp al 339.6325418 per organizzare un corso o una conferenza sull’A.I. generativa.







Lascia un Commento
Vuoi partecipare alla discussione?Sentitevi liberi di contribuire!