Come si allena un modello AI?
Come si allena un modello AI? Si parte da dati ed esempi, si misura l’errore e si aggiornano i parametri per migliorare il risultato. Nei modelli linguistici generativi, al pretraining possono seguire allenamenti mirati e feedback. Una metafora calcistica aiuta a distinguere queste fasi dalle istruzioni che scriviamo in un prompt.
Per capire come si allena un’intelligenza artificiale, proviamo a entrare in un campo da calcio. Ci sono esercizi, errori da correggere, un allenatore e una partita che dirà se tutto quel lavoro è servito.
La lavagna tattica, però, non basta. Posso disegnare il più bel 4-3-3 della storia: se i giocatori non sanno controllare il pallone, resterà un magnifico progetto d’arredamento dello spogliatoio.
Con l’AI possiamo distinguere in modo simile la preparazione delle capacità di base, gli allenamenti mirati e le istruzioni per affrontare un compito. Qui parlerò soprattutto dei modelli linguistici generativi, quelli che producono testo. La metafora serve a orientarsi: un modello non ha muscoli, intenzioni o voglia di vincere il derby.
1. I dati: il materiale della scuola calcio
Immaginate di preparare una squadra facendole vedere soltanto rigori. Quando arriveranno un calcio d’angolo o un contropiede, avrete qualche problema.
Questa immagine aiuta a capire perché conta ciò su cui un modello viene allenato. I dati sono gli esempi da cui ricava regolarità. Per un modello linguistico possono essere testi di natura diversa: il lavoro iniziale su un ampio insieme di testi si chiama pretraining. È una delle basi del percorso descritto nella ricerca Language Models are Few-Shot Learners.
Nella nostra scuola calcio, quindi, i dati sono il repertorio degli esercizi e delle situazioni di gioco. Se quel repertorio è limitato, dobbiamo stare attenti a ciò che pretendiamo dalla squadra.

2. Il pretraining: imparare i fondamentali
Prima degli schemi del mister vengono stop, passaggi e controllo del pallone. Nel caso dei modelli linguistici autoregressivi, un esercizio fondamentale consiste nel prevedere il token successivo, cioè la prossima unità di testo, che può essere una parola o un suo frammento.
Immaginiamo la frase: «L’attaccante tira e segna un…». “Gol” è una continuazione plausibile. Il modello assegna probabilità alle possibili continuazioni: durante l’allenamento queste previsioni vengono confrontate con il testo effettivo.
Ripetere questo esercizio su molti esempi permette di sviluppare capacità linguistiche utilizzabili in compiti diversi. Il lavoro su GPT-3 mostra proprio il rapporto fra pretraining e capacità di affrontare compiti presentati attraverso il testo. Prevedere il seguito di una frase, però, non equivale a verificarne la verità.

3. Come si allena un modello AI: tiro, errore, correzione
Un giocatore calcia fuori. L’allenatore osserva il gesto, suggerisce una correzione e gli fa riprovare. Nell’AI la correzione è matematica.
Il modello produce una previsione. Una funzione, chiamata loss, misura quanto quella previsione sia lontana dall’obiettivo dell’esercizio. Un algoritmo di ottimizzazione aggiorna i parametri, i valori numerici che regolano il comportamento del modello, cercando di ridurre la loss. Il ciclo si ripete su molti esempi. La guida di Google sulla discesa del gradiente illustra questo meccanismo di correzione progressiva.
La loss somiglia al criterio con cui il mister valuta l’esercizio; l’ottimizzatore al meccanismo con cui vengono applicati gli aggiustamenti. Sono ruoli diversi. Ecco il cuore dell’addestramento: cambiano i parametri del modello.

4. Il fine-tuning: imparare il gioco del mister
Ora la squadra sa giocare. Vogliamo però che impari un certo stile: costruzione dal basso, passaggi rapidi, attenzione alle consegne.
Il fine-tuning supervisionato può essere visto come un allenamento mirato su esempi del comportamento desiderato. Per un assistente, questi esempi possono mostrare come rispondere a una richiesta, organizzare una spiegazione o rispettare un formato.
La ricerca su InstructGPT descrive un percorso che parte da dimostrazioni scritte da persone per migliorare la capacità di seguire le istruzioni. Nella metafora: il mister mostra come vorrebbe fosse eseguita l’azione.
5. Il feedback: scegliere le azioni migliori
Due giocatori arrivano davanti alla porta. Uno tenta un tiro impossibile, l’altro passa al compagno libero. Il mister valuta quale scelta preferisce.
Anche nell’addestramento di un assistente si possono confrontare risposte alternative. Nel percorso di RLHF, apprendimento per rinforzo dal feedback umano, descritto nello studio su InstructGPT, le preferenze raccolte servono ad allenare un modello di ricompensa, poi usato per guidare ulteriori aggiornamenti dell’assistente.
Non esiste un’unica ricetta. La Direct Preference Optimization, o DPO, utilizza le preferenze con un metodo diverso, evitando di addestrare separatamente quel modello di ricompensa. È descritta nella ricerca di Rafailov e colleghi.
La domanda da allenatore diventa interessante: che cosa stiamo premiando? Se applaudissimo soltanto le giocate spettacolari, potremmo ritrovarci una squadra bravissima a fare colpi di tacco e pochissimo interessata al risultato.

6. La verifica: giocare una partita nuova
Segnare sempre nello stesso esercizio, contro lo stesso portiere, non basta. Serve una prova in condizioni che non siano già state memorizzate.
Per valutare un modello si separano i dati di training, usati per allenarlo, quelli di validazione, utili a orientare le scelte di sviluppo, e quelli di test, riservati alla valutazione finale. Google sottolinea che i test devono usare esempi nuovi, senza duplicati del training, e rappresentativi degli impieghi reali. Fonte: Dividing the original dataset.
Nella metafora calcistica sono allenamenti, amichevoli per aggiustare la preparazione e prova finale. L’overfitting è il rischio di diventare troppo bravi sugli esercizi già incontrati e poco efficaci sulle situazioni nuove. Una squadra campione dei coni, insomma.
7. E il prompt? Sono le istruzioni dalla panchina
«Allarga il gioco sulla destra». È una consegna per l’azione in corso. Non equivale a rifare tutta la preparazione atletica.
Un prompt funziona, nella nostra metafora, come quella consegna. Può includere obiettivi, vincoli ed esempi. Il modello li usa nel contesto della richiesta: questo, di per sé, non aggiorna i suoi parametri. Il lavoro su GPT-3 distingue esplicitamente l’uso di esempi nel testo dall’aggiornamento dei parametri.
Perciò, quando diciamo «sto allenando l’AI» perché le stiamo scrivendo istruzioni, spesso stiamo usando un’espressione imprecisa. Possiamo guidarla nella conversazione senza aver avviato un vero processo di addestramento.
Per approfondire un’altra distinzione importante, ho preparato anche una guida alla memoria di ChatGPT: personalizzazione delle risposte e addestramento del modello vanno tenuti separati.
La metafora in una tabella
| Nel calcio | Nel modello AI |
|---|---|
| Repertorio di esercizi | Dati di addestramento |
| Scuola calcio e fondamentali | Pretraining |
| Criterio per valutare l’errore | Funzione di loss |
| Aggiustamenti durante la preparazione | Aggiornamento dei parametri |
| Allenamenti mirati | Fine-tuning |
| Valutazione delle scelte di gioco | Feedback e preferenze |
| Partita di verifica | Test su esempi nuovi |
| Consegna dalla panchina | Prompt |
Un esercizio da portare in aula
Propongo di prendere un compito concreto, per esempio rispondere a un reclamo, e scrivere prima una richiesta generica. Poi aggiungiamo destinatario, obiettivo, limiti e un esempio di risposta ben costruita. Infine confrontiamo i risultati.
Abbiamo cambiato l’allenamento del modello? No: abbiamo migliorato le consegne. È un piccolo esperimento per distinguere ciò che il modello ha imparato durante la preparazione da ciò che gli chiediamo di fare adesso.
La prossima volta che un’AI sbaglia un passaggio, proviamo quindi a farci tre domande: le capacità sono adeguate al compito? Le istruzioni erano chiare? Abbiamo verificato il risultato? Dalla panchina si vede meglio la partita quando si sa che cosa osservare.
Scrivimi per organizzare un evento o un corso sull’intelligenza artificiale generativa
Mandami un WhatsApp al 339.6325418 per organizzare un corso o una conferenza sull’A.I. generativa.










Lascia un Commento
Vuoi partecipare alla discussione?Sentitevi liberi di contribuire!