Come si allena un modello AI?

,
Gianluigi Bonanomi allenatore spiega come si allena un modello AI con la metafora del calcio

Come si allena un modello AI? Si parte da dati ed esempi, si misura l’errore e si aggiornano i parametri per migliorare il risultato. Nei modelli linguistici generativi, al pretraining possono seguire allenamenti mirati e feedback. Una metafora calcistica aiuta a distinguere queste fasi dalle istruzioni che scriviamo in un prompt.

Per capire come si allena un’intelligenza artificiale, proviamo a entrare in un campo da calcio. Ci sono esercizi, errori da correggere, un allenatore e una partita che dirà se tutto quel lavoro è servito.

La lavagna tattica, però, non basta. Posso disegnare il più bel 4-3-3 della storia: se i giocatori non sanno controllare il pallone, resterà un magnifico progetto d’arredamento dello spogliatoio.

Con l’AI possiamo distinguere in modo simile la preparazione delle capacità di base, gli allenamenti mirati e le istruzioni per affrontare un compito. Qui parlerò soprattutto dei modelli linguistici generativi, quelli che producono testo. La metafora serve a orientarsi: un modello non ha muscoli, intenzioni o voglia di vincere il derby.

1. I dati: il materiale della scuola calcio

Immaginate di preparare una squadra facendole vedere soltanto rigori. Quando arriveranno un calcio d’angolo o un contropiede, avrete qualche problema.

Questa immagine aiuta a capire perché conta ciò su cui un modello viene allenato. I dati sono gli esempi da cui ricava regolarità. Per un modello linguistico possono essere testi di natura diversa: il lavoro iniziale su un ampio insieme di testi si chiama pretraining. È una delle basi del percorso descritto nella ricerca Language Models are Few-Shot Learners.

Nella nostra scuola calcio, quindi, i dati sono il repertorio degli esercizi e delle situazioni di gioco. Se quel repertorio è limitato, dobbiamo stare attenti a ciò che pretendiamo dalla squadra.

Pretraining: avatar di Gianluigi Bonanomi insegna i fondamentali a robot calciatori
Pretraining: la scuola calcio.

2. Il pretraining: imparare i fondamentali

Prima degli schemi del mister vengono stop, passaggi e controllo del pallone. Nel caso dei modelli linguistici autoregressivi, un esercizio fondamentale consiste nel prevedere il token successivo, cioè la prossima unità di testo, che può essere una parola o un suo frammento.

Immaginiamo la frase: «L’attaccante tira e segna un…». “Gol” è una continuazione plausibile. Il modello assegna probabilità alle possibili continuazioni: durante l’allenamento queste previsioni vengono confrontate con il testo effettivo.

Ripetere questo esercizio su molti esempi permette di sviluppare capacità linguistiche utilizzabili in compiti diversi. Il lavoro su GPT-3 mostra proprio il rapporto fra pretraining e capacità di affrontare compiti presentati attraverso il testo. Prevedere il seguito di una frase, però, non equivale a verificarne la verità.

La loss misura l’errore e l’ottimizzatore aggiorna i parametri: allenamento con Bonanomi
L’errore guida l’allenamento.

3. Come si allena un modello AI: tiro, errore, correzione

Un giocatore calcia fuori. L’allenatore osserva il gesto, suggerisce una correzione e gli fa riprovare. Nell’AI la correzione è matematica.

Il modello produce una previsione. Una funzione, chiamata loss, misura quanto quella previsione sia lontana dall’obiettivo dell’esercizio. Un algoritmo di ottimizzazione aggiorna i parametri, i valori numerici che regolano il comportamento del modello, cercando di ridurre la loss. Il ciclo si ripete su molti esempi. La guida di Google sulla discesa del gradiente illustra questo meccanismo di correzione progressiva.

La loss somiglia al criterio con cui il mister valuta l’esercizio; l’ottimizzatore al meccanismo con cui vengono applicati gli aggiustamenti. Sono ruoli diversi. Ecco il cuore dell’addestramento: cambiano i parametri del modello.

Fine-tuning e feedback spiegati da Bonanomi con una lavagna tattica
Fine-tuning e feedback.

4. Il fine-tuning: imparare il gioco del mister

Ora la squadra sa giocare. Vogliamo però che impari un certo stile: costruzione dal basso, passaggi rapidi, attenzione alle consegne.

Il fine-tuning supervisionato può essere visto come un allenamento mirato su esempi del comportamento desiderato. Per un assistente, questi esempi possono mostrare come rispondere a una richiesta, organizzare una spiegazione o rispettare un formato.

La ricerca su InstructGPT descrive un percorso che parte da dimostrazioni scritte da persone per migliorare la capacità di seguire le istruzioni. Nella metafora: il mister mostra come vorrebbe fosse eseguita l’azione.

5. Il feedback: scegliere le azioni migliori

Due giocatori arrivano davanti alla porta. Uno tenta un tiro impossibile, l’altro passa al compagno libero. Il mister valuta quale scelta preferisce.

Anche nell’addestramento di un assistente si possono confrontare risposte alternative. Nel percorso di RLHF, apprendimento per rinforzo dal feedback umano, descritto nello studio su InstructGPT, le preferenze raccolte servono ad allenare un modello di ricompensa, poi usato per guidare ulteriori aggiornamenti dell’assistente.

Non esiste un’unica ricetta. La Direct Preference Optimization, o DPO, utilizza le preferenze con un metodo diverso, evitando di addestrare separatamente quel modello di ricompensa. È descritta nella ricerca di Rafailov e colleghi.

La domanda da allenatore diventa interessante: che cosa stiamo premiando? Se applaudissimo soltanto le giocate spettacolari, potremmo ritrovarci una squadra bravissima a fare colpi di tacco e pochissimo interessata al risultato.

Bonanomi osserva una partita nuova: test del modello e differenza tra prompt e addestramento
Il test è una partita nuova.

6. La verifica: giocare una partita nuova

Segnare sempre nello stesso esercizio, contro lo stesso portiere, non basta. Serve una prova in condizioni che non siano già state memorizzate.

Per valutare un modello si separano i dati di training, usati per allenarlo, quelli di validazione, utili a orientare le scelte di sviluppo, e quelli di test, riservati alla valutazione finale. Google sottolinea che i test devono usare esempi nuovi, senza duplicati del training, e rappresentativi degli impieghi reali. Fonte: Dividing the original dataset.

Nella metafora calcistica sono allenamenti, amichevoli per aggiustare la preparazione e prova finale. L’overfitting è il rischio di diventare troppo bravi sugli esercizi già incontrati e poco efficaci sulle situazioni nuove. Una squadra campione dei coni, insomma.

7. E il prompt? Sono le istruzioni dalla panchina

«Allarga il gioco sulla destra». È una consegna per l’azione in corso. Non equivale a rifare tutta la preparazione atletica.

Un prompt funziona, nella nostra metafora, come quella consegna. Può includere obiettivi, vincoli ed esempi. Il modello li usa nel contesto della richiesta: questo, di per sé, non aggiorna i suoi parametri. Il lavoro su GPT-3 distingue esplicitamente l’uso di esempi nel testo dall’aggiornamento dei parametri.

Perciò, quando diciamo «sto allenando l’AI» perché le stiamo scrivendo istruzioni, spesso stiamo usando un’espressione imprecisa. Possiamo guidarla nella conversazione senza aver avviato un vero processo di addestramento.

Per approfondire un’altra distinzione importante, ho preparato anche una guida alla memoria di ChatGPT: personalizzazione delle risposte e addestramento del modello vanno tenuti separati.

La metafora in una tabella

Nel calcio Nel modello AI
Repertorio di esercizi Dati di addestramento
Scuola calcio e fondamentali Pretraining
Criterio per valutare l’errore Funzione di loss
Aggiustamenti durante la preparazione Aggiornamento dei parametri
Allenamenti mirati Fine-tuning
Valutazione delle scelte di gioco Feedback e preferenze
Partita di verifica Test su esempi nuovi
Consegna dalla panchina Prompt

Un esercizio da portare in aula

Propongo di prendere un compito concreto, per esempio rispondere a un reclamo, e scrivere prima una richiesta generica. Poi aggiungiamo destinatario, obiettivo, limiti e un esempio di risposta ben costruita. Infine confrontiamo i risultati.

Abbiamo cambiato l’allenamento del modello? No: abbiamo migliorato le consegne. È un piccolo esperimento per distinguere ciò che il modello ha imparato durante la preparazione da ciò che gli chiediamo di fare adesso.

La prossima volta che un’AI sbaglia un passaggio, proviamo quindi a farci tre domande: le capacità sono adeguate al compito? Le istruzioni erano chiare? Abbiamo verificato il risultato? Dalla panchina si vede meglio la partita quando si sa che cosa osservare.

Scrivimi per organizzare un evento o un corso sull’intelligenza artificiale generativa

Mandami un WhatsApp al 339.6325418 per organizzare un corso o una conferenza sull’A.I. generativa.

Inviaci email

0 commenti

Lascia un Commento

Vuoi partecipare alla discussione?
Sentitevi liberi di contribuire!

Lascia un commento