Cosa sono i base model (foundation model): la guida completa

Immagine realizzata con IA
Le immagini presenti nel post possono essere realizzate o elaborate con strumenti di Intelligenza Artificiale. Questa scelta nasce anche dalla necessità di prevenire le continue contestazioni e richieste economiche improprie che ricevo relative a fotografie utilizzate che sono sempre state acquistate con regolare licenza.
Contenuti dell'articolo

Se hai mai sentito parlare di GPT, Claude, Gemini o Llama, sei già entrato in contatto con i base model, chiamati anche foundation model.
Sono i modelli di partenza su cui vengono costruiti quasi tutti gli strumenti di intelligenza artificiale che usiamo ogni giorno.

In questa lezione vediamo cosa sono, come funzionano e perché sono diventati il punto di partenza di tutto il resto.

Cos’è un base model, in parole semplici

Un base model è un modello di intelligenza artificiale addestrato su una quantità enorme e generica di dati, senza essere stato progettato per un compito specifico.
Non nasce per tradurre, non nasce per scrivere email, non nasce per rispondere alle domande di un cliente.
Nasce per imparare i pattern generali del linguaggio, delle immagini o di altri tipi di dato.

Il nome “foundation model“, cioè modello di fondazione, dice esattamente questo: è la base, il fondamento su cui poi si costruisce altro.

Immagina di dover preparare un cuoco.
Invece di insegnargli subito una sola ricetta, gli fai studiare tutta la cucina: ingredienti, tecniche, abbinamenti, culture diverse. Solo dopo lo specializzi sulla pasticceria o sulla cucina giapponese.
Il base model è quel cuoco appena uscito dalla scuola: sa tantissimo in generale, ma non è ancora specializzato in niente.

Perché si chiamano “foundation”

Il termine è stato reso popolare nel 2021 dal gruppo di ricerca di Stanford, in un famoso report intitolato proprio “On the Opportunities and Risks of Foundation Models“.
L’idea era semplice: questi modelli non sono applicazioni finite, sono infrastrutture. Sono la base su cui altri costruiscono, esattamente come le fondamenta di un palazzo.

Da qui deriva una conseguenza importante: quando un base model cambia, cambia tutto quello che ci sta sopra. Migliaia di prodotti diversi possono condividere lo stesso modello di partenza, adattato in modi diversi.

Base model e modello specializzato: la differenza

Un modello specializzato è progettato per un compito preciso: riconoscere tumori nelle radiografie, tradurre dall’italiano al tedesco, stimare il prezzo di una casa. Lo si addestra su dati specifici e spesso funziona molto bene solo lì.

Un base model, invece, è generalista e adattabile. È stato addestrato su testi, codice, immagini e molto altro e da questa esposizione ampia ha sviluppato una comprensione trasversale del mondo. La differenza chiave è che un modello specializzato fa una cosa sola, mentre un base model può essere riadattato a mille compiti diversi senza ripartire da zero.

Un esempio pratico

Pensa a un modello addestrato per riconoscere le email di spam.

Se domani vuoi che riconosca anche le recensioni false, devi quasi ricominciare da capo. Con un base model, invece, parti da un modello che “sa leggere” e gli insegni solo la nuova distinzione. Molto più veloce, e con molti meno dati.

Confronto tra un base model, che si dirama verso molti compiti, e un modello specializzato, che punta a un solo compito

Cosa sa fare (e cosa non sa fare) un base model

Un base model grezzo è bravissimo a completare quello che gli dai in input. Se scrivi l’inizio di una frase, lui continua. Se gli mostri una sequenza di parole, lui prevede quella successiva. Questo è il suo mestiere di base.

Quello che non fa, di norma, è seguire istruzioni o rispondere in modo utile. Un base model puro, se gli chiedi “qual è la capitale della Francia?”, potrebbe non rispondere “Parigi”: potrebbe continuare il testo con altre domande simili, perché ha imparato che nei testi le domande spesso si susseguono. È un comportamento che sorprende molti, ma è normalissimo.

Proprio per questo, tra il base model e lo strumento che usi tu c’è quasi sempre un passaggio intermedio di post-training: istruzioni, esempi di risposte corrette e feedback umano. È lì che il modello impara a comportarsi come un assistente.

Come nasce un base model

La nascita di un base model si chiama pre-training ed è la fase più costosa di tutto il processo. Il modello viene esposto a enormi quantità di dati e impara a prevedere cosa viene dopo. Milioni di miliardi di parole, immagini e righe di codice, ripetute per settimane o mesi su migliaia di schede grafiche.

Tre ingredienti contano più di tutti:

  • Dati: tanti, vari e di buona qualità. Dati scadenti producono un modello scadente.
  • Parametri: la “dimensione” del modello, cioè quanti valori numerici interni riesce a regolare durante l’apprendimento.
  • Calcolo: la potenza di elaborazione necessaria per far girare tutto questo.

Aumentare insieme questi tre elementi porta a miglioramenti sorprendentemente prevedibili, un fenomeno noto come scaling laws.

Scaling laws e capacità emergenti

Le scaling laws sono uno dei risultati più affascinanti dell’IA moderna. In parole povere: più grande è il modello, più dati riceve e più calcolo ha a disposizione, meglio performa e il miglioramento segue curve abbastanza regolari.
Non serve indovinare, si può in buona parte prevedere.

Accanto a questo c’è il concetto di capacità emergenti: abilità che non erano presenti nei modelli piccoli e che compaiono all’improvviso superata una certa soglia di scala.
Fare calcoli a mente, tradurre senza esempi, seguire ragionamenti a più passaggi.
Nessuno le ha programmate esplicitamente: sono emerse dall’addestramento su larga scala.

Esempi concreti di base model

Alcuni nomi che probabilmente hai già sentito:

  • GPT di OpenAI: la famiglia di modelli chiusi alla base di ChatGPT.
  • Claude di Anthropic: modelli chiusi generalisti orientati al testo e al ragionamento.
  • Gemini di Google: modelli chiusi multimodali, cioè capaci di gestire testo, immagini e altro.
  • Llama di Meta: modelli con pesi aperti, molto usati per sperimentare e adattare.
  • Qwen di AliBaba: modelli generalisti multimodali aperti, usatissimi per fine tuning o distillazione.
  • Mistral e DeepSeek: modelli efficienti, spesso con licenze aperte, ottimi per progetti su misura.

Anche i modelli per le immagini e per l’audio funzionano allo stesso modo: c’è un base model che impara i pattern generali di quel tipo di dato, e poi applicazioni specifiche che lo sfruttano.

Dal base model al modello che usi ogni giorno

Il percorso tipico è in tre tappe:

  1. Pre-training: il modello impara i pattern generali dai dati grezzi. Questo è il base model vero e proprio.
  2. Post-training: il modello viene istruito a seguire richieste, rispondere in modo utile e rispettare delle regole.
  3. Adattamento: il modello viene rifinito su un dominio specifico, per esempio il diritto, la medicina o il customer care.

Quando usi un assistente come ChatGPT, stai quasi sempre usando il risultato finale di questa catena, non il base model grezzo. Il base model è il motore: potente, ma da solo non ti porta da nessuna parte senza il resto dell’auto.

Schema in quattro passaggi: dati grezzi, pre-training, base model, modello specializzato

Cosa significa per te, in pratica?

Capire cos’è un base model ti aiuta a leggere meglio il mercato dell’IA. Quando un’azienda annuncia “il nostro nuovo modello“, spesso sta annunciando un nuovo base model, cioè una nuova base su cui gireranno decine di prodotti. Quando invece annuncia una funzione, spesso sta annunciando un adattamento di un base model che esisteva già.

Ti aiuta anche a fare domande migliori: quel modello è generalista o specializzato? Su quali dati è stato addestrato? È aperto o chiuso? Sono tutte informazioni che cambiano molto l’uso pratico che puoi farne.

Domande frequenti

Base model e foundation model sono la stessa cosa?

Sì. “Base model” e “foundation model” sono due nomi per lo stesso concetto. Il secondo è più diffuso in ambito accademico, il primo è più immediato e viene usato spesso in ambito tecnico e aziendale.

Un base model può rispondere alle mie domande?

Un base model grezzo di solito no, o comunque non in modo affidabile. È bravo a completare testi, non a seguire istruzioni. Per ottenere un assistente conversazionale serve un passaggio di post-training.

Quanti dati servono per addestrare un base model?

Moltissimi: si parla di miliardi di documenti, testi e immagini, per un totale che si misura in migliaia di miliardi di parole. È per questo che solo poche organizzazioni al mondo possono addestrare un base model da zero.

Posso usare un base model sul mio computer?

I modelli più piccoli e con pesi aperti sì, se hai una scheda grafica adeguata. I modelli più grandi richiedono invece infrastrutture di calcolo che difficilmente stanno su una macchina singola. In alternativa si usano via API, senza scaricare nulla.

Che differenza c’è tra base model e modello fine-tuned?

Il modello fine-tuned è un base model che ha ricevuto un addestramento aggiuntivo su dati specifici. Il base model resta la base comune, mentre la versione fine-tuned è quella specializzata per un compito o un settore preciso.

Newsletter settimanale con le ultime novità sull’intelligenza artificiale

Corso gratuito sull’Intelligenza Artificiale, dalle nozioni base ai concetti più complessi

Condividi:

Potrebbero interessarti