Se hai letto la guida su cosa sono gli embedding, sai già che sono liste di numeri che rappresentano il significato delle parole.
Ma come si creano questi numeri? Chi li decide?
La risposta sorprende molti: nessuno li decide, vengono imparati dal modello in autonomia nella fase di addestramento, quando in sostanza legge tanto tanto testo. In questa guida vediamo il processo passo dopo passo, con esempi concreti.

Di cosa parleremo..
Il punto di partenza: tanto testo
Per creare un embedding servono due ingredienti. Il primo è un corpus, cioè una grande raccolta di testi: libri, articoli, pagine web, conversazioni. Il secondo è un algoritmo, cioè un programma che analizza questi testi e cerca di capire le relazioni tra le parole.
L’idea di base è semplice: le parole che compaiono in contesti simili hanno significati simili. Prendi “gatto” e “cane”: in una frase trovi spesso “il gatto dorme” e “il cane dorme”. I due animali non sono la stessa cosa, ma il contesto in cui compaiono è molto simile. L’algoritmo sfrutta proprio questo indizio.
Che cos’è il training: come il modello impara
Il processo per creare gli embedding si chiama addestramento o training. Il modello parte con numeri casuali, poi li corregge migliaia di volte, un passo alla volta. Ogni correzione lo avvicina all’obiettivo: parole simili devono avere vettori simili, parole diverse devono avere vettori diversi.
Per capire se ha fatto bene, il modello gioca a un piccolo indovinello.
Guarda una parola e prova a prevedere quali parole le stanno intorno. Se sbaglia, corregge i numeri. Se indovina, li lascia così. Ripetendo questo gioco su milioni di frasi, i numeri diventano sempre più precisi.
Word2vec: il pioniere
Il metodo più famoso si chiama Word2vec, introdotto da Google nel 2013. Funziona in due varianti. Nella prima, chiamata CBOW, il modello guarda le parole vicine e prova a indovinare quella centrale. Nella seconda, chiamata Skip-gram, fa il contrario: guarda la parola centrale e prova a prevedere quelle vicine. Entrambe producono embedding molto utili.

GloVe: contare le vicinanze
Un altro approccio famoso è GloVe, creato da Stanford. Invece di giocare a indovinare, conta quante volte due parole compaiono vicine in tutto il corpus. Queste statistiche vengono trasformate in vettori. Il risultato è simile a Word2vec, ma il percorso è diverso.
BERT e i modelli contestuali
I metodi classici assegnano un solo vettore per parola. Ma la parola “banca” ha significati diversi in “banca del sangue” e in “andare in banca”. Per questo sono nati modelli come BERT, che creano embedding contestuali: lo stesso vocabolo riceve numeri diversi a seconda della frase in cui si trova.
Questi embedding si chiamano anche contextual embedding e sono alla base dei modelli moderni.
Il risultato: lo spazio vettoriale
Alla fine del processo, ogni parola del vocabolario ha il suo vettore. Tutti questi vettori vivono in uno spazio vettoriale, uno spazio a molte dimensioni dove le parole simili per significato in determinati contesti sono vicine. La distanza tra due vettori misura la distanza di significato tra due parole.
La parte più affascinante è che in questo spazio emergono regolarità matematiche. Un esempio classico: se prendi il vettore di “re”, sottrai quello di “uomo” e aggiungi quello di “donna”, ottieni un punto molto vicino al vettore di “regina”.
I modelli non hanno mai ricevuto questa regola, l’hanno scoperta da soli leggendo il testo.
Come si creano oggi, nella pratica
Oggi quasi nessuno addestra embedding da zero. I modelli come GPT, Claude o Gemini contengono già layer di embedding imparati durante l’addestramento. Chi sviluppa applicazioni usa direttamente questi layer, oppure scarica embedding pre-addestrati pronti all’uso. Il lavoro di creazione resta fondamentale, ma è già stato fatto da altri.
Quando vedi un servizio che “vettorizza documenti”, in realtà sta passando i tuoi testi dentro un modello di embedding pre-addestrato, che restituisce un vettore per ogni frase o parola. Questo è il meccanismo alla base di motori di ricerca semantici e database vettoriali.
FAQ
Quanto testo serve per creare buoni embedding?
Dipende dal metodo, ma in generale serve molto testo: centinaia di milioni di parole per risultati solidi. I modelli moderni vengono addestrati su gran parte del web, miliardi di frasi.
Chi decide quali numeri usare per ogni parola?
Nessuno. I numeri vengono imparati dal modello durante l’addestramento, partendo da valori casuali e correggendoli un passo alla volta in base agli errori.
Un embedding può cambiare nel tempo?
Sì. Gli embedding rispecchiano il testo su cui sono stati addestrati. Se il linguaggio cambia, servono modelli riaddestrati per catturare i nuovi significati.
Embedding e token sono la stessa cosa?
No. Il token è il pezzo di testo, la parola o parte di parola. L’embedding è la rappresentazione numerica di quel token. Prima si divide il testo in token, poi si trasformano in embedding.
Posso creare embedding per le frasi intere?
Sì, esistono modelli specifici per sentence embedding, che trasformano intere frasi o paragrafi in un unico vettore. Servono per confrontare testi, cercare documenti simili o alimentare sistemi di domanda e risposta.


