i modelli
LLM
Large Language Model
Un LLM (Large Language Model) è un modello addestrato su enormi quantità di testo a prevedere la parola successiva, e da questa capacità deriva quella di comprendere domande e generare risposte.
2017
L’anno del paper che introduce il Transformer, l’architettura su cui poggiano tutti i modelli attuali.
~20
I token di addestramento per ogni parametro nel punto compute-ottimale, secondo Hoffmann et al. (2022).
100×
Il divario di dimensione che l’allineamento ha compensato nei test di Ouyang et al. (2022).
Sei cose da sapere
- Un LLM fa una cosa sola: prevedere il token successivo. Comprensione, sintesi e ragionamento sono conseguenze di quell’unico obiettivo, non funzioni separate.
- L’architettura di riferimento è il Transformer, introdotto nel 2017: è ciò che ha reso l’addestramento parallelizzabile e quindi economicamente possibile su scala.
- Più grande non significa migliore. Conta il rapporto tra parametri e quantità di testo visto: molti modelli famosi erano sottoallenati per la loro taglia.
- Un modello puro non consulta il web. Si ferma alla data di fine addestramento e non può citare nulla, perché non ha fonti da indicare.
- L’utilità pratica non è arrivata solo dalla scala ma dall’allineamento: insegnare al modello a seguire istruzioni ha pesato più di moltiplicarne le dimensioni.
- Per chi pubblica esistono due porte d’ingresso, l’addestramento e il recupero. Solo la seconda si apre in tempi utili.
Come nasce un modello, in quattro fasi
Le fasi non sono intercambiabili e non hanno lo stesso costo. La prima assorbe quasi tutto il budget di calcolo; l’ultima, che ne costa una frazione, è quella che ha reso i modelli utilizzabili da chiunque.
Pre-addestramento
Il modello legge enormi corpora di testo e impara a prevedere il token successivo. Nessuna etichetta umana: il testo stesso fornisce la risposta corretta, che è semplicemente la parola dopo. Qui si forma la conoscenza del mondo, e qui finisce quasi tutto il budget.
Scelta di scala
Dato un budget di calcolo, quanti parametri e quanti token di addestramento? Fino al 2022 si privilegiavano modelli molto grandi su relativamente poco testo. Hoffmann e colleghi hanno mostrato che era uno spreco: a parità di calcolo conviene un modello più piccolo che legge molto di più.
Fine-tuning supervisionato
Il modello grezzo completa testi, non risponde a domande. Alcune migliaia di dimostrazioni scritte da persone — domanda e risposta ideale — gli insegnano il formato conversazionale.
Allineamento tramite preferenze umane
Annotatori ordinano più risposte dalla migliore alla peggiore. Da quegli ordinamenti si addestra un modello di ricompensa, che poi guida l’ottimizzazione del modello principale. È la fase che trasforma un completatore di testo in un assistente.
Quattro risultati che hanno cambiato il campo
70B / 1,4T
Parametri e token di Chinchilla: circa venti token di addestramento per ogni parametro, il punto compute-ottimale.
Hoffmann et al., 2022
400+
I modelli linguistici addestrati per derivare la legge di scala. Raddoppiando i parametri va raddoppiato anche il testo.
Hoffmann et al., 2022
1,3B > 175B
Gli annotatori hanno preferito le risposte del modello allineato da 1,3 miliardi di parametri a quelle di GPT-3 da 175 miliardi.
Ouyang et al., 2022
85%
La frequenza con cui InstructGPT 175B è stato preferito a GPT-3 175B: stessa architettura, stessa taglia, solo allineamento in più.
Ouyang et al., 2022
- Chinchilla, con 70 miliardi di parametri, ha superato modelli molto più grandi addestrati con lo stesso calcolo, tra cui Gopher da 280 miliardi e GPT-3 da 175 miliardi.
- Il confronto tra InstructGPT e GPT-3 è metodologicamente pulito: stessa architettura, cambia solo il fine-tuning sui dati umani. La differenza è quindi attribuibile all’allineamento e non alla taglia.
Che cosa un LLM non fa
- Non consulta il web. Salvo che il sistema attorno non gli fornisca documenti, risponde solo con gli schemi appresi in addestramento.
- Non cita fonti. Un modello puro non ha un elenco di documenti da indicare: le citazioni arrivano dal livello di recupero, non dal modello.
- Non verifica. Produce ciò che è statisticamente plausibile. Una risposta fluente e sbagliata è indistinguibile, dall’interno, da una corretta.
- Non conosce la data di oggi né ciò che è stato pubblicato dopo la fine del suo addestramento.
Modello puro e modello con recupero
| Aspetto | Modello puro | Modello con recupero |
|---|---|---|
| Conoscenza | Ferma alla fine dell’addestramento | Aggiornata a ogni domanda |
| Fonti | Nessuna da indicare | I documenti recuperati |
| Come ci entri | Essendo stato assorbito negli anni precedenti | Essendo indicizzato e leggibile adesso |
| Tempi per te | Anni, e nessuna garanzia | Settimane, e verificabile |
| Dove si vede | Risposte senza riga di fonti | AI Overviews, Perplexity, ricerche in chat |
Un caso concreto
Un responsabile acquisti chiede: “chi produce valvole industriali certificate ATEX in Italia?”
Se il modello risponde senza recupero, pesca dai nomi assorbiti in addestramento. Verranno fuori le aziende che negli anni scorsi erano più citate sul web in lingua italiana — non necessariamente le migliori, e quasi mai quelle nate di recente.
Se il sistema recupera documenti, cerca nel suo indice le pagine pertinenti, ne legge alcuni frammenti e costruisce la risposta su quelli. A questo punto entra in gioco chi ha una pagina che dichiara in modo esplicito certificazione, categoria di prodotto e mercato servito, in un paragrafo che si capisce anche letto da solo.
La stessa azienda può quindi essere invisibile nel primo caso e citata nel secondo. È la ragione per cui misurare la propria presenza “sui modelli” senza distinguere le due modalità restituisce numeri che non si sanno interpretare.
Che cosa ne ricava chi pubblica
Le stesse ricerche che spiegano come funziona un modello dicono anche, indirettamente, che cosa conviene fare. Sul versante della visibilità il riferimento è lo studio che ha fondato la GEO come campo, presentato a KDD nel 2024 su un banco di prova di circa diecimila domande.
- La densità di parole chiave, cardine della SEO classica, ha mostrato un’influenza minima sulla probabilità di essere citati in una risposta generata.
- Hanno funzionato invece i segnali di autorevolezza epistemica: statistiche, citazioni di fonti e virgolettati di esperti, con miglioramenti di visibilità fino al 40%.
- L’aggiunta di fonti citate ha prodotto l’incremento più marcato per i siti già presenti ma in posizione arretrata: oltre il doppio di visibilità per quelli in quinta posizione.
- Tradotto in pratica: scrivere una pagina che a un modello risulti verificabile conta più che scriverne una che a un motore risulti pertinente.
frequenti
Domande frequenti sugli LLM
Un LLM sa che cosa è successo ieri?
Da solo no. La sua conoscenza si ferma alla fine dell’addestramento. Se l’interfaccia che stai usando risponde su fatti recenti, sta recuperando documenti dal web e passandoglieli: non è il modello a sapere, è il sistema attorno a trovare.
Un modello più grande è sempre migliore?
No. Hoffmann e colleghi hanno mostrato che molti modelli erano sottoallenati per la loro taglia: a parità di calcolo, un modello da 70 miliardi di parametri addestrato su 1,4 migliaia di miliardi di token ha superato modelli due o tre volte più grandi. E Ouyang e colleghi hanno visto annotatori preferire un modello cento volte più piccolo ma meglio allineato.
Che differenza c’è tra un LLM e un motore generativo?
L’LLM è il componente che scrive. Il motore generativo è il sistema completo: un livello di recupero che cerca documenti pertinenti più il modello che li sintetizza in una risposta. ChatGPT, Perplexity e le AI Overviews sono motori generativi; GPT e Gemini sono i modelli al loro interno.
Se pubblico un contenuto oggi, quando finirà dentro un modello?
Nei pesi di un modello, forse mai, e comunque non prima del prossimo ciclo di addestramento. Nel recupero, invece, appena la pagina è indicizzata e giudicata pertinente. È il motivo per cui il lavoro GEO si concentra sulla seconda porta: è l’unica con tempi compatibili con un piano editoriale.
Scrivere per i modelli significa scrivere peggio per le persone?
No, ma significa scrivere in modo più disciplinato. Un concetto per paragrafo, la risposta prima della premessa, i dati con la fonte accanto. Sono accorgimenti che migliorano anche la leggibilità umana: il rischio non è la noia, è la ripetitività se applicati meccanicamente.
Come si verifica se un modello nomina la mia azienda?
Si costruisce un insieme di domande che i tuoi clienti farebbero davvero, si interrogano i modelli a intervalli regolari e si conta in quante risposte compare il nome, con quale descrizione e accanto a quali concorrenti. Menzioni e citazioni vanno contate separatamente, perché rispondono a leve diverse.
Riferimenti
Vaswani, A. et al. — Attention Is All You Need
NeurIPS, 2017. Introduce l’architettura Transformer.
Brown, T. et al. — Language Models are Few-Shot Learners
NeurIPS, 2020. GPT-3: 175 miliardi di parametri, circa 300 miliardi di token.
Hoffmann, J. et al. — Training Compute-Optimal Large Language Models
DeepMind, 2022. Il paper Chinchilla: oltre 400 modelli addestrati, circa 20 token per parametro.
Ouyang, L. et al. — Training language models to follow instructions with human feedback
NeurIPS, 2022. arxiv.org/abs/2203.02155
Aggarwal, P. et al. — GEO: Generative Engine Optimization
KDD ’24, Barcellona. arxiv.org/abs/2311.09735