«Tanto hanno tutti voti simili, prendiamo quello che capita»
Quando si confrontano due strumenti di AI con punteggi vicini, viene spontaneo pensare che siano intercambiabili. Tanto vale prendere il più economico, no?
Arriva il primo lavoro vero, e i due modelli «a pari voto» crollano in punti diversi. Uno riassume da dio ma sui confronti annaspa; l’altro fa il contrario. Capita più spesso di quanto si creda.
Nel pezzo precedente abbiamo visto che l’AI, dentro, tratta davvero la struttura della frase. Oggi andiamo a guardare cosa decide quanto a fondo riesce a trattarla: il progetto del modello.
Il banco di prova è lo stesso studio del 2023, la serie «Physics of Language Models» di Zeyuan Allen-Zhu e Yuanzhi Li (arXiv:2305.13673). Il punto che ci interessa: come la differenza di progetto cambia il modo in cui il modello sbaglia nel lavoro vero.
Basta «come tiene la posizione» per cambiare quanto capisce
I ricercatori hanno messo a confronto più progetti sugli stessi dati a incastri annidati — frasi con proposizioni dentro proposizioni. La prima differenza è saltata fuori sul modo di gestire la posizione delle parole.
La codifica della posizione in pratica vuol dire il modo in cui il modello segnala dove sta ogni parola nella frase. I metodi si dividono grosso modo in due: la posizione «assoluta» (la parola numero 3, la numero 4) e quella «relativa» (questa parola è due passi dopo quella).
E quale ha vinto? Il risultato è netto: il metodo relativo, la famiglia del RoPE, batteva quello assoluto in modo costante.
Perché mai una cosa così tecnica dovrebbe interessarci? Il perché è intuitivo. Capire una frase dipende meno dal «numero d’ordine» della parola e più da «cosa si lega a cosa». Conta il legame, non la posizione sul righello.
Per chi sceglie, la morale è comoda: più che inseguire i numerini fini della scheda tecnica, conviene sapere di quale famiglia è il modello.
Quando il progetto «con più paletti» capisce di più
C’è poi un confronto che spiazza: quello tra l’impostazione tipo GPT (legge la frase da sinistra a destra, come quando scriviamo) e quella tipo BERT (la guarda tutta insieme, avanti e indietro). A occhio vince BERT, che vede prima e dopo. E invece no.
Negli esperimenti, sulle strutture annidate più profonde, in certe condizioni l’impostazione più vincolata — il GPT, che ha meno libertà di movimento — afferrava la struttura più a fondo. Proprio perché è costretto a seguire l’ordine, non può rispondere senza inseguire l’impalcatura della frase.
Il punto da portarsi a casa è questo: il progetto che «sulla carta fa più cose» non è sempre il più bravo. Qualche paletto in più, a volte, aiuta a capire meglio. Dipende dall’uso.
Sul lavoro conta il punto esatto dove il modello crolla
Tradotto nella scelta di uno strumento, allora, non basta guardare il punteggio medio. Conta dove il modello inizia a sbandare: il tipo di che produce.
Due modelli «a pari 90» portano rischi diversi. Uno cade sulle domande di confronto, l’altro sui testi lunghi pieni di condizioni. Per il vostro lavoro è la stessa cosa? Per niente: il primo da controllare è se i punti deboli del modello cascano proprio sul vostro compito principale.
scegliete l’AI «che sbaglia poco da voi»
La cosa che da tutto questo passa più dritta al lavoro è una sola: nel confronto tra modelli, più della media alta conta come crollano nei momenti che pesano, e se quando crollano un essere umano riesce ad accorgersene. La domanda buona è: qual è l’AI che sbaglia meno sul nostro uso?
Per arrivarci, la via concreta è fissare 3–5 compiti reali del vostro settore e ripetere la stessa prova, alle stesse condizioni, su ogni candidato. Misurati da voi, dicono più di qualsiasi classifica patinata.
Vale anche per i fornitori. Invece di farsi incantare dalle slide, chiedete a tutti lo stesso questionario: su quali condizioni il modello è debole, quanto i loro dati di test somigliano ai vostri, fin dove arriva la revisione umana. Così li confrontate sul rischio in esercizio, non sulla bellezza del materiale di vendita.
Il passo successivo è decidere fin dove affidare a un modello i compiti di ragionamento, e Quando chiedete all’AI di «ragionare», ci sta ragionando davvero? Andiamo a controllare stringe proprio quel criterio.
Fonti
- Zeyuan Allen-Zhu, Yuanzhi Li, “Physics of Language Models: Part 1, Learning Hierarchical Language Structures”, 2023. arXiv:2305.13673
- Physics of Language Models, sito ufficiale della serie. physics.allen-zhu.com