Idea

L'attenzione di un modello si degrada su ciò che si seppellisce a metà del suo contesto

Info

Scritto originalmente in francese. Tradotto dall'IA — il significato è stato preservato, non la prosa.

Idea principale

La finestra di contesto di un modello linguistico è finita, e questo lo sanno tutti. Ciò che si dà per scontato subito dopo è falso: che entro quel limite tutto ciò che viene fornito sia ugualmente disponibile. Alcuni ricercatori di Stanford l'hanno misurato in Lost in the Middle (Liu et al., 2024) — un'informazione collocata all'inizio o alla fine del contesto viene recuperata molto meglio della stessa informazione sepolta nel mezzo.

La conseguenza pratica riguarda un'abitudine molto diffusa: caricare un file di tremila righe sperando che il modello «capisca tutto». Il modello non rifiuta, non segnala nulla, e risponde. Ciò che si degrada non è la forma della risposta, è ciò di cui ha davvero tenuto conto — e niente nell'output dice che cosa è sfuggito.

Riempire non è quindi un'operazione neutra. Ogni riga aggiunta al contesto non si somma soltanto a ciò che il modello sa: spinge verso il centro ciò che c'era già.

Perché è importante

Trasforma la dimensione di finestra dichiarata da un fornitore in una capacità massima, non in una capacità utile. Raddoppiare la finestra non raddoppia ciò di cui il modello dispone davvero, e ragionare in numero di token disponibili porta a riempire fino all'orlo.

Giustifica anche un lavoro che altrimenti sembrerebbe superfluo: suddividere, gerarchizzare e selezionare ciò che si fornisce, anche quando tecnicamente ci starebbe tutto.

Sfumature e limiti

L'effetto è una proprietà dei modelli osservati in un dato momento, e la sua portata varia da un'architettura e da una generazione all'altra. Ciò che resta è il principio — riempire ha un costo in qualità — più che il dato numerico.

E la posizione non spiega tutto: un'informazione formulata male o contraddetta altrove nel contesto si perde anche in testa al documento.

Domande aperte

  • Come accorgersi, davanti a una risposta plausibile, che un'informazione fornita al modello non è stata utilizzata?