Diversità lessicale: TTR e MATTR
Analizza un campione linguistico con token, type, TTR e MATTR e confronta due testi senza confondere diversità lessicale e lunghezza.
Analizzatore di diversità lessicale
Incolla un campione italiano e calcola token, parole diverse, TTR, MATTR e frequenze con regole trasparenti.
- Tokenizzazione italiana
- TTR e MATTR
- Export delle frequenze
Abstract clinico — Fergadiotis et al. (2013) e Luckman et al. (2020)
Soluzione: trascrivi con regole stabili, usa TTR solo sapendo che dipende dalla lunghezza e preferisci MATTR con finestra costante per confronti longitudinali. Mantieni uguali compito, lingua, trattamento di ripetizioni e finestra.
Fergadiotis, Wright e West (2013), su 101 campioni di persone con afasia, hanno trovato forte evidenza a favore di MATTR e MTLD come misure meno distorte della diversità lessicale rispetto alla TTR grezza. Luckman e colleghi (2020), su 99 coppie di bambini, mostrano che misure di campione spontaneo e test standardizzati non descrivono necessariamente lo stesso costrutto.
Limite dell’evidenza: tokenizzazione e MATTR descrivono la varietà del campione, non l’intero vocabolario della persona. Un risultato alto o basso non è diagnostico e può cambiare per consegna, argomento, lunghezza, trascrizione e morfologia.
Confronta campioni senza farti ingannare dalla lunghezza
Analizza automaticamente token, type, TTR e MATTR, controlla le parole più frequenti ed esporta i risultati per la revisione.
Analizza il campioneTre letture complementari
Type / token
- 1Conta tutte le parole
- 2Conta forme diverse
- 3Dividi type per token
Semplice, ma sensibile alla lunghezza.
TTR, MATTR o semplice numero di parole diverse
Ogni indice risponde a una domanda diversa e nessuno rende confrontabili campioni raccolti con consegne incompatibili.
| Se osservi | Cosa fare | Come verificare |
|---|---|---|
| Campioni della stessa lunghezza | Puoi riportare NDW e TTR con il denominatore. | Tokenizzazione e compito sono identici. |
| Campioni di lunghezza diversa | Usa MATTR con finestra costante e riporta anche token. | Ogni campione contiene almeno il numero di token della finestra. |
| Molte ripetizioni, revisioni o filler | Rivedi la trascrizione e applica una regola esplicita. | La stessa regola vale per pre e post. |
| Lingue o argomenti differenti | Evita il confronto numerico diretto. | La decisione considera lingua, compito e opportunità lessicali. |
Procedura per un confronto longitudinale
La qualità del dato nasce dalla trascrizione e dal disegno del campione, non dal calcolo automatico.
- Scegli una consegna. Usa la stessa storia, immagine o procedura conversazionale nei tempi confrontati.
- Trascrivi con regole fisse. Definisci punteggiatura, contrazioni, elisioni, parole composte, esitazioni e parti non intelligibili.
- Controlla il testo. Correggi errori evidenti e rimuovi indicazioni del trascrittore che non appartengono al parlato.
- Registra token e type. Conserva lunghezza totale e numero di forme distinte insieme agli indici.
- Imposta la finestra MATTR. Scegli un valore compatibile con il campione più breve e non cambiarlo nel follow-up.
- Leggi le frequenze. Individua parole ripetute, elementi funzionali e possibili artefatti della consegna.
- Integra il risultato. Confronta il dato con accuratezza, informatività, grammatica e obiettivi comunicativi.
Esempio compilato: due narrazioni
Il confronto mantiene la stessa storia e la stessa finestra, mostrando perché la sola TTR può essere fuorviante.
| Campo | Esempio compilato | Perché è utile |
|---|---|---|
| Tempo 1 | 82 token, 45 type, TTR 0,55, MATTR-20 0,72. | Conserva lunghezza e indici. |
| Tempo 2 | 126 token, 59 type, TTR 0,47, MATTR-20 0,75. | La TTR scende con il campione più lungo mentre MATTR aumenta leggermente. |
| Controlli | Stessa storia, stessa trascrizione, filler esclusi, forme flesse non lemmatizzate. | Rende esplicite le regole che influenzano i valori. |
| Decisione | Descrivere lieve aumento MATTR e verificare informatività e parole target. | Evita di chiamare “peggioramento” la sola diminuzione della TTR. |
La TTR diminuisce spesso quando il campione si allunga
Non leggere una TTR più bassa come perdita lessicale senza controllare i token. Usa campioni omogenei o MATTR con finestra costante, riporta le regole di tokenizzazione e non confrontare valori generati con procedure diverse.
Vignetta clinica: la TTR che sembrava peggiorare
Contesto
Dopo otto settimane, la narrazione di Arianna passa da 60 a 115 parole. La TTR scende e il team teme una riduzione del lessico.
Intervento
La logopedista ricalcola entrambi i campioni con MATTR-20, verifica le frequenze e controlla la stessa consegna narrativa.
Esito
MATTR e numero di parole informative aumentano, mentre la TTR era diminuita soprattutto per la maggiore lunghezza. Il piano prosegue con target più specifici.
Approfondimenti collegati
Campione più lungo
Il post contiene il doppio dei token e una TTR più bassa.
Domande frequenti
Che differenza c’è tra token e type?
I token sono tutte le occorrenze di parola; i type sono le forme distinte. In “il gatto e il cane” ci sono cinque token e quattro type.
Come si calcola la TTR?
Numero di type diviso numero di token. Va sempre riportata insieme alla lunghezza perché tende a diminuire nei campioni più lunghi.
Che cos’è la MATTR?
È la media delle TTR calcolate su finestre mobili di lunghezza fissa. Riduce, ma non elimina, i problemi di comparabilità del campione.
Quale finestra MATTR devo usare?
Una finestra compatibile con il campione più breve e mantenuta costante. Non esiste un valore universale valido per tutte le popolazioni e domande.
Il tool riconosce automaticamente ripetizioni e riparazioni?
Analizza il testo inserito. Devi prima applicare le tue regole di trascrizione e controllare manualmente elementi da includere o escludere.
Fonti scientifiche full text
- Fergadiotis G, Wright HH, West TM (2013). Measuring Lexical Diversity in Narrative Discourse of People With Aphasia. Studio di validità su TTR, MATTR, MTLD, D e HD-D in 101 campioni.
- Luckman C et al. (2020). Lexical Diversity and Lexical Skills in Children Who Stutter. Studio multicentrico su 99 coppie di bambini e più misure di diversità lessicale.
- Kim H, Wright HH (2020). Concurrent Validity and Reliability of the Core Lexicon Measure as a Measure of Word Retrieval Ability in Aphasia Narratives. Studio che integra misure lessicali e qualità informativa del discorso.