Yuu Solk
/
|
/
← Analitika Statisztikák

Módszertan / fogalomtár

Mit jelentenek pontosan a mutatók, és honnan jönnek a számok — közérthetően.

Alapfogalmak

MTLD

MTLD = Measure of Textual Lexical Diversity, magyarul nagyjából a szöveg lexikai változatosságának mértéke. Azt méri, hogy egy szöveg mennyire változatos szókincset használ. A legegyszerűbb lexikai változatosság mutató a Type-Token Ratio (TTR): TTR = különböző szavak száma / összes szó száma. Azonban a hosszabb szövegekben nagyobb mennyiségű szó ismétlődik, ezért a TTR értéke csökken. Ezért két különböző hosszúságú szöveg TTR-je nehezen hasonlítható össze. Az MTLD ennek a szöveghosszfüggetlen változata, éppen ennek a problémának a kezelésére fejlesztették ki. Az MTLD a szöveget szóról szóra végigolvassa, és folyamatosan figyeli a TTR értékét. Amíg a TTR egy küszöbérték (általában 0,72) fölött marad, a szakasz folytatódik. Amikor a TTR 0,72 alá esik, az egy „faktor” végét jelenti. Az MTLD ezeknek a faktoroknak az átlagos hosszát méri.

Hapax legomena

A szövegekben pontosan egyszer előforduló szavak mennyiségét méri. Minél nagyobb ezek aránya, annál változatosabb a szóhasználat.

Percentilis

A percentilis egy 100 részre osztott skálát képez az összes műből. A percentilis értéke attól függ, hogy az adott mű milyen mértékben hasonlít más művekre. Minden kompozit index alapja. Ha például 100 szöveg MTLD-értékét vizsgáljuk, és egy szöveg MTLD-je a 95. percentilisben van, akkor annak a szövegnek gazdagabb a szókincse, mint a szövegek 95%-ának.

Burrows' Delta

Burrows' Delta (vagy egyszerűen Delta) egy stilometriai mérőszám, amelyet John F. Burrows dolgozott ki szerzőségvizsgálatra. Arra használják, hogy megmérjék, mennyire hasonló vagy különböző két szöveg írásstílusa. Ismeretlen szerzőjű szövegek szerzőjének azonosítására használják irodalomtudományi és digitális bölcsészeti kutatásokban, illetve annak vizsgálatára, hogy egy vitatott művet valóban egy adott szerző írt-e. A módszer nem a ritka szavakat figyeli, hanem a leggyakoribb szavak (pl. „és”, „a”, „az”, „hogy”) használati gyakoriságát. Ezeket a szerzők általában tudattalanul használják, ezért jól tükrözik az egyéni stílust. Számítása során kiválasztjuk a korpusz leggyakoribb szavait, majd minden szó gyakoriságát standardizáljuk (z-score). Két szöveg között kiszámítják a z-score különbségek abszolút értékének átlagát. A klasszikus képlet: Δ(A,B) = (1/n) Σ|zᴀᵢ − zʙᵢ|, ahol n a vizsgált gyakori szavak száma, zᴀᵢ és zʙᵢ pedig az i-edik szó standardizált gyakorisága a két szövegben. Az eredmény értelmezése: minél kisebb a Delta értéke, a két szöveg annál hasonlóbb.

Kompozit index

Több alapmutatóból, súlyozott mértani középpel összeállított mutató. A módszer maga (percentilis-normalizálás + súlyozott mértani közép) tudományos szakirodalomban is elfogadott eljárás összesített mutatók készítésére (ilyen módszertannal készül pl. az ENSZ Humán Fejlettségi Indexe is) — a konkrét súlyok viszont a weboldal fejlesztése közben használt LLM-ek-re bízott „döntés” eredményei, nem külön kutatással levezetett értékek. Ez lent, minden indexnél külön jelölve van.

A képletek jelölése

Minden alábbi képletben a bemenetek már percentilis-értékek (0–100), a felső indexben szereplő szám a bemenet súlya. A végeredmény mindig egy súlyozott mértani közép: Index = (b₁^w₁ × b₂^w₂ × ... × bₙ^wₙ)^(1 / (w₁+w₂+...+wₙ))

Kompozit indexek

NGI: Nyelvi Gazdagsági Index

Bemenetek: MTLD (súly 0.30), hapax-arány (0.20), a leggyakoribb 10 szó dominanciájának fordítottja (0.15), MTLD ismét, nagyobb hangsúllyal (0.35). Minél gazdagabb és kevésbé pár szóra támaszkodó a szóhasználat, annál magasabb az érték.

GKI: Gondolati Komplexitási Index

Bemenetek: átlagos mondathossz (0.30), mondathossz szórása (0.20), átlagos bekezdéshossz (0.25), átlagos mondathossz ismét (0.25). Azt közelíti, mennyi figyelmet igényel a szöveg az olvasótól.

SUI: Stílus-Ujjlenyomat Index

Bemenetek: Eredetiség Index / Burrows' Delta percentilise (0.5), MTLD (0.25), mondathossz szórása (0.25).

EI: Eredetiség Index

Közvetlenül a Burrows' Delta értéke (percentilisre vetítve) — nincs benne további súlyozás.

KSI: Költői Sűrűség Index

(csak verseknél)
Bemenetek: alliterációs index (0.25), sorvég-diverzitás (0.15), sor/mondat arány (0.25), sorhossz szórása (0.35).

ZI: Zeneiség Index

(csak verseknél)
Bemenetek: magánhangzó-arány (0.20), alliteráció (0.30), sorvég-diverzitás (0.20), sorhossz szórása (0.30).

NDI: Narratív Dinamika Index

(csak prózánál)
Bemenetek: párbeszéd-arány (0.35), mondatritmus szórása (0.35), átlagos mondathossz (0.30).

SHI: Strukturális Harmónia Index

Bemenetek verseknél: sorhossz-szórás fordítottja (0.5), sorvég-diverzitás (0.5). Prózánál: mondathossz-szórás fordítottja (0.5), mondatritmus-szórás fordítottja (0.5). Minél egyenletesebb, kiszámíthatóbb a forma, annál magasabb az érték.

MPI: Memetikus Potenciál Index

Bemenetek: rövid mondatok aránya (0.3), hapax-arány (0.2), Eredetiség Index (0.2), MTLD (0.3). Azt közelíti, mennyire "idézhető", megjegyezhető a szöveg.

ITI: Irodalmi Térgörbület Index

A Strukturális Harmónia, a Nyelvi Gazdagság, a Zeneiség/Narratív Dinamika és az Eredetiség négy dimenziójából számolt négyzetes közép: ITI = √(SHI² + NGI² + (ZI vagy NDI)² + EI²) / 2.

TMI: Teljes Műprofil Index

A fenti indexek összesítése: NGI (0.18), KSI/NDI (0.12), GKI (0.15), SUI (0.10), ZI/NDI (0.10), EI (0.15), SHI (0.10), MPI (0.05), ITI (0.05).

"DNS" csoportok

A fenti indexek további összevonása három nagy csoportba, egyenlő súlyokkal, gyors, átfogó jellemzésre: Nyelvi DNS = NGI + SUI + EI mértani közepe. Forma DNS = (KSI vagy NDI) + SHI mértani közepe. Gondolati DNS = GKI + (NDI vagy KSI) + ITI mértani közepe.