Ar DI supranta lietuviškai? Išmatavau
Tie patys 900 klausimų anglų ir lietuvių kalbomis, septyni vietiniai kalbos modeliai ir trys paieškos modeliai. Kiek prarandama lietuviškai ir kokie pasirinkimai tą praradimą sumažina.
Dauguma DI modelių mokomi daugiausia angliškais tekstais. Lietuvių kalba maža, o jos gramatika sudėtinga: septyni linksniai, daugybė galūnių. Todėl prieš kuriant dokumentų sistemą lietuviškai organizacijai verta žinoti, kiek prasčiau DI veikia lietuviškai ir ką su tuo daryti.
Tai išmatavau vienodomis sąlygomis: tie patys klausimai apie tuos pačius tekstus abiem kalbomis, modeliai veikia privačiai, viename kompiuteryje su įprasta vaizdo plokšte (NVIDIA RTX 4070, 12 GB). Jokie duomenys niekur nesiunčiami. Visas metodas ir rezultatai angliškai: LAB/006.
Kaip matavau
Naudojau viešą „Meta AI“ rinkinį Belebele (CC BY-SA 4.0): 900 teksto supratimo klausimų su keturiais atsakymų variantais apie 488 trumpus tekstus. Tekstai profesionaliai išversti į daugiau nei šimtą kalbų, todėl angliška ir lietuviška versijos skiriasi tik kalba, ne turiniu.
Kiekvienas modelis perskaitė tekstą, klausimą ir atsakymų variantus ir atsakė viena raide. Nurodymas abiem atvejais buvo angliškas: keitėsi tik medžiagos kalba.
Teksto supratimas
Qwen3-4B Instruct-2507 Q4_K_M
- Anglų91,1 %
- Lietuvių78,6 %
Qwen3-4B Instruct-2507 Q8_0
- Anglų91,3 %
- Lietuvių79,1 %
Qwen3-8B Q4_K_M
- Anglų84,4 %
- Lietuvių79,2 %
Qwen3-8B Q8_0
- Anglų86,0 %
- Lietuvių78,9 %
Qwen3-14B Q4_K_M
- Anglų94,7 %
- Lietuvių87,7 %
Phi-4-mini Q4_K_M
- Anglų88,8 %
- Lietuvių62,2 %
Phi-4-mini Q8_0
- Anglų89,2 %
- Lietuvių64,6 %
Visi modeliai lietuviškai klysta dažniau, bet skirtumas labai nevienodas. „Qwen3“ modeliai praranda 5–13 procentinių punktų, „Microsoft“ „Phi-4-mini“ – apie 25 ir neteisingai atsako maždaug į kas trečią klausimą. Geriausias lietuviškas rezultatas – „Qwen3-14B“, 87,7 %, – maždaug prilygsta vidutinio dydžio modelių rezultatams angliškai.
| Anglų | Lietuvių | Skirtumas (p. p.) | |
|---|---|---|---|
| Qwen3-4B Instruct-2507 Q4_K_M | 91,1 % | 78,6 % | 12,5 |
| Qwen3-4B Instruct-2507 Q8_0 | 91,3 % | 79,1 % | 12,2 |
| Qwen3-8B Q4_K_M | 84,4 % | 79,2 % | 5,2 |
| Qwen3-8B Q8_0 | 86,0 % | 78,9 % | 7,1 |
| Qwen3-14B Q4_K_M | 94,7 % | 87,7 % | 7,0 |
| Phi-4-mini Q4_K_M | 88,8 % | 62,2 % | 26,6 |
| Phi-4-mini Q8_0 | 89,2 % | 64,6 % | 24,6 |
Suspaudimas (4 bitų vietoj 8 bitų versija) lietuviško rezultato beveik nekeičia: skirtumai neviršija 2,4 punkto, o tai yra atsitiktinės paklaidos ribose.
Paieška: ar sistema randa tinkamą tekstą?
Prieš atsakydamas į klausimą, dokumentų asistentas turi rasti tinkamą tekstą. Šiame bandyme kiekvienas klausimas turėjo rasti tekstą, kuriam buvo parašytas, tarp visų 488 tekstų. Tam naudojami įterpinių (angl. embedding) modeliai, kurie tekstą paverčia skaičių vektoriais paieškai.
- bge-m3 (daugiakalbis)87,0 %
- multilingual-e5-base (daugiakalbis)83,4 %
- bge-base-en (tik anglų k.)45,0 %
Tai aiškiausias šio tyrimo rezultatas. Tik anglų kalbai skirtas paieškos modelis lietuviškai neveikia: tinkamą tekstą pirmoje vietoje jis pateikia rečiau nei pusę kartų, nors angliškai – 90 % atvejų. Ir sistema apie tai niekaip neįspėja: rezultatai tiesiog blogi. Daugiakalbis modelis „bge-m3“ (MIT licencija, pakankamai mažas, kad veiktų toje pačioje vaizdo plokštėje šalia kalbos modelio) lietuviškai praranda tik 4 punktus.
| EN→EN | LT→LT | LT→EN | EN→LT | |
|---|---|---|---|---|
| bge-m3 (daugiakalbis) | 91,3 % | 87,0 % | 83,1 % | 84,8 % |
| multilingual-e5-base (daugiakalbis) | 92,1 % | 83,4 % | 65,8 % | 77,9 % |
| bge-base-en (tik anglų k.) | 89,7 % | 45,0 % | 17,6 % | 28,9 % |
Stulpeliai LT→EN ir EN→LT parodo, kas vyksta, kai lietuviškai klausiama apie angliškus dokumentus arba atvirkščiai. Organizacijose tai įprasta. „bge-m3“ ir čia veikia gerai (83–85 %), o kitas daugiakalbis modelis, „multilingual-e5-base“, gerokai silpnesnis (66 %, kai klausimas lietuviškas, o tekstai angliški). Ieškant ne vieno, o penkių geriausių atitikmenų, „bge-m3“ tinkamą lietuvišką tekstą randa 96,8 % atvejų.
Ką tai reiškia praktiškai
- Lietuvių kalba su vietiniais modeliais veikia, bet su išmatuojama kaina. Tikėkitės kelių punktų prastesnio tikslumo nei tokios pat sistemos anglų kalba ir testuokite su lietuviška medžiaga nuo pat pradžių.
- Paieškos modelis svarbesnis už kalbos modelį. Tik anglų kalbai skirtas įterpinių modelis yra dažniausia ir žalingiausia klaida, nes ji nepastebima. Rinkitės daugiakalbį, pavyzdžiui, „bge-m3“.
- Kalbos modelį rinkitės pagal lietuviškus, ne angliškus rezultatus. „Phi-4-mini“ angliškai konkurencingas, o lietuviškai – gerokai silpniausias.
- Didesnis modelis padeda. „Qwen3-14B“, didžiausias telpantis į 12 GB vaizdo plokštę, lietuviškai buvo aiškiai geriausias.
Ribos
Belebele tekstai trumpi, redaguoti, bendro pobūdžio ir išversti iš anglų kalbos. Tikri lietuviški dokumentai (teisės aktai, savivaldybių sprendimai, sąskaitos, kasdienės kalbos el. laiškai) bus sunkesni, o terminija čia netikrinta. Klausimai su atsakymų variantais matuoja supratimą, ne tai, kaip gerai modelis lietuviškai rašo. Tai atskiras klausimas. Paieška vyko tarp 488 tekstų; didesniuose rinkiniuose užduotis sunkesnė visiems modeliams.
Jei planuojate DI sprendimą lietuviškiems dokumentams, pirmiausia verta išmatuoti tai su jūsų pačių dokumentais. Parašykite, nuo ko norėtumėte pradėti.