Predmet uvaja področje obdelave naravnega jezika (ONJ) in velikih jezikovnih modelov (VJM) za študente humanističnih, družboslovnih in interdisciplinarnih programov. Razlaga osnove tradicionalnih, statističnih in nevronskih pristopov ter jih utrdi s praktično rabo odprtokodnih sistemov, predvsem v okolju Python. Velik del predmeta se posveti delu z generativnimi VJM (npr. ChatGPT, Claude, odprti modeli kot LLaMA, Mistral, Gemma) in tehnikam oblikovanja ukaznih pozivov (prompt engineering). Pri vajah študenti rešujejo realne probleme obdelave večjih količin besedil, vključno s slovenskimi viri.
Vsebine predavanj in vaj:
- Uvod v obdelavo naravnega jezika in VJM: kaj je naravni jezik z vidika računalništva, dvoumnost in jezikovna kompleksnost, kratka zgodovina ONJ, od tradicionalnih do nevronskih pristopov, kje srečamo VJM v vsakdanji rabi.
- Osnove dela z besedili: priprava in čiščenje besedil, kodiranje znakov, optično prepoznavanje besedila (OCR) in transkripcija, jezikovna normalizacija, lematizacija in oblikoslovno označevanje, regularni izrazi, tokenizacija (vključno z modernimi pristopi – npr. BPE in WordPiece).
- Mere podobnosti in osnovne predstavitve besedil: vreča besed (BoW), TF-IDF, kosinusna podobnost, n-grami, gručenje besedil, uvrščanje sentimenta z enostavnimi metodami.
- Jezikovni viri: korpusi (Gigafida, ccGigafida, slWaC, KAS, Common Crawl, Wikipedia), označeni viri (SUK, korpusi za vrednotenje), repozitoriji (CLARIN.SI, Hugging Face) in Evropski jezikovni podatkovni prostor, licenčni in pravni vidiki, FAIR načela, etika zbiranja podatkov.
- Globoke nevronske mreže in vložitve besed: intuitivna razlaga nevronskih mrež, kontekstualne in nekontekstualne vložitve (word2vec, fastText), večjezične vložitve, podobnost stavkov in dokumentov.
- Veliki jezikovni modeli: arhitektura transformer (na intuitivni ravni), modeli kodirnik in/ali dekodirnik (BERT, GPT, T5), kako uči VJM-je, spodbujevano učenje s povratnim človeškim odzivom (RLHF), odprti in zaprti modeli, lokalna raba modelov (Ollama), strošek, hitrost in okoljski vidik uporaba VJM kot storitev.
- Oblikovanje ukaznih pozivov (prompt engineering): osnove pisanja navodil, tehnike (zero-shot, few-shot, chain-of-thought), strukturirani izhodi (JSON), sistemski pozivi in vloge, pogoste napake in halucinacije, vzorci za praktične naloge (klasifikacija, povzemanje, ekstrakcija, prevajanje, urejanje besedil).
- S poizvedovanjem obogateno generiranje (RAG): priprava dokumentov, vektorske baze (FAISS, Chroma), iskalniki in pridobivanje besedil, sestava ogrodja RAG nad lastnimi dokumenti.
- Semantične in leksikalne tehnologije: WordNet in sloWNet, FrameNet, BabelNet, ontologije in grafi znanja (Wikidata), povezovanje entitet, terminološke zbirke; kako VJM dopolnjujemo s strukturiranim znanjem.
- Jezikoslovne naloge in večjezičnost: prepoznavanje imenskih entitet, prevajanje, razdvoumljanje pomenov besed, analiza sentimenta, odkrivanje koreferenčnosti; specifike slovenščine in drugih morfološko bogatih jezikov.
- Vrednotenje in zanesljivost VJM: avtomatske metrike (BLEU, ROUGE, BERTScore), človeško vrednotenje, jezikovni model kot sodnik, ocenjevalne lestvice (SloBENCH), pristranskost, varnost in etični vidiki.
- Agentne tehnologije in orodja: klici funkcij, integracija z zunanjimi viri, princip MCP, agenti za pomoč pri raziskovanju, pisanju in podatkovni analizi.
- Uporaba jezikovnih tehnologij v praksi: študije primerov iz humanistike in družboslovja - prevodoslovja, jezikoslovnih raziskav, družboslovja, izobraževanja, knjižničarstva in zgodovine; načrtovanje lastnega mini-projekta.
- Multimodalni in govorni modeli (kratek pregled): samodejna razpoznava govora (npr. Whisper), sinteza govora, modeli besedilo–slika, intuitivna predstavitev za naloge, kjer ne gre samo za besedilo.
Projektno delo: študenti v majhnih skupinah ali individualno rešijo izbrani problem na večji količini besedilnih podatkov (npr. analiza arhivskega gradiva/knjig, gradnja klepetalnika nad korpusom, primerjalna analiza modelov, jezikovna obdelava družbenomedijskih virov).