Projekt EPIC-SI gradi prvi celovit korpus zgodnje komunikacije med starši in otroki v slovenščini.

Pri projektu sodelujejo Institut »Jožef Stefan«, Pedagoški inštitut ter Pedagoška fakulteta in Fakulteta za elektrotehniko Univerze v Ljubljani.

Aktivnosti projekta

Delovni sklopi

V projektu bomo zbrali 150–300 ur zvočnih in video posnetkov spontane komunikacije otrok, starih od 12 do 48 mesecev, in njihovih staršev, in jih ročno prepisali ter opremili z jezikovnimi in nejezikovnimi oznakami. Tako bo nastala obsežna in reprezentativna podatkovna zbirka, kakršne za slovenščino doslej ni bilo.

Na podlagi zbranih podatkov bomo izvedli prve razvojne, jezikoslovne in avdiovizualne študije. Zbirka bo hkrati izhodišče za prilagajanje tehnologij za obdelavo naravnega jezika (npr. samodejnega razpoznavanja govora) slovenskemu otroškemu govoru.

Po zaključku projekta bo anonimiziran korpus odprto dostopen v mednarodnih repozitorijih (CLARIN.SI in TalkBank/CHILDES).

Podroben pregled aktivnosti po delovnih sklopih:

WP0: Upravljanje projekta in diseminacija
CiljiZagotavljanje koordinacije med partnerji, komuniciranje ciljev in rezultatov projekta ter upravljanje s stroški in časovnimi okviri.
NalogePriprava promocijskih gradiv, vzpostavitev spletne strani, komunikacijske platforme in podatkovnega strežnika ter izvedba delavnic za starše in javnost.
RezultatiUčinkovito upravljanje projekta, vidna promocija ciljev in rezultatov projekta ter uspešna vključitev staršev v raziskavo.
WP1: Priprava materialov in metod
CiljiRazvoj protokolov za zbiranje podatkov, priprava tehnične opreme in dokumentacije za etično presojo.
NalogeIzbor vzorca udeležencev, priprava snemalne opreme, priprava gradiv za udeležence.
RezultatiEtična odobritev projekta, navodila za snemanje v naravnem okolju, pripravljene snemalne naprave.
WP2: Zbiranje podatkov
CiljiZbiranje 300 ur avdiovizualnih posnetkov starševsko-otroške komunikacije.
NalogeRekrutacija udeležencev, izvedba snemanj na domovih, prenos in obdelava podatkov.
RezultatiCelovit korpus posnetkov kot osnova za nadaljnje študije.
WP3: Transkripcija podatkov
CiljiRočna transkripcija posnetkov z uporabo standardiziranih orodij.
NalogePriprava smernic za transkripcijo, usposabljanje zunanjih transkriptorjev, nadzor in validacija transkripcij.
RezultatiAnotiran in transkribiran korpus govornih podatkov.
WP4: Obogatitev podatkov
CiljiDodajanje dodatnih nivojev informacij (fonološka poravnava, jezikovne oznake, vizualni podatki).
NalogeSamodejna in ročna anotacija, razvoj orodij za prepoznavanje drž in gest.
RezultatiObogaten in javno dostopen korpus v mednarodnih podatkovnih repozitorijih.
WP5: Raziskovalno delo
CiljiRaziskovanje fonološkega, sintaktičnega, leksikalnega in pragmatičnega razvoja otrok.
NalogeAnaliza govornih zvokov, neverbalne komunikacije, slovničnih struktur in pragmatičnih označevalcev.
RezultatiRazvojni mejniki za slovenščino, raziskovalna poročila o multimodalni komunikaciji.

Ključni rezultati

Dostop do rezultatov projekta (deliverables).

Tabela z rezultati
DeliverableExpected deliveryFormatWP / ResponsibleStatusUploads
Promotional & educational materials package (recruitment + parent material)Month 03Videos, flyers, lectures, etc.WP0 – Mgmt & dissemination (PEI)In progress
Ethics committee application (objectives, methodology, consent templates, data-protection & risk assessment)Month 03Application documentWP1 – Materials & methods (PEF)5/1/2026
Project web page with participant informationMonth 06Public web pageWP0 – Mgmt & dissemination (PEI)7/1/2026Website
Data Management Plan & Dissemination PlanMonth 06Digital platform + serversWP0 – Mgmt & dissemination (PEI)5/1/2026Data Management Plan (PDF)
Instructions for participants (recording setup + elicitation material)Month 06Instruction documents + materialsWP1 – Materials & methods (PEF)In progress
Project platform (partner communication + deliverables + data storage)Month 07Digital platform + serversWP0 – Management & dissemination (PEI)3/8/2026Nextcloud platform
Annotation guidelines & annotator trainingMonth 07Guideline document + trainingWP3 – Data transcription (PEF)Not started
Machine-learning pipeline for automated posture & gesture recognitionMonth 16ML pipeline / softwareWP4 – Data enrichment (IJS)Not started
Gesture and Posture DatasetMonth 20Annotated datasetWP4 – Data enrichment (IJS)Not started
Corpus recordings (150–300 hrs)Month 22Audio / video recordingsWP2 – Data collection (PEI)Not started
Transcribed speech corpusMonth 24Transcribed corpusWP3 – Data transcription (PEF)Not started
Evaluation report on landmark-detection algorithmMonth 24Evaluation reportWP4 – Data enrichment (IJS)Not started
Benchmark for child speech ASR (SloBENCH)Month 24Benchmark datasetWP4 – Data enrichment (IJS)Not started
Benchmark for linguistic preprocessingMonth 24Benchmark datasetWP4 – Data enrichment (IJS)Not started
Milestones of phonological progression & cross-participant variationMonth 30Research report / datasetWP5 – Research (PEI)Not started
Analysis of non-verbal communicative acts vs. language stagesMonth 32Research reportWP5 – Research (PEI)Not started
Context-dependent variation in gesture usage across age groupsMonth 34Research reportWP5 – Research (PEI)Not started
Published enriched corpus (CLARIN.SI, NoSketchEngine, TalkBank/CHILDES)Month 36Public corpusWP4 – Data enrichment (IJS)Not started
Report on shared gesture–language interaction patternsMonth 36Research reportWP5 – Research (PEI)Not started
Morphosyntactic development vs. vocabulary growthMonth 36Research reportWP5 – Research (PEI)Not started
Onset of pragmatic communicative markers in child speechMonth 36Research reportWP5 – Research (PEI)Not started

Transkripcija

Postopek transkripcije.