Keď sa dnes bežného chatbota opýtate niečo po anglicky, odpovie plynule, presne a s prirodzeným citom pre jazyk. Keď sa ho opýtate po slovensky, odpoveď je zvyčajne zrozumiteľná — no niekedy sa v nej mihne trochu neprirodzený slovosled, nesprávny pád alebo pojem, ktorý model jednoducho nepozná. Nejde o náhodu ani o menejcennosť slovenčiny ako jazyka. Je to dôsledok toho, čomu sa v odbore hovorí nízkozdrojový jazyk — problém, ktorého praktické dôsledky ukázal aj nový projekt slovenských vedcov predstavený v roku 2026.
Prečo práve teraz
- marca 2026 predstavil tím zložený z výskumníkov Slovenskej akadémie vied, Technickej univerzity v Košiciach a Jazykovedného ústavu Ľudovíta Štúra SAV nový jazykový model s názvom Qwen3-14B-SK — inštrukčný model cielene doladený pre potreby slovenčiny. Podľa jedného z autorov, Mareka Dobeša zo SAV, model umožňuje „posilniť technologickú autonómiu krajiny a zároveň zachovať jej kultúrnu identitu v digitálnom svete“. Na vývoji sa okrem neho podieľali Peter Bednár z Ústavu umelej inteligencie na FEI TUKE a Radovan Garabík z Jazykovedného ústavu SAV — teda kombinácia informatikov a jazykovedcov, čo pri tejto téme nie je náhoda, ale nevyhnutnosť.
Tréning modelu prebiehal na výkonných európskych superpočítačoch Leonardo (Taliansko) a Perun (Slovensko). Výsledný model je verejne dostupný pre ďalší výskum aj praktické využitie — nejde teda o uzavretý firemný produkt, ale o zdieľanú výskumnú infraštruktúru.
Prečo je slovenčina „chudobná“ reč pre stroje
Veľké jazykové modely sa neučia gramatiku zo slovníka pravidiel, ale štatisticky, z obrovského množstva textu. Aby model dokázal komunikovať gramaticky spoľahlivo, potrebuje pri trénovaní od úplnej nuly rádovo okolo jedného bilióna slov — a angličtina takéto množstvo textu na internete jednoducho má. Slovenčina nie.
Radovan Garabík z Jazykovedného ústavu SAV to vyčíslil takto: dlhodobo budovaný Slovenský národný korpus má v súčasnosti približne 1,5 miliardy slov. Väčší webový korpus dosahuje okolo 4 miliardy slov. Najväčším dostupným korpusom slovenských textov je paradoxne zbierka súdnych rozhodnutí s vyše 10 miliardami slov — čo ilustruje, koľko slovenských textov vôbec vzniká v podobe, ktorú možno strojovo spracovať, aj to, aké je odvetvové zloženie tejto zásoby. Ostatné dostupné korpusy sú výrazne menšie.
Riešením nie je nutne trénovať úplne nový model od nuly, čo by si vyžadovalo dáta, ktoré Slovensko jednoducho nemá. Ukazuje sa, že na „priučenie“ existujúceho, už vytrénovaného viacjazyčného modelu novému jazyku stačí podstatne menej — približne 5 miliárd slov, teda množstvo, ktorému sa veľkosť slovenského webového korpusu už reálne približuje. Presne túto cestu zvolil aj tím okolo Qwen3-14B-SK: namiesto stavania jazykového modelu od základov vzali existujúci otvorený model čínskej spoločnosti Alibaba a doladili ho na slovenských dátach — Slovenskom národnom korpuse, Slovníku slovenského jazyka a encyklopédii Beliana.
Ako to zhrnul Dobeš, globálne modely „často nedostatočne zachytávajú špecifiká menších jazykov“ — nedostatok sa prejavuje najmä pri témach úzko spätých so slovenským prostredím, akými sú história, spoločenské reálie, regionálne výrazy alebo odborná terminológia.
Prečo je to dôležité pre bežného človeka
Keď sa hovorí o „nízkozdrojových jazykoch“, väčšina ľudí si predstaví niečo vzdialené od ich každodenného života. V skutočnosti však ide o veľmi praktickú vec.
Ak používaš AI na preklad úradných dokumentov, písanie e-mailov, učenie sa jazyka, tvorbu obsahu alebo prácu s informáciami, kvalita modelu v slovenčine priamo ovplyvňuje, ako dobre ti pomôže. Zlé porozumenie kontextu, regionálnych výrazov, odbornej terminológie alebo gramatických špecifík môže viesť k chybám, nepresnostiam alebo dokonca k nevhodným formuláciám.
Model ako Qwen3-14B-SK nie je len „ďalší model“ – je to krok k tomu, aby AI dokázala lepšie rozumieť slovenským reáliám, histórii, právnym textom alebo lokálnym kontextom. Dlhodobo by to mohlo znamenať:
- lepšie preklady a sumarizácie úradných dokumentov,
- spoľahlivejšie chatboty pre verejné služby,
- presnejšie nástroje pre učiteľov, novinárov, právnikov a zdravotníkov,
- menšiu závislosť od veľkých zahraničných spoločností pri spracovaní citlivých dát v slovenčine.
Slovensko v širšom obraze
Za projektom Qwen3-14B-SK stojí spolupráca inštitúcie so 80-ročnou tradíciou a modernejších technických pracovísk. Jazykovedný ústav Ľudovíta Štúra SAV vznikol už v roku 1943 a dlhodobo je hlavným slovenským pracoviskom základného výskumu slovenského jazyka — autorom kľúčových slovníkov, pravopisných pravidiel aj Slovenského národného korpusu, ktorý dnes slúži ako trénovacie dáta pre modernú umelú inteligenciu. Práve táto kombinácia — desaťročia budovaná jazyková databáza plus súčasné strojové učenie — je dôvodom, prečo sa jazykovedci a informatici pri podobných projektoch nezaobídu jeden bez druhého.
Na strane výpočtovej infraštruktúry a strojového učenia stojí Ústav umelej inteligencie na FEI TUKE. Vedľa akademických pracovísk sa spracovaniu slovenčiny a širšie umelej inteligencii venuje aj Kempelen Institute of Intelligent Technologies (KInIT) — samostatný výskumný ústav mimo klasickej univerzitnej štruktúry, ktorý sa profiluje na dôveryhodnú a zodpovednú umelú inteligenciu.
Budúcnosť
Model s necelými 15 miliardami parametrov nie je a nemá ambíciu byť konkurentom najväčších svetových modelov, ktoré majú stovky miliárd až bilióny parametrov — je to skôr špecializovaný nástroj než univerzálny gigant. Jeho hodnota nespočíva v tom, že by vo všeobecných úlohách prekonal veľké globálne modely, ale v tom, že pri slovenčine — jazyku, ktorý je vo veľkých modeloch zastúpený rádovo stokrát menej než angličtina — ponúka spoľahlivejšie porozumenie kontextu, jazykových noriem a domácich reálií.
Skutočným testom bude až širšie používanie a nezávislé testovanie modelu mimo tímu, ktorý ho vytvoril. Otvorená zostáva aj otázka, do akej miery podobné projekty dokážu pravidelne pokračovať — tréning na superpočítačoch a spracovanie jazykových korpusov si vyžaduje opakovanú, nie jednorazovú investíciu, ak má slovenčina v ére umelej inteligencie držať krok s jazykmi, ktoré takýto nedostatok dát nemajú.
💡 Ako si vyskúšať slovenský AI model doma
Chcete AI, ktorá lepšie rozumie slovenčine a môže fungovať priamo vo vašom počítači?
Najjednoduchší spôsob (odporúčame):
1. Nainštalujte si nástroj na lokálne spúšťanie AI modelov, napríklad Ollama, LM Studio alebo inú aplikáciu podporujúcu formát GGUF.
2. Stiahnite si kvantizovanú verziu modelu Qwen3-14B-SK vo formáte GGUF.
Tento formát je určený na domáce spúšťanie — zachováva schopnosti modelu, ale výrazne znižuje nároky na pamäť.
Dostupné GGUF verzie nájdete napríklad na Hugging Face:
Qwen3-14B-SK GGUF modely
3. Otvorte model v podporovanej aplikácii a začnite chatovať v slovenčine.
Výhody:
Model beží priamo na vašom počítači.
Vaše otázky a odpovede nemusia odchádzať na cudzie servery.
Po stiahnutí modelu môžete pracovať aj bez internetového pripojenia.
Aký počítač potrebujete:
Qwen3-14B-SK má približne 15 miliárd parametrov. Na domáce používanie sa preto odporúčajú práve GGUF kvantizované verzie, ktoré znižujú nároky na pamäť.
12–16 GB VRAM: pohodlné používanie s vhodnou kvantizáciou,
16–32 GB RAM: možné spustenie aj bez výkonnej grafickej karty (pomalšie),
slabší počítač model spustí, ale odpovede budú generované pomalšie.
