{"id":9440,"date":"2024-08-05T14:23:42","date_gmt":"2024-08-05T12:23:42","guid":{"rendered":"https:\/\/eurocc.nscc.sk\/?p=9440"},"modified":"2024-08-15T15:40:46","modified_gmt":"2024-08-15T13:40:46","slug":"vyuzitie-velkych-jazykovych-modelov-na-efektivnu-analyzu-nabozenskych-textov","status":"publish","type":"post","link":"https:\/\/eurocc.nscc.sk\/en\/vyuzitie-velkych-jazykovych-modelov-na-efektivnu-analyzu-nabozenskych-textov\/","title":{"rendered":"Leveraging LLMs for Efficient Religious Text Analysis"},"content":{"rendered":"\n<div class=\"is-layout-flow wp-block-group alignfull posts-all\"><div class=\"wp-block-group__inner-container\">\n<div class=\"is-layout-flex wp-container-4 wp-block-columns\">\n<div class=\"is-layout-flow wp-block-column\" style=\"flex-basis:60%\">\n<div class=\"is-layout-flow wp-block-group alignfull\"><div class=\"wp-block-group__inner-container\">\n<p><\/p>\n\n\n\n<p><\/p>\n\n\n\n<p><strong>Vyu\u017eitie ve\u013ek\u00fdch jazykov\u00fdch modelov na efekt\u00edvnu anal\u00fdzu n\u00e1bo\u017eensk\u00fdch textov<\/strong><\/p>\n\n\n\n<p>Anal\u00fdza a \u0161t\u00fadium textov s n\u00e1bo\u017eensk\u00fdmi t\u00e9mami boli historicky dom\u00e9nou filozofov, teol\u00f3gov a \u010fal\u0161\u00edch \u0161pecialistov v soci\u00e1lnych ved\u00e1ch. S pr\u00edchodom umelej inteligencie, konkr\u00e9tne ve\u013ek\u00fdch jazykov\u00fdch modelov, naber\u00e1 v\u00fdskum v tejto oblasti nov\u00e9 dimenzie. Tieto modern\u00e9 technol\u00f3gie m\u00f4\u017eu by\u0165 vyu\u017eit\u00e9 na odha\u013eovanie skryt\u00fdch nu\u00e1ns v n\u00e1bo\u017eensk\u00fdch textoch, \u010d\u00edm umo\u017e\u0148uj\u00fa hlb\u0161ie pochopenie r\u00f4znych symbolizmov a odhalenie v\u00fdznamov, ktor\u00e9 s\u00fa pre tieto texty charakteristick\u00e9 a m\u00f4\u017eu by\u0165 nejasn\u00e9. Tak\u00e9to zr\u00fdchlenie analytick\u00e9ho procesu umo\u017e\u0148uje v\u00fdskumn\u00edkom s\u00fastredi\u0165 sa len na \u0161pecifick\u00e9 aspekty textu relevantn\u00e9 pre ich v\u00fdskum.<\/p>\n<\/div><\/div>\n\n\n\n<p> <\/p>\n<\/div>\n\n\n\n<div class=\"is-layout-flow wp-block-column\"><div class=\"wp-block-image\">\n<figure class=\"aligncenter size-large\"><a href=\"https:\/\/eurocc.nscc.sk\/wp-content\/uploads\/2024\/08\/Snimka-obrazovky-2024-08-05-141247.png\"><img decoding=\"async\" loading=\"lazy\" width=\"1024\" height=\"741\" src=\"https:\/\/eurocc.nscc.sk\/wp-content\/uploads\/2024\/08\/Snimka-obrazovky-2024-08-05-141247-1024x741.png\" alt=\"\" class=\"wp-image-9456\" srcset=\"https:\/\/eurocc.nscc.sk\/wp-content\/uploads\/2024\/08\/Snimka-obrazovky-2024-08-05-141247-1024x741.png 1024w, https:\/\/eurocc.nscc.sk\/wp-content\/uploads\/2024\/08\/Snimka-obrazovky-2024-08-05-141247-300x217.png 300w, https:\/\/eurocc.nscc.sk\/wp-content\/uploads\/2024\/08\/Snimka-obrazovky-2024-08-05-141247-768x556.png 768w, https:\/\/eurocc.nscc.sk\/wp-content\/uploads\/2024\/08\/Snimka-obrazovky-2024-08-05-141247-18x12.png 18w, https:\/\/eurocc.nscc.sk\/wp-content\/uploads\/2024\/08\/Snimka-obrazovky-2024-08-05-141247.png 1173w\" sizes=\"(max-width: 1024px) 100vw, 1024px\" \/><\/a><\/figure><\/div><\/div>\n<\/div>\n\n\n\n<p>Jednou z \u00faloh, ktorou sa vedci v tejto oblasti zaoberaj\u00fa, je \u0161t\u00fadium diel autorov asociovan\u00fdch so \u0161pecifick\u00fdmi n\u00e1bo\u017eensk\u00fdmi skupinami a komunitami. Porovn\u00e1van\u00edm ich textov s ofici\u00e1lnymi doktr\u00ednami a u\u010deniami ich denomin\u00e1ci\u00ed m\u00f4\u017eu v\u00fdskumn\u00edci hlb\u0161ie nahliadnu\u0165 do presved\u010den\u00ed, viery a uhlov poh\u013eadu komun\u00edt, formovan\u00fdch u\u010deniami vplyvn\u00fdch autorov.<\/p>\n\n\n\n<p>\u0160t\u00fadia sumarizuje pr\u00edstup vyu\u017e\u00edvaj\u00faci embeddingov\u00e9 indexy a jazykov\u00e9 modely na efekt\u00edvnu anal\u00fdzu textov s n\u00e1bo\u017eensk\u00fdmi t\u00e9mami. Prim\u00e1rnym cie\u013eom je vyvin\u00fa\u0165 n\u00e1stroj na z\u00edskavanie inform\u00e1ci\u00ed, \u0161peci\u00e1lne navrhnut\u00fd na \u00fa\u010dinn\u00e9 lokalizovanie relevantn\u00fdch \u010dast\u00ed textu v dokumentoch. Identifik\u00e1cia nes\u00faladov medzi z\u00edskan\u00fdmi \u010das\u0165ami textu z diel n\u00e1bo\u017eensk\u00fdch komun\u00edt a ofici\u00e1lnymi n\u00e1ukami dan\u00e9ho n\u00e1bo\u017eenstva, z ktor\u00e9ho t\u00e1to komunita poch\u00e1dza, nie je cie\u013eom tejto pr\u00e1ce a je ponechan\u00e1 na teol\u00f3gov.<\/p>\n\n\n\n<p>T\u00e1to pr\u00e1ca vznikla spojen\u00fdm \u00fasil\u00edm N\u00e1rodn\u00e9ho superpo\u010d\u00edta\u010dov\u00e9ho centra a Teologickej fakulty Trnavskej univerzity. Na dosiahnutie rie\u0161enia, ktor\u00e9 vy\u017eadovalo numericky n\u00e1ro\u010dn\u00e9 spracovanie ve\u013ek\u00e9ho objemu d\u00e1t, boli vyu\u017eit\u00e9 v\u00fdpo\u010dtov\u00e9 zdroje HPC syst\u00e9mu Devana.<\/p>\n\n\n\n<p><strong>D\u00e1ta<\/strong><\/p>\n\n\n\n<p>Texty analyzovan\u00e9 v tejto \u0161t\u00fadii poch\u00e1dzaj\u00fa z n\u00e1bo\u017eenskej komunity zn\u00e1mej ako Hnutie Nazaret (be\u017ene naz\u00fdvanej aj \u201dBe\u0148ovci\u201d), ktor\u00e1 sa za\u010dala formova\u0165 v sedemdesiatych rokoch minul\u00e9ho storo\u010dia. Hnutie, o ktorom niektor\u00ed vedci hovoria, \u017ee m\u00e1 zn\u00e1mky sekty, je st\u00e1le akt\u00edvne aj v dne\u0161nej dobe, av\u0161ak v redukovanej a zmenenej forme. Jeho zakladate\u013e, J\u00e1n August\u00edn Be\u0148o (1921 &#8211; 2006), bol tajne vysv\u00e4ten\u00fdm katol\u00edckym k\u0148azom v totalitnej dobe. Be\u0148o nab\u00e1dal \u010dlenov hnutia k akt\u00edvnemu \u017eitiu viery prostredn\u00edctvom ka\u017edodenn\u00e9ho \u010d\u00edtania biblick\u00fdch textov a uplat\u0148ovania ich posolstva v praxi prostredn\u00edctvom konkr\u00e9tnych rozhodnut\u00ed a \u010dinov. Hnutie sa roz\u0161\u00edrilo po celom Slovensku, pri\u010dom komunity existovali takmer v ka\u017edom v\u00e4\u010d\u0161om meste. Roz\u0161\u00edrilo sa aj do susedn\u00fdch kraj\u00edn, ako Po\u013esko, \u010cesk\u00e1 republika, Ukrajina a Ma\u010farsko. V roku 2000 bolo v hnut\u00ed pribli\u017ene tristo man\u017eelsk\u00fdch p\u00e1rov, tis\u00edc deti a stotridsa\u0165 k\u0148azov a \u0161tudentov pripravuj\u00facich sa na k\u0148azstvo. Hnutie malo tri hlavn\u00e9 ciele: radik\u00e1lnu prevenciu v oblasti vzdelania, podporu k\u0148azov, ktor\u00ed by mohli p\u00f4sobi\u0165 ako rodi\u010dovsk\u00e9 postavy na identifik\u00e1ciu a rozvoj k\u0148azsk\u00fdch povolan\u00ed u det\u00ed, a v\u00fdrobu a distrib\u00faciu samizdatov\u00fdch materi\u00e1lov potrebn\u00fdch na katech\u00e9zu a evanjeliz\u00e1ciu.<\/p>\n\n\n\n<p>Pre v\u00fdskum bolo k dispoz\u00edcii 27 dokumentov vytvoren\u00fdch touto komunitou. Tieto dokumenty, ktor\u00e9 v\u00fdznamne vpl\u00fdvali na formovanie ideol\u00f3gie komunity Be\u0148ovci, boli reprodukovan\u00e9 a distribuovan\u00e9 po\u010das komunistick\u00e9ho re\u017eimu vo forme samizdatov &#8211; literat\u00fary zak\u00e1zanej komunistick\u00fdm re\u017eimom. Po politickom prevrate boli viacer\u00e9 z t\u00fdchto dokumentov vytla\u010den\u00e9 a distribuovan\u00e9 verejnosti mimo hnutia. V\u00e4\u010d\u0161ina z dokumentov pozost\u00e1vala z textov ur\u010den\u00fdch pre \u201drann\u00e9 \u00favahy\u201d \u2014 kr\u00e1tke medit\u00e1cie nad biblick\u00fdmi textami. Dokumenty taktie\u017e obsahovali zakladate\u013eove koment\u00e1re o u\u010deniach Katol\u00edckej cirkvi a vybran\u00fdch t\u00e9mach t\u00fdkaj\u00facich sa v\u00fdchovy det\u00ed, spiritu\u00e1lneho vedenia a katech\u00e9zy pre deti.<\/p>\n\n\n\n<p>Dokumenty obsahovali nieko\u013eko duplic\u00edt, av\u0161ak pre \u00falohu z\u00edskavania a vyh\u013ead\u00e1vania inform\u00e1ci\u00ed to nepredstavuje probl\u00e9m. V\u0161etky dokumenty s\u00fa nap\u00edsan\u00e9 v\u00fdhradne v slovenskom jazyku.<\/p>\n\n\n\n<p>Jeden z dokumentov bol anotovan\u00fd pre \u00fa\u010dely testovania expertom z partnerskej fakulty, ktor\u00fd sa dlhodobo venuje Hnutiu Nazaret. Anot\u00e1ciami mysl\u00edme \u010dasti textu (zvy\u010dajne odseky, pr\u00edpadne vety) ozna\u010den\u00e9 ako patriace do jednej z piatich tried, pri\u010dom tieto triedy reprezentuj\u00fa p\u00e4\u0165 t\u00e9m:<\/p>\n\n\n\n<ol type=\"1\">\n<li>Direkt\u00edvna poslu\u0161nos\u0165<\/li>\n\n\n\n<li>Hierarchick\u00e1 v\u00fdchova<\/li>\n\n\n\n<li>Radik\u00e1lnos\u0165 v prevzat\u00ed modelu \u017eivota<\/li>\n\n\n\n<li>\u013dudsk\u00e9 potreby realizovan\u00e9 len v spolo\u010denstve\/hnut\u00ed a v rodine<\/li>\n\n\n\n<li>Divn\u00e9\/\u010dudn\u00e9\/siln\u00e9<\/li>\n<\/ol>\n\n\n\n<p>Ka\u017ed\u00e1 z t\u00fdchto t\u00e9m je doplnen\u00e1 o s\u00fabor ot\u00e1zok (dopytov\/v\u00fdrazov), ktor\u00e9 boli navrhnut\u00e9 na testovanie rie\u0161enia z\u00edskavania inform\u00e1ci\u00ed. Cie\u013eom t\u00fdchto testovac\u00edch ot\u00e1zok je vyhodnoti\u0165, ko\u013eko relevantn\u00fdch \u010dast\u00ed textu t\u00fdkaj\u00facich sa danej t\u00e9my dok\u00e1\u017ee n\u00e1\u0161 n\u00e1stroj z\u00edska\u0165 z anotovan\u00e9ho dokumentu.<\/p>\n\n\n<div class=\"wp-block-image\">\n<figure class=\"aligncenter size-full is-resized\"><img decoding=\"async\" loading=\"lazy\" src=\"https:\/\/eurocc.nscc.sk\/wp-content\/uploads\/2024\/08\/Snimka-obrazovky-2024-08-05-135530.png\" alt=\"\" class=\"wp-image-9445\" width=\"610\" height=\"96\" srcset=\"https:\/\/eurocc.nscc.sk\/wp-content\/uploads\/2024\/08\/Snimka-obrazovky-2024-08-05-135530.png 857w, https:\/\/eurocc.nscc.sk\/wp-content\/uploads\/2024\/08\/Snimka-obrazovky-2024-08-05-135530-300x48.png 300w, https:\/\/eurocc.nscc.sk\/wp-content\/uploads\/2024\/08\/Snimka-obrazovky-2024-08-05-135530-768x122.png 768w, https:\/\/eurocc.nscc.sk\/wp-content\/uploads\/2024\/08\/Snimka-obrazovky-2024-08-05-135530-18x3.png 18w\" sizes=\"(max-width: 610px) 100vw, 610px\" \/><figcaption class=\"wp-element-caption\">Tabu\u013eka 1<\/figcaption><\/figure><\/div>\n\n\n<p><strong>Postup rie\u0161enia<\/strong><\/p>\n\n\n\n<p>Existuje viacero met\u00f3d vhodn\u00fdch na rie\u0161enie tejto \u00falohy, vr\u00e1tane klasifik\u00e1cie textu, modelovania t\u00e9my textu, RAG (z angl. Retrieval-Augmented Generation), alebo optimaliz\u00e1cie predtr\u00e9novan\u00e9ho jazykov\u00e9ho modelu. Av\u0161ak, po\u017eiadavkou partnersk\u00fdch teol\u00f3gov, zaoberaj\u00faci sa anal\u00fdzou t\u00fdchto dokumentov, bola identifik\u00e1cia konkr\u00e9tn\u00fdch \u010dast\u00ed textu relevantn\u00fdch k dan\u00fdm t\u00e9mam, a teda z\u00edskanie ich presn\u00e9ho znenia. Pr\u00e1ve preto bola vybran\u00e1 met\u00f3da z\u00edskavania inform\u00e1ci\u00ed (z angl. information retrieval). Tento pr\u00edstup sa l\u00ed\u0161i od met\u00f3dy RAG, ktor\u00e1 be\u017ene obsahuje \u010das\u0165 z\u00edskavania inform\u00e1ci\u00ed a tie\u017e \u010das\u0165 generovania nov\u00e9ho textu, v tom, \u017ee sa s\u00fastred\u00ed v\u00fdhradne na identifik\u00e1ciu relevantn\u00fdch \u010dast\u00ed textu v dokumentoch a negeneruje \u017eiadny nov\u00fd text.<\/p>\n\n\n\n<p>Met\u00f3da z\u00edskavania inform\u00e1ci\u00ed vyu\u017e\u00edva jazykov\u00e9 modely na transformovanie komplexn\u00fdch d\u00e1t, ako je text, do numerickej reprezent\u00e1cie, ktor\u00e1 zachyt\u00e1va cel\u00fd v\u00fdznam a kontext dan\u00e9ho vstupu. T\u00e1to numerick\u00e1 reprezent\u00e1cia, naz\u00fdvan\u00e1 embedding (vo zvy\u0161ku textu budeme kv\u00f4li jednoduchosti vyu\u017e\u00edva\u0165 u\u017e len tento term\u00edn), m\u00f4\u017ee by\u0165 pou\u017eit\u00e1 na s\u00e9mantick\u00e9 vyh\u013ead\u00e1vanie v dokumentoch analyzovan\u00edm poz\u00edci\u00ed a bl\u00edzkosti embeddingov v multidimenzion\u00e1lnom vektorovom priestore. Pou\u017eit\u00edm ot\u00e1zok (dopytov) dok\u00e1\u017ee syst\u00e9m n\u00e1js\u0165 v dokumentoch relevantn\u00e9 \u010dasti textu meran\u00edm podobnosti medzi embeddingami ot\u00e1zok a embeddingami segmentovan\u00e9ho textu. Tento pr\u00edstup nevy\u017eaduje \u017eiadnu optimaliz\u00e1ciu existuj\u00faceho jazykov\u00e9ho modelu, tak\u017ee modely m\u00f4\u017eu by\u0165 pou\u017eit\u00e9 bez ak\u00fdchko\u013evek \u00faprav a pracovan\u00fd postup zost\u00e1va pomerne jednoduch\u00fd.<\/p>\n\n\n\n<p><strong>V\u00fdber modelu<\/strong><\/p>\n\n\n\n<p>Ke\u010f\u017ee v\u0161etky analyzovan\u00e9 dokumenty v r\u00e1mci tejto \u0161t\u00fadie s\u00fa v slovenskom jazyku, je potrebn\u00e9, aby zvolen\u00fd jazykov\u00fd model \u201drozumel\u201d sloven\u010dine, \u010do zna\u010dne z\u00fa\u017eilo mo\u017enosti jeho v\u00fdberu. K dne\u0161n\u00e9mu d\u0148u existuje len jeden verejne dostupn\u00fd model, ktor\u00fd rozumie v\u00fdhradne slovensk\u00e9mu jazyku, a nieko\u013eko multilingv\u00e1lnych modelov, ktor\u00e9 rozumej\u00fa sloven\u010dine do ur\u010ditej miery. \u0160tyri predtr\u00e9novan\u00e9 modely boli vybran\u00e9 z mal\u00e9ho mno\u017estva dostupn\u00fdch mo\u017enost\u00ed, prv\u00fdm z nich je model Slovak-BERT . Slovak-BERT je verejne dostupn\u00fd model zalo\u017een\u00fd na architekt\u00fare transformerov. \u010eal\u0161\u00edm vybran\u00fdm modelom je text-embedding-3-small model. Ide o v\u00fdkonn\u00fd propriet\u00e1rny embedding model dostupn\u00fdm len cez API spolo\u010dnosti OpenAI. Tret\u00edm modelom je verejne dostupn\u00fd embedding model BGE M3 , ktor\u00fd je v\u00fdkonn\u00fdm multilingv\u00e1lnym modelom podporuj\u00facim viac ne\u017e 100 jazykov. Posledn\u00fdm modelom je taktie\u017e multilingv\u00e1lny model z dielne Microsoftu naz\u00fdvan\u00fd E5 , ktor\u00fd je rovnako verejne dostupn\u00fd.<\/p>\n\n\n\n<p>Tieto \u0161tyri modely boli pou\u017eit\u00e9 na z\u00edskanie vektorov\u00fdch reprezent\u00e1ci\u00ed textu. Ich v\u00fdkon bude detailne diskutovan\u00fd v nasleduj\u00facich \u010dastiach reportu.<\/p>\n\n\n\n<p><strong>Predspracovanie d\u00e1t<\/strong><\/p>\n\n\n\n<p>Prv\u00fdm krokom predspracovania d\u00e1t je segmentovanie textu (z angl. chunking). Hlavn\u00fdm d\u00f4vodom pre tento krok bolo splni\u0165 po\u017eiadavku teol\u00f3gov na vyh\u013ead\u00e1vanie (z\u00edskavanie) kr\u00e1tkych \u010dast\u00ed textu. Okrem toho bolo potrebn\u00e9 dokumenty rozdeli\u0165 na men\u0161ie \u010dasti, aj kv\u00f4li obmedzenej d\u013a\u017eke vstupu niektor\u00fdch jazykov\u00fdch modelov. Na t\u00fato \u00falohu bola pou\u017eit\u00e1 kni\u017enica Langchain . Poskytuje hierarchick\u00e9 segmentovanie textu, ktor\u00e9 produkuje prekr\u00fdvaj\u00face sa bloky textu definovanej d\u013a\u017eky (s definovan\u00fdm prekryt\u00edm) tak, aby v nich bol zachovan\u00fd kontext. Takto boli vytvoren\u00e9 bloky s d\u013a\u017ekami 300, 400, 500 a 700 znakov. N\u00e1sledne spracovanie pozost\u00e1valo z odstr\u00e1nenia diakritiky, \u00faprava textu na ve\u013ek\u00e9\/mal\u00e9 p\u00edsmen\u00e1, pod\u013ea podmienok modelov a odstr\u00e1nenie vyl\u00fa\u010den\u00fdch slov (z angl. stopwords). Odstra\u0148ovanie t\u00fdchto slov je be\u017enou praxou v \u00faloh\u00e1ch spracovania prirodzen\u00e9ho jazyka, ke\u010f\u017ee vyl\u00fa\u010den\u00e9 slov\u00e1 nenes\u00fa \u017eiadnu v\u00fdznamov\u00fa inform\u00e1ciu. Niektor\u00e9 modely m\u00f4\u017eu profitova\u0165 z odstr\u00e1nenia vyl\u00fa\u010den\u00fdch slov na zlep\u0161enie relevantnosti z\u00edskan\u00fdch blokov textu, ale in\u00e9 m\u00f4\u017eu \u0165a\u017ei\u0165 z ponechania t\u00fdchto slov, aby bol zachovan\u00fd cel\u00fd kontext nevyhnutn\u00fd na pochopenie textu.<\/p>\n\n\n<div class=\"wp-block-image\">\n<figure class=\"aligncenter size-full is-resized\"><img decoding=\"async\" loading=\"lazy\" src=\"https:\/\/eurocc.nscc.sk\/wp-content\/uploads\/2024\/08\/Snimka-obrazovky-2024-08-05-135739.png\" alt=\"\" class=\"wp-image-9447\" width=\"610\" height=\"271\" srcset=\"https:\/\/eurocc.nscc.sk\/wp-content\/uploads\/2024\/08\/Snimka-obrazovky-2024-08-05-135739.png 896w, https:\/\/eurocc.nscc.sk\/wp-content\/uploads\/2024\/08\/Snimka-obrazovky-2024-08-05-135739-300x134.png 300w, https:\/\/eurocc.nscc.sk\/wp-content\/uploads\/2024\/08\/Snimka-obrazovky-2024-08-05-135739-768x342.png 768w, https:\/\/eurocc.nscc.sk\/wp-content\/uploads\/2024\/08\/Snimka-obrazovky-2024-08-05-135739-18x8.png 18w\" sizes=\"(max-width: 610px) 100vw, 610px\" \/><figcaption class=\"wp-element-caption\">Tabu\u013eka 2<\/figcaption><\/figure><\/div>\n\n\n<p><strong>Vektorov\u00e9 embeddingy<\/strong><\/p>\n\n\n\n<p>Vektorov\u00e9 embeddingy boli vytvoren\u00e9 z blokov textu s pou\u017eit\u00edm vybran\u00fdch predtr\u00e9novan\u00fdch jazykov\u00fdch modelov.<\/p>\n\n\n\n<p>V pr\u00edpade modelu Slovak-BERT, sme pre generovanie embeddingov pou\u017eili model bez pridan\u00fdch predik\u010dn\u00fdch vrstiev, a n\u00e1sledne sme ukladali iba prv\u00fd embedding, ktor\u00fd obsahuje cel\u00fd v\u00fdznam vstupn\u00e9ho textu. \u010eal\u0161ie pou\u017e\u00edvan\u00e9 modely priamo produkuj\u00fa embeddingy vo vhodnej forme, preto nebolo potrebn\u00e9 \u017eiadne dodato\u010dn\u00e9 spracovanie v\u00fdstupov.<\/p>\n\n\n\n<p>V nasleduj\u00facej \u010dasti s v\u00fdsledkami analyzujeme v\u00fdkon v\u0161etk\u00fdch vybran\u00fdch embedding modelov a porovn\u00e1vame ich schopnosti zachyti\u0165 kontext.<\/p>\n\n\n\n<p><strong>V\u00fdsledky<\/strong><\/p>\n\n\n\n<p>Pred uskuto\u010dnen\u00edm kvantitat\u00edvnych testov pre\u0161li v\u0161etky embeddingov\u00e9 indexy predbe\u017en\u00fdm hodnoten\u00edm, aby sa zistila \u00farove\u0148 porozumenia slovensk\u00e9ho jazyka a \u0161pecifickej n\u00e1bo\u017eenskej terminol\u00f3gie evaluovan\u00fdch modelov. Predbe\u017en\u00e9 hodnotenie zah\u0155\u0148alo subjekt\u00edvne pos\u00fadenie relevantnosti z\u00edskan\u00fdch \u010dast\u00ed textu.<\/p>\n\n\n\n<p>Tieto testy odhalili, \u017ee embeddingy z\u00edskan\u00e9 pomocou modelu E5 nie s\u00fa dostato\u010dne efekt\u00edvne pre na\u0161e d\u00e1ta. Ke\u010f sme pomocou testovacej ot\u00e1zky h\u013eadali inform\u00e1cie v dokumentoch, v\u00e4\u010d\u0161ina z\u00edskan\u00fdch blokov textu obsahovala k\u013e\u00fa\u010dov\u00e9 slov\u00e1 pou\u017eit\u00e9 v ot\u00e1zke, ale neobsahovala kontext ot\u00e1zky. Mo\u017en\u00fdm vysvetlen\u00edm by mohlo by\u0165, \u017ee tento model uprednost\u0148uje zhody na \u00farovni slov pred zhodami kontextu v slovenskom jazyku. \u010eal\u0161\u00edm d\u00f4vodom m\u00f4\u017ee by\u0165 aj to, \u017ee tento model bol natr\u00e9novan\u00fd na d\u00e1tach, ktor\u00e9 neobsahovali ve\u013ek\u00e9 mno\u017estvo textu v sloven\u010dine, resp. v\u00fdber textov nebol dostato\u010dne rozmanit\u00fd, \u010do m\u00f4\u017ee vies\u0165 k ni\u017e\u0161iemu v\u00fdkonu modelu E5 v sloven\u010dine, aj ke\u010f v in\u00fdch jazykoch dosahuje v\u00fdborn\u00e9 v\u00fdsledky. Podot\u00fdkame, \u017ee tieto pozorovania nie s\u00fa definit\u00edvne z\u00e1very, ale sk\u00f4r hypot\u00e9zy zalo\u017een\u00e9 na s\u00fa\u010dasn\u00fdch, obmedzen\u00fdch v\u00fdsledkoch. Rozhodli sme sa \u010falej nevyhodnocova\u0165 v\u00fdkon embeddingov\u00fdch indexov z\u00edskan\u00fdch z E5 modelu, ke\u010f\u017ee je to irelevantn\u00e9 vzh\u013eadom na neschopnos\u0165 modelu zachyti\u0165 nuansy n\u00e1bo\u017eensk\u00e9ho textu. Na druhej strane, schopnosti modelu Slovak-BERT, ktor\u00fd je zalo\u017een\u00fd na architekt\u00fare RoBERTa charakteristickej jej relat\u00edvne jednoduchou topol\u00f3giou, prekonali o\u010dak\u00e1vania. Navy\u0161e, v\u00fdkon text-embedding-3-small a BGE M3 embeddingov splnil o\u010dak\u00e1vania, ke\u010f\u017ee prv\u00fd, subjekt\u00edvne vyhodnoten\u00fd, test uk\u00e1zal ve\u013emi dobr\u00e9 porozumenie kontextu a nu\u00e1ns v textoch s n\u00e1bo\u017eensk\u00fdmi t\u00e9mami a taktie\u017e v\u00fdborn\u00e9 porozumenie slovensk\u00e9ho jazyka.<\/p>\n\n\n\n<p>Preto boli kvantitat\u00edvne testy vykonan\u00e9 len pre vektorov\u00e9 datab\u00e1zy vyu\u017e\u00edvaj\u00face Slovak-BERT, OpenAI text-embedding-3-small a BGE M3 embeddingy.<\/p>\n\n\n\n<p>Vzh\u013eadom na povahu rie\u0161en\u00e9ho probl\u00e9mu a charakter testovac\u00edch anot\u00e1ci\u00ed existuje potenci\u00e1lna obava t\u00fdkaj\u00faca sa ich kvality. Niektor\u00e9 \u010dasti textu mohli by\u0165 nespr\u00e1vne klasifikovan\u00e9, preto\u017ee m\u00f4\u017eu patri\u0165 do viacer\u00fdch tried. T\u00e1to skuto\u010dnos\u0165, spolu s mo\u017enos\u0165ou \u013eudskej chyby, mohla ovplyvni\u0165 konzistentnos\u0165 a presnos\u0165 anot\u00e1ci\u00ed.<\/p>\n\n\n\n<p>Ber\u00fac do \u00favahy t\u00fato skuto\u010dnos\u0165, sme sa rozhodli zamera\u0165 v\u00fdhradne na vyhodnotenie metriky zvanej recall. Hodnotu tejto metriky meriame ako pomer po\u010dtu z\u00edskan\u00fdch blokov zhodn\u00fdch s anot\u00e1ciami, k celkov\u00e9mu po\u010dtu anotovan\u00fdch blokov textu (bez oh\u013eadu na podiel falo\u0161ne pozit\u00edvnych blokov). Recall vyhodnocujeme pre ka\u017ed\u00fa t\u00e9mu a pre v\u0161etky vektorov\u00e9 datab\u00e1zy s r\u00f4znymi d\u013a\u017ekami blokov textu.<\/p>\n\n\n\n<p>Komplexnos\u0165 a interpreta\u010dn\u00e1 povaha n\u00e1bo\u017eensk\u00fdch \u0161t\u00fadi\u00ed sa pravdepodobne prejavuje nielen v kvalite testovac\u00edch anot\u00e1ci\u00ed, ale aj v samotn\u00fdch testovac\u00edch ot\u00e1zkach. Ako pr\u00edklad m\u00f4\u017eeme uvies\u0165 testovaciu ot\u00e1zku \u201dBo\u017eia v\u00f4\u013ea\u201d pre t\u00e9mu Direkt\u00edvna poslu\u0161nos\u0165. Hoci pozorn\u00fd \u010ditate\u013e rozumie, ako t\u00e1to ot\u00e1zka s\u00favis\u00ed s danou t\u00e9mou, nemus\u00ed to by\u0165 o\u010dividn\u00e9 pre jazykov\u00fd model. Preto, okrem vyhodnotenia pomocou dodan\u00fdch testovac\u00edch ot\u00e1zok budeme vyhodnocova\u0165 v\u00fdkon embeddingov aj s pou\u017eit\u00edm \u010fal\u0161\u00edch ot\u00e1zok, ktor\u00e9 boli z\u00edskan\u00e9 met\u00f3dou kontextovej augment\u00e1cie. Kontextov\u00e1 augment\u00e1cia je technika v prompt in\u017einieringu pou\u017e\u00edvan\u00e1 na zlep\u0161enie kvality textov\u00fdch d\u00e1t a je dokumentovan\u00e1 vo viacer\u00fdch vedeck\u00fdch \u010dl\u00e1nkoch , . T\u00e1to technika spo\u010d\u00edva v tom, \u017ee sa zvolen\u00fd jazykov\u00fd model pou\u017eije na vytvorenie novej ot\u00e1zky (pr\u00edp. nov\u00e9ho textu) na z\u00e1klade p\u00f4vodnej ot\u00e1zky (textu) a doplnen\u00e9ho kontextu s cie\u013eom formulovania lep\u0161ej ot\u00e1zky. Jazykov\u00fd model pou\u017eit\u00fd na generovanie nov\u00fdch ot\u00e1zok pomocou tejto techniky bol GPT 3.5 a tieto ot\u00e1zky budeme \u010falej v texte ozna\u010dova\u0165 ako \u201dGPT ot\u00e1zky\u201d.<\/p>\n\n\n\n<p><strong>Slovak-BERT embeddingov\u00e9 indexy<\/strong><\/p>\n\n\n\n<p>Vyhodnotenie metriky recall pre embeddingov\u00e9 indexy vyu\u017e\u00edvaj\u00face Slovak-BERT embeddingy pre \u0161tyri r\u00f4zne ve\u013ekosti blokov textu s pou\u017eit\u00edm a bez pou\u017eitia met\u00f3dy odstra\u0148ovania vyl\u00fa\u010den\u00fdch slov je zobrazen\u00e9 na Obr\u00e1zku <a href=\"#fig:bert_graphs\">1<\/a>. Toto vyhodnotenie zah\u0155\u0148a ka\u017ed\u00fa z piatich t\u00e9m \u0161pecifikovan\u00fdch v \u010casti <a href=\"#sec:data\">2<\/a> a pokr\u00fdva p\u00f4vodn\u00e9 aj GPT ot\u00e1zky.<\/p>\n\n\n\n<p>Je o\u010dividn\u00e9, \u017ee GPT ot\u00e1zky produkuj\u00fa vo v\u0161eobecnosti lep\u0161ie v\u00fdsledky ne\u017e p\u00f4vodn\u00e9 ot\u00e1zky, okrem pr\u00edpadu posledn\u00fdch dvoch t\u00e9m, pri ktor\u00fdch obe sady ot\u00e1zok produkuj\u00fa podobn\u00e9 v\u00fdsledky. Je tie\u017e zrejm\u00e9, \u017ee Slovak-BERT embeddingy vo v\u00e4\u010d\u0161ine pr\u00edpadov profituj\u00fa z odstr\u00e1nenia vyl\u00fa\u010den\u00fdch slov. Najvy\u0161\u0161ia hodnota recall bola dosiahnut\u00e1 pre t\u00e9mu Radik\u00e1lnos\u0165 v prevzat\u00ed modelu \u017eivota, s ve\u013ekos\u0165ou blokov textu 700 znakov, s odstr\u00e1nen\u00fdmi vyl\u00fa\u010den\u00fdmi slovami, dosahuj\u00fac viac ne\u017e 47%. Na druhej strane, najhor\u0161ie v\u00fdsledky boli z\u00edskan\u00e9 pre t\u00e9mu Divn\u00e9\/\u010dudn\u00e9\/siln\u00e9, kde ani jedna sada ot\u00e1zok nedok\u00e1zala \u00faspe\u0161ne z\u00edska\u0165 relevantn\u00e9 \u010dast\u00ed textu z dokumentov. Dokonca, v niektor\u00fdch pr\u00edpadoch neboli z\u00edskane absol\u00fatne \u017eiadne relevantn\u00e9 bloky textov.<\/p>\n\n\n\n<p>Hodnoty recall pre v\u0161etky t\u00e9my vyhodnoten\u00e9 pomocou p\u00f4vodn\u00fdch aj GPT ot\u00e1zok (pre v\u0161etky sk\u00faman\u00e9 ve\u013ekosti blokov textu) pre embeddingy generovan\u00e9 modelom Slovak-BERT. Indexy embeddingov ozna\u010den\u00e9 ako +SW obsahuj\u00fa vyl\u00fa\u010den\u00e9 slov\u00e1, zatia\u013e \u010do -NoSW znamen\u00e1, \u017ee vyl\u00fa\u010den\u00e9 slov\u00e1 boli odstr\u00e1nen\u00e9.<\/p>\n\n\n<div class=\"wp-block-image\">\n<figure class=\"aligncenter size-large\"><a href=\"https:\/\/eurocc.nscc.sk\/wp-content\/uploads\/2024\/08\/Snimka-obrazovky-2024-08-05-140929.png\"><img decoding=\"async\" loading=\"lazy\" width=\"1024\" height=\"689\" src=\"https:\/\/eurocc.nscc.sk\/wp-content\/uploads\/2024\/08\/Snimka-obrazovky-2024-08-05-140929-1024x689.png\" alt=\"\" class=\"wp-image-9452\" srcset=\"https:\/\/eurocc.nscc.sk\/wp-content\/uploads\/2024\/08\/Snimka-obrazovky-2024-08-05-140929-1024x689.png 1024w, https:\/\/eurocc.nscc.sk\/wp-content\/uploads\/2024\/08\/Snimka-obrazovky-2024-08-05-140929-300x202.png 300w, https:\/\/eurocc.nscc.sk\/wp-content\/uploads\/2024\/08\/Snimka-obrazovky-2024-08-05-140929-768x517.png 768w, https:\/\/eurocc.nscc.sk\/wp-content\/uploads\/2024\/08\/Snimka-obrazovky-2024-08-05-140929-18x12.png 18w, https:\/\/eurocc.nscc.sk\/wp-content\/uploads\/2024\/08\/Snimka-obrazovky-2024-08-05-140929-1200x807.png 1200w, https:\/\/eurocc.nscc.sk\/wp-content\/uploads\/2024\/08\/Snimka-obrazovky-2024-08-05-140929.png 1295w\" sizes=\"(max-width: 1024px) 100vw, 1024px\" \/><\/a><figcaption class=\"wp-element-caption\">Obr\u00e1zok 1: Hodnoty recall pre v\u0161etky t\u00e9my vyhodnoten\u00e9 pomocou p\u00f4vodn\u00fdch aj GPT ot\u00e1zok (pre v\u0161etky sk\u00faman\u00e9 ve\u013ekosti blokov textu) pre embeddingy generovan\u00e9 modelom Slovak-BERT. Indexy embeddingov ozna\u010den\u00e9 ako +SW obsahuj\u00fa vyl\u00fa\u010den\u00e9 slov\u00e1, zatia\u013e \u010do -NoSW znamen\u00e1, \u017ee vyl\u00fa\u010den\u00e9 slov\u00e1 boli odstr\u00e1nen\u00e9.<\/figcaption><\/figure><\/div>\n\n\n<p><strong>OpenAI text-embedding-3-small embeddingov\u00e9 indexy<\/strong><\/p>\n\n\n\n<p>Analogicky k vyhodnoteniu Slovak-BERT embeddingov\u00fdch indexov, grafy s v\u00fdsledkami pre embeddingy z\u00edskan\u00e9 modelom text-embedding-3-small s\u00fa zobrazen\u00e9 na Obr\u00e1zku <a href=\"#fig:gpt_graphs\">2<\/a>. Hodnoty metriky recall s\u00fa v\u0161eobecne vy\u0161\u0161ie ne\u017e tie z\u00edskan\u00e9 so Slovak-BERT embeddingami. Podobne ako v predch\u00e1dzaj\u00facom pr\u00edpade, GPT ot\u00e1zky produkuj\u00fa lep\u0161ie v\u00fdsledky. Pozorovate\u013en\u00fd je taktie\u017e ist\u00fd trend medzi hodnotou metriky recall a ve\u013ekos\u0165ou textov\u00fdch blokov \u2014 dlh\u0161ie bloky textu zvy\u010dajne vykazuj\u00fa vy\u0161\u0161ie hodnoty recall.<\/p>\n\n\n\n<p>Zauj\u00edmav\u00e9 zistenie sa t\u00fdka t\u00e9my Radik\u00e1lnos\u0165 v prevzat\u00ed modelu \u017eivota. S pou\u017eit\u00edm p\u00f4vodn\u00fdch ot\u00e1zok sme nez\u00edskali takmer \u017eiadne relevantn\u00e9 v\u00fdsledky. Naopak, pri pou\u017eit\u00ed ot\u00e1zok generovan\u00fdch pomocou GPT modelu, boli hodnoty recall metriky v\u00fdrazne vy\u0161\u0161ie a dosahovali takmer 90% pre bloky textu s ve\u013ekos\u0165ou 700 znakov.<\/p>\n\n\n\n<p>\u010co sa t\u00fdka odstra\u0148ovania vyraden\u00fdch slov, vplyv tejto techniky na embeddingy sa l\u00ed\u0161i. Pre t\u00e9my 4 a 5 sa ukazuje, \u017ee odstr\u00e1nenie vyraden\u00fdch slov je prospe\u0161n\u00e9. Av\u0161ak, pre ostatn\u00e9 t\u00e9my tento krok v\u00fdhody neprin\u00e1\u0161a.<\/p>\n\n\n\n<p>T\u00e9my 4 a 5 vykazovali najslab\u0161ie v\u00fdsledky medzi v\u0161etk\u00fdmi t\u00e9mami. M\u00f4\u017ee to by\u0165 sp\u00f4soben\u00e9 povahou ot\u00e1zok pre tieto dve t\u00e9my, ke\u010f\u017ee s\u00fa to cit\u00e1ty a cel\u00e9 vety, na rozdiel od ot\u00e1zok pre ostatn\u00e9 t\u00e9my, ktor\u00e9 s\u00fa fr\u00e1zy, k\u013e\u00fa\u010dov\u00e9 slov\u00e1 alebo v\u00fdrazy. Zd\u00e1 sa, \u017ee model text-embedding-3-small funguje lep\u0161ie s fr\u00e1zovit\u00fdm typom ot\u00e1zok. Ale na druhej strane, ke\u010f\u017ee ot\u00e1zky pre t\u00e9my 4 a 5 s\u00fa cel\u00e9 vety, zd\u00e1 sa embeddingy profituj\u00fa z odstr\u00e1nenia vyraden\u00fdch slov, ke\u010f\u017ee v tomto pr\u00edpade to m\u00f4\u017ee pom\u00f4c\u0165 pri zachyten\u00ed kontextu v dlh\u00fdch ot\u00e1zkach.<\/p>\n\n\n\n<p>T\u00e9ma 4 je ve\u013emi \u0161pecifick\u00e1 a preto mo\u017eno vy\u017eaduje detailnej\u0161ie testovacie ot\u00e1zky, ke\u010f\u017ee poskytnut\u00e9 ot\u00e1zky pravdepodobne neobsahuj\u00fa v\u0161etky nuansy danej t\u00e9my. Naopak, t\u00e9ma 5 je ve\u013emi v\u0161eobecn\u00e1, v\u010faka \u010domu je celkom pochopite\u013en\u00e9, pre\u010do je zachyt\u00e1vanie kontextu tejto t\u00e9my pomocou embeddingov n\u00e1ro\u010dn\u00e9. V\u0161eobecn\u00fd charakter tejto t\u00e9my by mohol profitova\u0165 z in\u00e9ho analytick\u00e9ho pr\u00edstupu. Napr\u00edklad met\u00f3da anal\u00fdzy sentimentu by mohla zachyti\u0165 zvl\u00e1\u0161tnu, \u010dudn\u00fa a siln\u00fa n\u00e1ladu vo vz\u0165ahu k \u0161tudovan\u00fdm n\u00e1bo\u017eensk\u00fdm t\u00e9mam.<\/p>\n\n\n<div class=\"wp-block-image\">\n<figure class=\"aligncenter size-large\"><a href=\"https:\/\/eurocc.nscc.sk\/wp-content\/uploads\/2024\/08\/Snimka-obrazovky-2024-08-05-141247.png\"><img decoding=\"async\" loading=\"lazy\" width=\"1024\" height=\"741\" src=\"https:\/\/eurocc.nscc.sk\/wp-content\/uploads\/2024\/08\/Snimka-obrazovky-2024-08-05-141247-1024x741.png\" alt=\"\" class=\"wp-image-9456\" srcset=\"https:\/\/eurocc.nscc.sk\/wp-content\/uploads\/2024\/08\/Snimka-obrazovky-2024-08-05-141247-1024x741.png 1024w, https:\/\/eurocc.nscc.sk\/wp-content\/uploads\/2024\/08\/Snimka-obrazovky-2024-08-05-141247-300x217.png 300w, https:\/\/eurocc.nscc.sk\/wp-content\/uploads\/2024\/08\/Snimka-obrazovky-2024-08-05-141247-768x556.png 768w, https:\/\/eurocc.nscc.sk\/wp-content\/uploads\/2024\/08\/Snimka-obrazovky-2024-08-05-141247-18x12.png 18w, https:\/\/eurocc.nscc.sk\/wp-content\/uploads\/2024\/08\/Snimka-obrazovky-2024-08-05-141247.png 1173w\" sizes=\"(max-width: 1024px) 100vw, 1024px\" \/><\/a><figcaption class=\"wp-element-caption\">Obr\u00e1zok 2: Hodnoty recall vyhodnoten\u00e9 pre v\u0161etky t\u00e9my pomocou p\u00f4vodn\u00fdch aj GPT ot\u00e1zok, pre v\u0161etky embeddingov\u00e9 indexy generovan\u00e9 modelom text-embedding-3-small. Embeddingov\u00e9 indexy ozna\u010den\u00e9 +SW obsahuj\u00fa vyl\u00fa\u010den\u00e9 slov\u00e1, zatia\u013e \u010do indexy ozna\u010den\u00e9 -NoSW maj\u00fa vyl\u00fa\u010den\u00e9 slov\u00e1 odstr\u00e1nen\u00e9.<br><\/figcaption><\/figure><\/div>\n\n\n<p><strong>BGE M3 embeddingov\u00e9 indexy<\/strong><\/p>\n\n\n\n<p>Grafy s vyhodnotenou metrikou recall pre embeddingov\u00e9 indexy vyu\u017e\u00edvaj\u00face BGE M3 embeddingy s\u00fa zobrazen\u00e9 na Obr\u00e1zku <a href=\"#fig:bge_graphs\">3<\/a>. Tieto hodnoty ukazuj\u00fa v\u00fdkon spadaj\u00faci medzi Slovak-BERT a OpenAI text-embedding-3-small embeddingy. V niektor\u00fdch pr\u00edpadoch sa nepodarilo dosiahnu\u0165 tak\u00e9 vysok\u00e9 hodnoty metriky recall ako pri OpenAI embeddingoch, av\u0161ak BGE M3 embeddingy st\u00e1le vykazuj\u00fa konkurencieschopn\u00fd v\u00fdkon, hlavne ak prihliadneme na skuto\u010dnos\u0165, \u017ee sa jedn\u00e1 o verejne dostupn\u00fd model, na rozdiel od OpenAI embeddingov\u00e9ho modelu, ku ktor\u00e9mu sa d\u00e1 pristupova\u0165 len cez API, \u010do m\u00f4\u017ee by\u0165 niekedy probl\u00e9mom kv\u00f4li zdie\u013eaniu s\u00fakromn\u00fdch alebo citliv\u00fdch d\u00e1t a taktie\u017e kv\u00f4li finan\u010dn\u00fdm n\u00e1kladom.<\/p>\n\n\n\n<p>S t\u00fdmito embeddingami m\u00f4\u017eeme pozorova\u0165 rovnak\u00fd fenom\u00e9n ako s text-embedding-3-small embeddingami: kr\u00e1tke, fr\u00e1zovit\u00e9 ot\u00e1zky s\u00fa preferovan\u00e9 pred dlh\u0161\u00edmi ot\u00e1zkami pod\u00e1van\u00fdmi formou viet a cit\u00e1tov. Preto s\u00fa hodnoty recall pre prv\u00e9 tri t\u00e9my vy\u0161\u0161ie, ako sme diskutovali u\u017e v predch\u00e1dzaj\u00facej \u010dasti.<\/p>\n\n\n\n<p>Odstr\u00e1nenie vyl\u00fa\u010den\u00fdch slov sa zd\u00e1 by\u0165 u\u017eito\u010dn\u00e9, hlavne pre posledn\u00e9 dve t\u00e9my.<\/p>\n\n\n<div class=\"wp-block-image\">\n<figure class=\"aligncenter size-large\"><a href=\"https:\/\/eurocc.nscc.sk\/wp-content\/uploads\/2024\/08\/Snimka-obrazovky-2024-08-05-141157.png\"><img decoding=\"async\" loading=\"lazy\" width=\"1024\" height=\"753\" src=\"https:\/\/eurocc.nscc.sk\/wp-content\/uploads\/2024\/08\/Snimka-obrazovky-2024-08-05-141157-1024x753.png\" alt=\"\" class=\"wp-image-9455\" srcset=\"https:\/\/eurocc.nscc.sk\/wp-content\/uploads\/2024\/08\/Snimka-obrazovky-2024-08-05-141157-1024x753.png 1024w, https:\/\/eurocc.nscc.sk\/wp-content\/uploads\/2024\/08\/Snimka-obrazovky-2024-08-05-141157-300x221.png 300w, https:\/\/eurocc.nscc.sk\/wp-content\/uploads\/2024\/08\/Snimka-obrazovky-2024-08-05-141157-768x565.png 768w, https:\/\/eurocc.nscc.sk\/wp-content\/uploads\/2024\/08\/Snimka-obrazovky-2024-08-05-141157-16x12.png 16w, https:\/\/eurocc.nscc.sk\/wp-content\/uploads\/2024\/08\/Snimka-obrazovky-2024-08-05-141157.png 1181w\" sizes=\"(max-width: 1024px) 100vw, 1024px\" \/><\/a><figcaption class=\"wp-element-caption\">Obr\u00e1zok 3: Hodnoty metriky recall pre v\u0161etky t\u00e9my z\u00edskan\u00e9 s pou\u017eit\u00edm p\u00f4vodn\u00fdch aj GPT ot\u00e1zok pre embeddingy vytovren\u00e9 modelom BGE M3. Zna\u010dky +SW ozna\u010duj\u00fa indexy obsahuj\u00face vyl\u00fa\u010den\u00e9 slov\u00e1, zatia\u013e\u010do -NoSW indikuje, \u017ee vyl\u00fa\u010den\u00e9 slov\u00e1 boli v dan\u00fdch indexoch odstr\u00e1nen\u00e9.<\/figcaption><\/figure><\/div>\n\n\n<p><\/p>\n\n\n\n<p><strong>Z\u00e1ver<\/strong><\/p>\n\n\n\n<p>\u0160t\u00fadia prezentuje pr\u00edstup pre anal\u00fdzu textov s n\u00e1bo\u017eensk\u00fdmi t\u00e9mami pomocou numerick\u00fdch reprezent\u00e1ci\u00ed textu zvan\u00fdch embeddingy, generovan\u00fdmi troma vybran\u00fdmi predtr\u00e9novan\u00fdmi jazykov\u00fdmi modelmi: Slovak-BERT, OpenAI text-embedding-3-small a BGE M3 model. V\u00fdberu modelov predch\u00e1dzalo pos\u00fadenie ich schopnosti \u201drozumie\u0165 sloven\u010dine\u201d a n\u00e1bo\u017eenskej terminol\u00f3gii. Pre zvolen\u00e9 tri modely sme kon\u0161tatovali dostato\u010dn\u00fa schopnos\u0165, \u010do ich predur\u010dilo ako vhodn\u00fdch kandid\u00e1tov na zvl\u00e1dnutie \u00falohy z\u00edskavania inform\u00e1ci\u00ed z danej sady dokumentov.<\/p>\n\n\n\n<p>V\u00fdzvy t\u00fdkaj\u00face sa kvality testovac\u00edch ot\u00e1zok boli adresovan\u00e9 pomocou techniky kontextovej augment\u00e1cie. Tento pr\u00edstup pomohol pri formulovan\u00ed vhodnej\u0161\u00edch ot\u00e1zok, \u010do viedlo k z\u00edskavaniu relevantnej\u0161\u00edch \u010dast\u00ed textu, ktor\u00e9 zachyt\u00e1vali v\u0161etky nuansy t\u00e9m, ktor\u00e9 teol\u00f3govia v texte h\u013eadaj\u00fa.<\/p>\n\n\n\n<p>V\u00fdsledky demon\u0161truj\u00fa, \u017ee efekt\u00edvnos\u0165 embeddingov generovan\u00fdch t\u00fdmito modelmi, hlavne modelom text-embedding-3-small od OpenAI, je dostato\u010dn\u00e1 na hlbok\u00e9 porozumenie kontextu, aj v slovenskom jazyku. Hodnoty metriky recall pre embeddingy tohto modelu sa l\u00ed\u0161ia v z\u00e1vislosti od t\u00e9my a pou\u017eit\u00fdch testovac\u00edch ot\u00e1zok, pri\u010dom najlep\u0161ia hodnota bola dosiahnut\u00e1 pre t\u00e9mu Radik\u00e1lnos\u0165 v prevzat\u00ed modelu \u017eivota dosahuj\u00fac takmer 90%, s pou\u017eit\u00edm GPT ot\u00e1zok a d\u013a\u017eky textov\u00fdch blokov 700&nbsp;znakov. Vo v\u0161eobecnosti, text-embedding-3-small model mal najlep\u0161ie v\u00fdsledky s najv\u00e4\u010d\u0161ou analyzovanou d\u013a\u017ekou blokov textu, vykazuj\u00fac mierny trend zvy\u0161uj\u00facej sa hodnoty recall so zv\u00e4\u010d\u0161uj\u00facou sa d\u013a\u017ekou blokov textu. T\u00e9ma Divn\u00e9\/\u010dudn\u00e9\/siln\u00e9 mala najni\u017e\u0161iu hodnotu recall, \u010do m\u00f4\u017ee by\u0165 d\u00f4sledkom neur\u010ditosti v \u0161pecifik\u00e1cii tejto t\u00e9my.<\/p>\n\n\n\n<p>Pre Slovak-BERT embeddingov\u00e9 indexy s\u00fa hodnoty recall o nie\u010do ni\u017e\u0161ie, ale st\u00e1le pomerne p\u00f4sobiv\u00e9 vzh\u013eadom na jednoduchos\u0165 tohto jazykov\u00e9ho modelu. Lep\u0161ie v\u00fdsledky boli z\u00edskan\u00e9 v pou\u017eit\u00edm GPT ot\u00e1zok, s najlep\u0161ou hodnotou 47,1%&nbsp;pre t\u00e9mu Radik\u00e1lnos\u0165 v prevzat\u00ed modelu \u017eivota s d\u013a\u017ekou blokov 700 znakov, a s embeddingami vytvoren\u00fdmi z textu s odstr\u00e1nen\u00fdmi vyl\u00fa\u010den\u00fdmi slovami. Celkovo, tento model najviac \u0165a\u017eil z odstra\u0148ovania vyl\u00fa\u010den\u00fdch slov.<\/p>\n\n\n\n<p>\u010co sa t\u00fdka BGE M3 embeddingov, v\u00fdsledky boli taktie\u017e ve\u013emi dobr\u00e9, dosahuj\u00fac vysok\u00fa hodnotu recall metriky, aj ke\u010f nie a\u017e tak\u00fa vysok\u00fa ako v pr\u00edpade OpenAI embeddingov. Ale vzh\u013eadom na to, \u017ee BGE M3 je verejne dostupn\u00fd model, s\u00fa tieto v\u00fdsledky pozoruhodn\u00e9.<\/p>\n\n\n\n<p>Tieto zistenia zd\u00f4raz\u0148uj\u00fa potenci\u00e1l vyu\u017eitia ve\u013ek\u00fdch jazykov\u00fdch modelov pre \u0161pecializovan\u00e9 oblasti ako anal\u00fdza textu s n\u00e1bo\u017eensk\u00fdmi t\u00e9mami. V\u00fdskum by sa \u010falej mohol zaobera\u0165 zhlukovan\u00edm embeddingov za \u00fa\u010delom odhalenia asoci\u00e1ci\u00ed a in\u0161pir\u00e1ci\u00ed autorov t\u00fdchto diel. Pre teol\u00f3gov, bud\u00faca pr\u00e1ca spo\u010d\u00edva v anal\u00fdze z\u00edskan\u00fdch \u010dast\u00ed textu s cie\u013eom identifikova\u0165 odch\u00fdlky od ofici\u00e1lneho u\u010denia Katol\u00edckej cirkvi, \u010d\u00edm sa objasnia interpret\u00e1cie a poh\u013eady hnutia.<\/p>\n\n\n\n<p><strong>Po\u010fakovanie<\/strong><\/p>\n\n\n\n<p>V\u00fdskum bol realizovan\u00fd s podporou N\u00e1rodn\u00e9ho kompeten\u010dn\u00e9ho centra pre HPC, projektu EuroCC 2 a N\u00e1rodn\u00e9ho Superpo\u010d\u00edta\u010dov\u00e9ho Centra na z\u00e1klade dohody o grante 101101903-EuroCC 2-DIGITAL-EUROHPC-JU-2022-NCC-01.<\/p>\n\n\n\n<p>V\u00fdskum bol realizovan\u00fd s vyu\u017eit\u00edm v\u00fdpo\u010dtovej infra\u0161trukt\u00fary obstaranej v projekte N\u00e1rodn\u00e9 kompeten\u010dn\u00e9 centrum pre vysokov\u00fdkonn\u00e9 po\u010d\u00edtanie (k\u00f3d projektu: 311070AKF2) financovan\u00e9ho z Eur\u00f3pskeho fondu region\u00e1lneho rozvoja, \u0160truktur\u00e1lnych fondov EU Informatiz\u00e1cia spolo\u010dnosti, opera\u010dn\u00e9ho programu Integrovan\u00e1 infra\u0161trukt\u00fara 2014-2020.<\/p>\n\n\n\n<p><a href=\"https:\/\/eurocc.nscc.sk\/wp-content\/uploads\/2024\/08\/benovci_final_sk-1.pdf\">Pln\u00e1 verzia \u010dl\u00e1nku SK<\/a><a href=\"https:\/\/eurocc.nscc.sk\/wp-content\/uploads\/2024\/08\/benovci_final_sk.pdf\"><br><\/a><a href=\"https:\/\/eurocc.nscc.sk\/wp-content\/uploads\/2024\/08\/benovci_final_en.pdf\">Pln\u00e1 verzia \u010dl\u00e1nku EN<\/a><\/p>\n\n\n\n<p><strong>Autori<\/strong><\/p>\n\n\n\n<p>Bibi\u00e1na Laj\u010dinov\u00e1 &#8211; N\u00e1rodn\u00e9 superpo\u010d\u00edta\u010dov\u00e9 centrum<br>Jozef \u017duffa &#8211; Teologick\u00e1 fakulta Trnavskej univerzity v Trnave<br>Milan Urban\u010dok &#8211; Teologick\u00e1 fakulta Trnavskej univerzity v Trnave<\/p>\n\n\n\n<p><strong>Literat\u00fara<\/strong><\/p>\n\n\n\n<p>[1] Mat\u00fa\u0161 Pikuliak, \u0160tefan Grivalsk\u00fd, Martin Kon\u00f4pka, Miroslav Bl\u0161\u0165\u00e1k, Martin Tamajka, Viktor Bachrat\u00fd, Mari\u00e1n \u0160imko, Pavol Bal\u00e1\u017eik, Michal Trnka, and Filip Uhl\u00e1rik. Slovakbert: Slovak masked language model, 2021.<\/p>\n\n\n\n<p>[2] Jianlv Chen, Shitao Xiao, Peitian Zhang, Kun Luo, Defu Lian, and Zheng Liu. Bge m3-embedding: Multi-lingual, multi-functionality, multi-granularity text embeddings through self-knowledge distillation, 2024.<\/p>\n\n\n\n<p>[3] Liang Wang, Nan Yang, Xiaolong Huang, Linjun Yang, Rangan Majumder, and Furu Wei. Multi-lingual e5 text embeddings: A technical report, 2024.<\/p>\n\n\n\n<p>[4] Harrison Chase. Langchain. <a href=\"https:\/\/github.com\/langchain-ai\/langchain\">https:\/\/github.com\/langchain-ai\/langchain<\/a>, 2022. Accessed: May 2024.<\/p>\n\n\n\n<p>[5] Xinbei Ma, Yeyun Gong, Pengcheng He, Hai Zhao, and Nan Duan. Query rewriting for retrieval-augmented large language models, 2023.<\/p>\n\n\n\n<p>[6] Rolf Jagerman, Honglei Zhuang, Zhen Qin, Xuanhui Wang, and Michael Bendersky. Query expansion by prompting large language models, 2023.<\/p>\n\n\n\n<h5><br><\/h5>\n\n\n\n<div class=\"is-horizontal is-content-justification-center is-layout-flex wp-container-5 wp-block-buttons\">\n<div class=\"wp-block-button\"><a class=\"wp-block-button__link wp-element-button\" href=\"\/success-stories\">Success-Stories<\/a><\/div>\n<\/div>\n\n\n<div class=\"display-posts-listing grid\"><div class=\"listing-item\"><a class=\"image\" href=\"https:\/\/eurocc.nscc.sk\/en\/ked-hmla-necakane-udrie\/\"><img width=\"300\" height=\"167\" src=\"https:\/\/eurocc.nscc.sk\/wp-content\/uploads\/2026\/08\/Gemini_Generated_Image_2v4sdu2v4sdu2v4s-300x167.jpg\" class=\"attachment-medium size-medium wp-post-image\" alt=\"\" decoding=\"async\" loading=\"lazy\" srcset=\"https:\/\/eurocc.nscc.sk\/wp-content\/uploads\/2026\/08\/Gemini_Generated_Image_2v4sdu2v4sdu2v4s-300x167.jpg 300w, https:\/\/eurocc.nscc.sk\/wp-content\/uploads\/2026\/08\/Gemini_Generated_Image_2v4sdu2v4sdu2v4s-1024x572.jpg 1024w, https:\/\/eurocc.nscc.sk\/wp-content\/uploads\/2026\/08\/Gemini_Generated_Image_2v4sdu2v4sdu2v4s-768x429.jpg 768w, https:\/\/eurocc.nscc.sk\/wp-content\/uploads\/2026\/08\/Gemini_Generated_Image_2v4sdu2v4sdu2v4s-18x10.jpg 18w, https:\/\/eurocc.nscc.sk\/wp-content\/uploads\/2026\/08\/Gemini_Generated_Image_2v4sdu2v4sdu2v4s-1200x670.jpg 1200w, https:\/\/eurocc.nscc.sk\/wp-content\/uploads\/2026\/08\/Gemini_Generated_Image_2v4sdu2v4sdu2v4s.jpg 1376w\" sizes=\"(max-width: 300px) 100vw, 300px\" \/><\/a> <a class=\"title\" href=\"https:\/\/eurocc.nscc.sk\/en\/ked-hmla-necakane-udrie\/\">Ke\u010f hmla ne\u010dakane udrie<\/a> <span class=\"date\">22 Aug<\/span> <span class=\"excerpt-dash\">-<\/span> <span class=\"excerpt\">Ako v\u010das odhali\u0165 hmlu ako \u201enevidite\u013en\u00fa\u201c hrozbu sk\u00f4r, ne\u017e ochrom\u00ed na\u0161e cesty?<\/span><\/div><div class=\"listing-item\"><a class=\"image\" href=\"https:\/\/eurocc.nscc.sk\/en\/stop-digitalnym-pochlebovacom\/\"><img width=\"282\" height=\"300\" src=\"https:\/\/eurocc.nscc.sk\/wp-content\/uploads\/2026\/08\/Gemini_Generated_Image_u7pb5au7pb5au7pb-1-scaled-e1786916429981-282x300.jpg\" class=\"attachment-medium size-medium wp-post-image\" alt=\"\" decoding=\"async\" loading=\"lazy\" srcset=\"https:\/\/eurocc.nscc.sk\/wp-content\/uploads\/2026\/08\/Gemini_Generated_Image_u7pb5au7pb5au7pb-1-scaled-e1786916429981-282x300.jpg 282w, https:\/\/eurocc.nscc.sk\/wp-content\/uploads\/2026\/08\/Gemini_Generated_Image_u7pb5au7pb5au7pb-1-scaled-e1786916429981-963x1024.jpg 963w, https:\/\/eurocc.nscc.sk\/wp-content\/uploads\/2026\/08\/Gemini_Generated_Image_u7pb5au7pb5au7pb-1-scaled-e1786916429981-768x817.jpg 768w, https:\/\/eurocc.nscc.sk\/wp-content\/uploads\/2026\/08\/Gemini_Generated_Image_u7pb5au7pb5au7pb-1-scaled-e1786916429981-11x12.jpg 11w, https:\/\/eurocc.nscc.sk\/wp-content\/uploads\/2026\/08\/Gemini_Generated_Image_u7pb5au7pb5au7pb-1-scaled-e1786916429981-1200x1276.jpg 1200w, https:\/\/eurocc.nscc.sk\/wp-content\/uploads\/2026\/08\/Gemini_Generated_Image_u7pb5au7pb5au7pb-1-scaled-e1786916429981.jpg 1312w\" sizes=\"(max-width: 282px) 100vw, 282px\" \/><\/a> <a class=\"title\" href=\"https:\/\/eurocc.nscc.sk\/en\/stop-digitalnym-pochlebovacom\/\">Stop digit\u00e1lnym pochlebova\u010dom<\/a> <span class=\"date\">16 Aug<\/span> <span class=\"excerpt-dash\">-<\/span> <span class=\"excerpt\">Vedky\u0148a pomocou superpo\u010d\u00edta\u010da prelomila zvyk modelov AI len pr\u00e1zdne chv\u00e1li\u0165 a nau\u010dila ich d\u00e1va\u0165 \u00faprimn\u00fa, kritick\u00fa sp\u00e4tn\u00fa v\u00e4zbu<\/span><\/div><div class=\"listing-item\"><a class=\"image\" href=\"https:\/\/eurocc.nscc.sk\/en\/odvratena-strana-hier\/\"><img width=\"300\" height=\"164\" src=\"https:\/\/eurocc.nscc.sk\/wp-content\/uploads\/2026\/07\/Gemini_Generated_Image_ln32f2ln32f2ln32-300x164.png\" class=\"attachment-medium size-medium wp-post-image\" alt=\"\" decoding=\"async\" loading=\"lazy\" srcset=\"https:\/\/eurocc.nscc.sk\/wp-content\/uploads\/2026\/07\/Gemini_Generated_Image_ln32f2ln32f2ln32-300x164.png 300w, https:\/\/eurocc.nscc.sk\/wp-content\/uploads\/2026\/07\/Gemini_Generated_Image_ln32f2ln32f2ln32-1024x559.png 1024w, https:\/\/eurocc.nscc.sk\/wp-content\/uploads\/2026\/07\/Gemini_Generated_Image_ln32f2ln32f2ln32-768x419.png 768w, https:\/\/eurocc.nscc.sk\/wp-content\/uploads\/2026\/07\/Gemini_Generated_Image_ln32f2ln32f2ln32-1536x838.png 1536w, https:\/\/eurocc.nscc.sk\/wp-content\/uploads\/2026\/07\/Gemini_Generated_Image_ln32f2ln32f2ln32-2048x1117.png 2048w, https:\/\/eurocc.nscc.sk\/wp-content\/uploads\/2026\/07\/Gemini_Generated_Image_ln32f2ln32f2ln32-18x10.png 18w, https:\/\/eurocc.nscc.sk\/wp-content\/uploads\/2026\/07\/Gemini_Generated_Image_ln32f2ln32f2ln32-1200x655.png 1200w, https:\/\/eurocc.nscc.sk\/wp-content\/uploads\/2026\/07\/Gemini_Generated_Image_ln32f2ln32f2ln32-1980x1080.png 1980w\" sizes=\"(max-width: 300px) 100vw, 300px\" \/><\/a> <a class=\"title\" href=\"https:\/\/eurocc.nscc.sk\/en\/odvratena-strana-hier\/\">Odvr\u00e1ten\u00e1 strana bezplatn\u00fdch hier<\/a> <span class=\"date\">11 Jul<\/span> <span class=\"excerpt-dash\">-<\/span> <span class=\"excerpt\">Ako slovensk\u00fd t\u00edm s pomocou superpo\u010d\u00edta\u010da vyrie\u0161il r\u00e9bus extr\u00e9mne vz\u00e1cneho spr\u00e1vania hr\u00e1\u010dov<\/span><\/div><\/div>\n<\/div><\/div>\n","protected":false},"excerpt":{"rendered":"<p>The analysis and research of texts with religious themes have historically been the domain of philosophers, theologians, and other social sciences specialists. With the advent of artificial intelligence, such as the large language models (LLMs), this task takes on new dimensions. These technologies can be leveraged to reveal various insights and nuances contained in religious texts \u2014 interpreting their symbolism and uncovering their meanings. This acceleration of the analytical process allows researchers to focus on specific aspects of texts relevant to their studies.<\/p>","protected":false},"author":2,"featured_media":9455,"comment_status":"closed","ping_status":"closed","sticky":false,"template":"templates\/template-full-width.php","format":"standard","meta":[],"categories":[9,1],"tags":[],"_links":{"self":[{"href":"https:\/\/eurocc.nscc.sk\/en\/wp-json\/wp\/v2\/posts\/9440"}],"collection":[{"href":"https:\/\/eurocc.nscc.sk\/en\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/eurocc.nscc.sk\/en\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/eurocc.nscc.sk\/en\/wp-json\/wp\/v2\/users\/2"}],"replies":[{"embeddable":true,"href":"https:\/\/eurocc.nscc.sk\/en\/wp-json\/wp\/v2\/comments?post=9440"}],"version-history":[{"count":29,"href":"https:\/\/eurocc.nscc.sk\/en\/wp-json\/wp\/v2\/posts\/9440\/revisions"}],"predecessor-version":[{"id":9508,"href":"https:\/\/eurocc.nscc.sk\/en\/wp-json\/wp\/v2\/posts\/9440\/revisions\/9508"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/eurocc.nscc.sk\/en\/wp-json\/wp\/v2\/media\/9455"}],"wp:attachment":[{"href":"https:\/\/eurocc.nscc.sk\/en\/wp-json\/wp\/v2\/media?parent=9440"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/eurocc.nscc.sk\/en\/wp-json\/wp\/v2\/categories?post=9440"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/eurocc.nscc.sk\/en\/wp-json\/wp\/v2\/tags?post=9440"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}