IOAS sa podieľa na príprave dát a trénovaní jazykových modelov pre právny systém lexpetra.pro — od zberu a čistenia korpusov judikatúry, cez anotácie a obohacovanie rozhodnutí, až po vyhodnocovanie kvality modelov na dedikovaných GPU uzloch v Európskej únii.
Abstrakt
lexpetra.pro je právny informačný systém, ktorý advokátom, podnikovým právnikom a verejnej správe sprístupňuje judikatúru, právne predpisy a nástroje na prácu so zmluvami. Za jeho odpoveďami stoja jazykové modely — a tie sú presne také dobré, aké dobré sú dáta, na ktorých sú trénované a vyhodnocované.
IOAS zabezpečuje práve túto vrstvu: budovanie a čistenie právnych korpusov, anotačnú metodiku, obohacovanie rozhodnutí o strojovo čitateľné atribúty, trénovanie a dolaďovanie modelov a meranie ich kvality. Celé spracovanie prebieha na infraštruktúre v Európskej únii — v našom dátovom centre AIDAT.
1. Čo na projekte robíme
Zber a konsolidácia prameňov. Judikatúra slovenských súdov, konsolidované znenia právnych predpisov a rozhodnutia zahraničných a nadnárodných súdov — Českej republiky, Poľska, Nemecka, Rakúska, Súdneho dvora EÚ a Európskeho súdu pre ľudské práva. Zdroje sa líšia formátom, štruktúrou aj kvalitou; našou úlohou je previesť ich do jednej kanonickej databázy s jednotnou identifikáciou dokumentov.
Extrakcia a čistenie textu. Podstatná časť slovenských rozhodnutí je dostupná len ako naskenované alebo generované PDF. Texty extrahujeme, normalizujeme a kontrolujeme — bez čistého textu nemá zmysel spúšťať žiadny model.
Anotácie a obohacovanie. Ku každému rozhodnutiu dopĺňame strojovo čitateľné atribúty: právnu vetu (headnote), zhrnutie, oblasť práva, kľúčové slová, výsledok konania a ďalšie parametre, podľa ktorých sa dá judikatúra filtrovať a porovnávať. Obohacovanie beží dávkovo na GPU uzloch; každý výstup nesie mieru dôvery a záznamy pod stanoveným prahom idú do validačnej fronty na ľudskú kontrolu.
Trénovanie a dolaďovanie modelov. Nad pripravenými dátami trénujeme špecializované modely — napríklad klasifikátor stavu právnej vety, ktorý rozlišuje, či ide o nosný právny názor alebo o procesnú poznámku. Metodicky vychádzame z pravidlových (bootstrapovaných) označení odvodených priamo z výrokovej časti rozhodnutia; sú presnejšie než anotácie generované modelom a dávajú spoľahlivý referenčný bod.
Meranie kvality. Každá zmena modelu alebo promptu sa vyhodnocuje na pevnej testovacej sade s ručne overenými odpoveďami. Sledujeme nielen presnosť, ale aj podloženosť tvrdení zdrojom — teda či je konkrétna právna veta skutočne krytá textom rozhodnutia, na ktoré sa systém odvoláva.
2. Rozsah dát
Kanonická databáza pracuje s miliónmi rozhodnutí rozdelenými do samostatných vetiev podľa jurisdikcie a súdu. Kurátorský korpus s plnými textami tvorí jadro, nad ktorým prebieha obohacovanie; metadátová vrstva pokrýva podstatne širší záber a dopĺňa sa priebežne, ako sa darí získavať plné znenia.
Pri práci s takýmto objemom je rozhodujúca prevádzková disciplína: idempotentné a obnoviteľné spracovanie (beh sa dá kedykoľvek prerušiť a pokračovať), priebežné kontrolné body, nezávislý dohľad nad behom a kontrola integrity výstupov. Bez toho sa pri miliónoch dokumentov chyba prejaví až vtedy, keď je drahé ju opravovať.
3. Ochrana údajov
Do trénovania a obohacovania vstupujú výhradne verejne publikované rozhodnutia a právne predpisy. Klientske spisy, podania ani iné dôverné dokumenty používateľov systému sa na trénovanie nepoužívajú.
Spracovanie prebieha na dedikovaných uzloch na území Európskej únie — dáta neopúšťajú EÚ a neodovzdávajú sa verejným AI službám tretích strán. Prístupy k dátam sa auditujú a nasadenie zodpovedá základnému rámcu kontrol podľa GDPR a NIS2.
4. Prečo to robíme
Právo je oblasť, kde je cena nepresnej odpovede vysoká — nesprávne citovaná judikatúra alebo prehliadnutá zmena predpisu má priamy dopad na klienta. Vidíme preto zmysel v tom, aby na slovenskom a stredoeurópskom právnom materiáli vznikali modely, ktoré sú overiteľné, podložené zdrojom a prevádzkované v európskom právnom priestore — a nie postavené na uzavretých službách, do ktorých niet vidieť.
Skúsenosti z tohto projektu premietame aj do ďalších oblastí, kde sa spracúvajú citlivé dokumenty: verejná správa, zdravotníctvo a compliance.
5. Spolupráca
Pracujete na projekte, ktorý potrebuje kvalitné dáta pre jazykové modely — korpus, anotačnú metodiku, dolaďovanie alebo nezávislé vyhodnotenie kvality? Ozvite sa nám. Výpočtové kapacity a prostredie pre takúto prácu poskytujeme v rámci projektu AIDAT.