Bezpečnosť údajov pri implementácii AI: čo možno zdieľať s modelmi a čo nie
Najčastejšia otázka od manažérov: kam pôjdu naše údaje? Analyzujeme možnosti umiestnenia údajov, čo možno zdieľať s externými modelmi a ako zabrániť únikom.
Stručne, ak nemáte čas čítať všetko
- ✓Najprv klasifikujte údaje: čo je verejné, čo interné, čo osobné alebo obchodné tajomstvo.
- ✓Obchodné API veľkých poskytovateľov a verejný chat podliehajú rôznym podmienkam používania údajov.
- ✓Najcitlivejšie údaje je možné spracovávať pomocou miestnych modelov, bez opustenia vášho prostredia.
- ✓Práva prístupu, anonymizácia a akčné protokoly sú dôležitejšie ako výber konkrétneho modelu.
„A kam pôjdu naše dáta?“ Túto otázku počúvame na každom prvom stretnutí. A je to správne. Lebo to najhoršie, čo môžete urobiť, je skopírovať zmluvu s klientom do verejného chatbota „len aby z toho spravil stručné zhrnutie“.
Poďme sa pozrieť na to, ako sa to robí správne.
1. Začnite klasifikáciou dát
Nie všetky dáta sú rovnaké. Skôr než čokoľvek automatizujete, roztrieďte si ich:
- Verejné: katalóg, ceny na webe, otvorené články. Tu riziká takmer neexistujú.
- Interné: smernice, návody, komunikácia. Ak uniknú, je to nepríjemné, ale nie katastrofa.
- Osobné údaje: mená, telefónne čísla, adresy klientov a zamestnancov. Tu platí zákon a treba s nimi zaobchádzať podľa pravidiel.
- Obchodné tajomstvo: ceny pre kľúčových klientov, finančné výkazy, podmienky zmlúv. Najcitlivejšia kategória.
Pre každú kategóriu platia vlastné pravidlá. A tie treba nastaviť ešte pred štartom, nie až potom.
2. Tri možnosti nasadenia
Cloudové API veľkých poskytovateľov. Najvýkonnejšie modely, minimum infraštruktúry. Dôležitý detail: podmienky používania dát v business API a v bezplatnom verejnom chate sa líšia. Skôr než odošlete čokoľvek citlivé, treba si pozorne prečítať podmienky konkrétneho poskytovateľa a vybrať vhodný plán.
Lokálne modely na vašom serveri. Dáta vôbec neopúšťajú vaše prostredie. Open-source modely sú dnes úplne použiteľné na veľa úloh: klasifikácia, extrakcia polí, vyhľadávanie v dokumentoch. Platíte za to hardvérom a podporou.
Hybrid. Veľmi často najrozumnejšia voľba. Citlivé veci sa spracujú lokálne alebo sa anonymizujú a náročnejšie úlohy s necitlivými dátami idú do výkonnejšieho cloudového modelu.
3. Praktické pravidlá, ktoré fungujú
- Anonymizácia. Skôr než odošlete text do externého modelu, nahraďte mená, telefónne čísla a čísla účtov značkami. Model dostane podstatu, nie osobné údaje.
- Prístupové práva. Firemný asistent ukáže zamestnancovi iba tie dokumenty, ku ktorým už aj tak má prístup.
- RAG namiesto doučovania modelu. Vaše dokumenty ležia vo vašej databáze a model dostane iba potrebný úryvok pre konkrétnu odpoveď. Podrobnejšie v článku čo je RAG.
- Záznam aktivít. Každý dopyt, odpoveď aj volanie nástroja sa zapisujú. Ak sa niečo pokazí, vidno presne čo a kedy.
- Kľúče iba na serveri. API kľúče sa nikdy nesmú dostať do prehliadača ani do mobilnej aplikácie.
- NDA. Skôr než sa ponoríme do vašich databáz, podpíšeme dohodu o mlčanlivosti a testujeme na syntetických alebo anonymizovaných dátach.
4. Čo určite nerobiť
- Nekopírovať citlivé dokumenty do bezplatných verejných chatov.
- Nedávať AI agentovi širšie oprávnenia, než reálne potrebuje na splnenie úlohy.
- Nepripájať model priamo na produkčnú databázu bez medzivrstvy kontrol.
Bezpečnosť nie je samostatná voľba, ktorú pridáte na konci. Musí byť súčasťou architektúry od prvého dňa. Vaše dáta prejdeme a vhodný variant nasadenia vyberieme počas auditu podnikových procesov. Ako to celé funguje vo firemnej znalostnej báze, si prečítajte na stránke Firemná znalostná báza a RAG.
- Zákon Ukrajiny o ochrane osobných údajov
- Politiky využívania údajov v obchodných API popredných poskytovateľov jazykových modelov
Podniková znalostná báza a RAG
Ostali vám otázky k téme článku?
Pozrime sa, ako tieto prístupy zapadnú do procesov práve vašej firmy.