Adatbiztonság a mesterséges intelligencia bevezetésekor: mit lehet megosztani a modellekkel és mit nem
A leggyakoribb kérdés a vezetőktől: hová fognak menni az adataink? Elemezzük az adat elhelyezésének lehetőségeit, mit lehet megosztani külső modellekkel, és hogyan lehet megelőzni az adatvesztést.
Röviden, ha nincs ideje mindent elolvasni
- ✓Először is, osztályozza az adatokat: mi nyilvános, mi belső, mi személyes vagy üzleti titok.
- ✓A nagy szolgáltatók üzleti API-i és a nyilvános chat különböző adatfelhasználási feltételeknek vannak alávetve.
- ✓A legérzékenyebb adatokat helyi modellek segítségével lehet feldolgozni, anélkül, hogy elhagyná a saját környezetét.
- ✓A hozzáférési jogok, az anonimizálás és a cselekvési naplók fontosabbak, mint egy adott modell kiválasztása.
„És hová kerülnek majd az adataink?” Ezt a kérdést minden első megbeszélésen halljuk. És teljesen jogosan. Mert a legrosszabb, amit tehetünk, az az, hogy bemásoljuk az ügyféllel kötött szerződést egy nyilvános chatbotba „csak azért, hogy csináljon belőle egy rövid összefoglalót”.
Nézzük meg, hogyan érdemes ezt normálisan csinálni.
1. Kezdjék az adatok osztályozásával
Nem minden adat egyforma. Mielőtt bármit automatizálnának, tegyék őket rendbe:
- Nyilvános: katalógus, weboldalon szereplő árak, nyílt cikkek. Itt szinte nincs kockázat.
- Belső: szabályzatok, útmutatók, levelezés. Kellemetlen, ha kiszivárognak, de nem katasztrófa.
- Személyes adatok: ügyfelek és munkatársak nevei, telefonszámai, címei. Itt jogszabályok érvényesek, ennek megfelelően kell kezelni őket.
- Üzleti titok: kulcsügyfeleknek adott árak, pénzügyi jelentések, szerződéses feltételek. Ez a legérzékenyebb kategória.
Minden kategóriához külön szabályok tartoznak. És ezeket a szabályokat még indulás előtt kell rögzíteni, nem utána.
2. Három elhelyezési lehetőség
Nagy szolgáltatók felhős API-jai. A legerősebb modellek, minimális infrastruktúraigénnyel. Van egy fontos árnyalat: az adathasználati feltételek az üzleti API-k és az ingyenes nyilvános chat között eltérnek. Mielőtt bármi érzékenyet továbbítanának, alaposan el kell olvasni az adott szolgáltató feltételeit, és a megfelelő csomagot kell választani.
Lokális modellek az Önök szerverén. Az adatok egyáltalán nem hagyják el az Önök környezetét. A nyílt modellek ma már sok feladatra teljesen megfelelők: osztályozás, mezők kinyerése, dokumentumkeresés. Ennek az ára a hardver és az üzemeltetés.
Hibrid. Sokszor ez a legésszerűbb megoldás. Az érzékeny adatokat helyben dolgozzák fel vagy anonimizálják, míg az összetettebb, nem érzékeny adatokkal kapcsolatos feladatok egy erősebb felhős modellhez mennek.
3. Gyakorlati szabályok, amelyek tényleg működnek
- Anonimizálás. Mielőtt szöveget küldenének egy külső modellnek, cseréljék le a neveket, telefonszámokat és számlaszámokat címkékre. A modell így a lényeget kapja meg, nem a személyes adatokat.
- Hozzáférési jogosultságok. A vállalati asszisztens csak azokat a dokumentumokat mutatja meg a munkatársnak, amelyekhez egyébként is van hozzáférése.
- RAG a finomhangolás helyett. Az Önök dokumentumai a saját adatbázisukban maradnak, a modell pedig csak az adott válaszhoz szükséges részletet kapja meg. Részletesen itt: mi az a RAG.
- Tevékenységnapló. Minden kérés, válasz és eszközhívás rögzítésre kerül. Ha valami félremegy, pontosan látszik, mi történt és mikor.
- Kulcsok csak a szerveren. Az API-kulcsok soha nem kerülnek a böngészőbe vagy a mobilalkalmazásba.
- NDA. Mielőtt mélyebben belemegyünk az adatbázisaikba, aláírunk egy titoktartási megállapodást, a tesztelést pedig szintetikus vagy anonimizált adatokon végezzük.
4. Mit ne csináljanak semmiképp
- Ne másoljanak érzékeny dokumentumokat ingyenes nyilvános chatfelületekbe.
- Ne adjanak az AI-ügynöknek szélesebb jogosultságokat, mint amennyire a feladathoz ténylegesen szükség van.
- Ne kössék rá közvetlenül a modellt az éles adatbázisra egy köztes ellenőrzési réteg nélkül.
A biztonság nem egy külön opció, amit a végén adnak hozzá. Ezt már az első naptól bele kell építeni az architektúrába. Az üzleti folyamatok auditja során áttekintjük az adataikat, és kiválasztjuk a megfelelő elhelyezési megoldást. Arról pedig, hogyan működik mindez egy vállalati tudásbázisban, itt olvashatnak: Vállalati tudásbázis és RAG.
- Ukrajna személyes adatok védelméről szóló törvénye
- Adatfelhasználási irányelvek a vezető nyelvi modellek üzleti API-jában
Vállalati tudásbázis és RAG
Maradtak kérdései a cikk témájával kapcsolatban?
Nézzük meg, hogyan illeszkednek ezek a megközelítések éppen az Ön cégének folyamataihoz.