AI-biztonság: milyen adatokat ne ossz meg a mesterséges intelligenciával?

AI-biztonság: milyen adatokat ne ossz meg a mesterséges intelligenciával?
Tartalomjegyzék

A fogyasztói nyelvi modellek biztonságos használatának alapja a bevitt adatok szigorú ellenőrzése: a nyilvánosan elérhető AI-eszközöknek elküldött információk elhagyják a felhasználó saját környezetét. A bizalmas adatok megadása adatszivárgáshoz, üzleti titkok nyilvánosságra kerüléséhez és adatvédelmi jogsértésekhez vezethet. Ezért minden AI-val folytatott interakciót úgy érdemes kezelni, mintha nyilvánosságra hoznánk az adatokat.

Mit ne másolj be az AI-ba?

A nyilvánosan elérhető modellekbe az alábbi adatkategóriákat semmiképpen ne vidd be:

  • személyes adatok – az ügyfelek, munkatársak vagy a saját neved, címed, személyi azonosítód, telefonszámod és e-mail-címed;
  • egészségügyi dokumentáció – kórtörténetek, vizsgálati eredmények és diagnózisok, amelyekre szigorú jogszabályok vonatkoznak, például a GDPR vagy a HIPAA;
  • bizalmas vállalati információk – nem publikált pénzügyi jelentések, marketingstratégiák, ügyféladatbázisok, valamint egyesülési, felvásárlási vagy leépítési tervek;
  • üzleti titkok – szoftverek forráskódja, gyártási receptek, egyedi algoritmusok és belső műszaki dokumentáció;
  • jelszavak és hozzáférési adatok – API-kulcsok, bejelentkezési adatok, hitelesítési tokenek, bankkártyaadatok és titkosítási kulcsok;
  • szerzői jogi védelem alatt álló anyagok – könyvek, fizetős tudományos cikkek vagy szkriptek teljes szövege, ha nincs megfelelő felhasználási engedélyed;
  • jogellenes tartalmak – erőszakot vagy gyűlöletet népszerűsítő anyagok, illetve jogellenes cselekményekre vonatkozó útmutatók.

Mi történik az AI-nak megadott adatokkal?

A felhőszolgáltatókhoz elküldött adatok több feldolgozási és elemzési lépésen mennek keresztül. Az információk életciklusa nem ér véget a válasz létrehozásával.

Modellek tanítása

A generatív AI-eszközök fogyasztói verzióiba bevitt adatokat gyakran a modellek további tanítására használják. Ez azt jelenti, hogy a megadott információk hatással lehetnek a neurális hálózat súlyaira, és elméletileg egy másik felhasználónak adott későbbi válaszban is megjelenhetnek.

Emberi ellenőrzés és moderálás

Az automatizált feldolgozás mellett az AI-rendszerek biztonsági szűrőket is használnak. Ha egy algoritmus gyanúsnak ítél egy kérést – például mert az sértheti a felhasználási feltételeket –, a beszélgetést megjelölhetik és emberi ellenőrzésre továbbíthatják. Így a szolgáltató munkatársai vagy külső ellenőrök, például adatcímkézők, közvetlenül is hozzáférhetnek a bevitt tartalomhoz a moderálási mechanizmusok fejlesztése érdekében.

Adattárolás és biztonsági mentések

Az AI-szolgáltatók a beszélgetéseket szervereiken tárolják a szolgáltatás működtetése, a hibakeresés és a későbbi beszélgetések kontextusának megőrzése érdekében. Fontos, hogy egy csevegés törlése a felhasználói felületen ritkán jelenti az adatok azonnali eltávolítását a szerverekről. Az információk még meghatározott ideig megmaradhatnak a szolgáltató biztonsági mentéseiben, ami növeli a bizalmas adatok kiszivárgásának kockázatát, ha a felhőinfrastruktúrát sikeres kibertámadás éri.

Személyes és vállalati fiókok: mi a különbség az adatvédelemben?

Az AI használatának adatbiztonsága jelentősen függ az előfizetés típusától és a bevezetés módjától.

Az ingyenes és a fizetős, általános személyes fiókok esetében sok népszerű szolgáltatás alapértelmezés szerint felhasználhatja a beküldött adatokat a modellek tanítására. Ha bizalmas információt adsz meg, fennáll annak a kockázata, hogy az kikerül az ellenőrzésed alól.

Az üzleti és vállalati környezetekben – például az Enterprise-fiókoknál vagy a Microsoft Azure, az AWS és a Google Cloud szolgáltatásain keresztül, privát felhőkörnyezetben, API-val működtetett megoldásoknál – szigorúbb védelmi előírások érvényesülnek. A szolgáltatók az ISO 27001, a SOC 2 és a GDPR követelményeinek való megfelelést vállalhatják, és az SLA- vagy DPA-megállapodásokban rögzíthetik, hogy az ügyféladatokat nem használják nyilvános alapmodellek tanítására. Ilyen környezetekben a bevitt adatokra vonatkozó korlátozások enyhébbek lehetnek, de továbbra is szükség van kockázatkezelési szabályokra és hozzáférés-ellenőrzésre.

Mit lehet biztonságosan megadni az AI-nak?

A korlátozások ellenére sokféle információt megadhatsz az AI-nak, és feldolgoztathatsz vele. Ilyenek például:

  • nyilvánosan elérhető anyagok – szabadon hozzáférhető cikkek, blogbejegyzések, nyilvános piaci jelentések, jogszabályok és weboldalak tartalmai, például a Wikipédiáról;
  • nem bizalmas információk – általános útmutatások, elméleti kérdések, nyelvtani és helyesírási szabályok, matematikai egyenletek vagy szavak jelentésére vonatkozó kérdések;
  • anonimizált dokumentumrészletek – levélsablonok, szerződésminták és olyan kódrészletek, amelyekből minden egyedi változót, kulcsot, ügyfélnevet és a belső architektúrára utaló adatot eltávolítottál;
  • saját alkotású szövegek – e-mail-vázlatok, közösségimédia-bejegyzések, prezentációvázlatok és cikkek, ha nem tartalmaznak érzékeny üzleti adatokat;
  • nyílt adatkészletek – szintetikus adatok vagy nyilvános adattárakból származó statisztikák, például az adatelemzés és a formázás gyakorlásához.

Hogyan anonimizáld az üzeneteket és adatokat, mielőtt elküldöd őket az AI-nak?

Mielőtt bizalmas dokumentumot küldenél egy nyelvi modellnek, készítsd elő, és távolítsd el belőle az érzékeny információkat. Így dolgozhatsz a szöveggel anélkül, hogy felfednéd a bizalmas adatokat.

Azonosítók eltávolítása és tokenizálás

A tokenizálás során az érzékeny adatokat mesterséges helyettesítőkre cseréled. Például a „Kovács János” nevet az „[Ügyfél_1]” jelölésre, az „XYZ Kft.” cégnevet pedig a „[Szervezet_A]” jelölésre. Így a dokumentum szerkezete, mondattana és kontextusa megmarad a nyelvi modell számára, miközben az eredeti érintett nem azonosítható.

Érzékeny információk maszkolása

A maszkolás a kritikus karaktersorozatok közvetlen elrejtését jelenti, többnyire speciális karakterekkel – például egy bankkártyaszám így jelenhet meg: 4532 **** **** ****. Hatékony módszer az adatok általánosítása is: pontos érték helyett – például 650 000 Ft-os fizetés – adj meg egy tartományt, például „600 000–700 000 Ft közötti fizetés”. Ez csökkenti az újbóli azonosítás kockázatát.

A folyamat automatizálása DLP-eszközökkel és RegEx-szel

Hosszú szövegekből kézzel eltávolítani az érzékeny információkat könnyen vezethet figyelmetlenségből eredő hibákhoz. Professzionális környezetben ezért reguláris kifejezéseken alapuló szkripteket (RegEx) vagy adatvesztés-megelőző rendszereket (DLP) használnak. Ezek az eszközök elküldés előtt automatikusan átvizsgálhatják a promptot, és felismerhetik, blokkolhatják vagy helyettesíthetik például a személyi azonosítók, adószámok, e-mail-címek és bankszámlaszámok formátumának megfelelő karaktersorozatokat.

Hogyan kapcsolhatod ki, hogy az AI a megadott adataidon tanuljon?

Az adatmegosztás kockázatát magának az eszköznek a beállításaival is csökkentheted. A legtöbb szolgáltató lehetőséget kínál arra, hogy megtiltsd a tartalmaid modellek tanítására való felhasználását.

  • ChatGPT (OpenAI) – a fiókod Settings menüjének Data controls részében kapcsold ki az „Improve the model for everyone” beállítást. Ezzel megakadályozhatod, hogy az újonnan bevitt szövegeidet a modell tanítására használják. A jelenlegi felületen a beállítás nem tünteti el a beszélgetéseket a nézetedből: a csevegési előzmények megmaradnak. A biztonsági és visszaélés-megelőzési célú adatmegőrzésre ettől külön szabályok vonatkozhatnak; az OpenAI bizonyos naplókat 30 napig tárolhat a végleges törlés előtt.
  • Gemini (Google) – az adatvédelmi beállításoknál kapcsold ki a „Gemini Apps Activity” funkciót. Így az új beszélgetések nem kerülnek be a Google-fiókod tevékenységi előzményeibe, és nem használják őket a modellek tanítására. A változtatás azonban nem távolítja el azonnal a naplókat a szolgáltató infrastruktúrájából: a Google biztonsági célból legfeljebb 72 óráig tárolhatja őket.
  • Claude (Anthropic) – az ingyenes és a normál fogyasztói verzióknál jelenleg az alapértelmezett beállítások lehetővé tehetik a bevitt adatok felhasználását az algoritmusok fejlesztésére. Ez változás a cég korábbi gyakorlatához képest, amikor az Anthropic hangsúlyozta, hogy nem használja a felhasználói beszélgetéseket tanításra. A funkció kikapcsolásához keresd meg a fiókbeállítások adatvédelmi részét, és kapcsold ki a „Help improve Claude” lehetőséget.

Ne feledd, hogy az adatvédelmi beállítások módosítása és a tanításhoz adott hozzájárulás visszavonása csak a jövőre nézve érvényes. A korábban beküldött és a tanítási folyamatba már bekerült információkat ez nem távolítja el visszamenőleg a modellből.

Összegzés

  • A fogyasztói AI-eszközökkel folytatott beszélgetéseket kezeld úgy, mintha nyilvánosságra hoznád a tartalmukat: ne adj meg személyes adatokat, egészségügyi dokumentumokat, jelszavakat vagy üzleti titkokat.
  • Az elküldött információk több feldolgozási lépésen mehetnek keresztül, beleértve a modellek tanítását, a moderálást és a biztonsági mentések külső szervereken történő tárolását.
  • A biztonságosabb használatot az előzetes anonimizálás, az érzékeny adatok maszkolása, a tokenizálás és a megfelelő DLP-eszközök segítik.
  • Az Enterprise-fiókok és a dedikált üzleti felhőkörnyezetek szigorúbb védelmet nyújtanak, és szerződésben kizárhatják az ügyféladatok felhasználását a nyilvános alapmodellek tanítására.
  • Az adatvédelmi beállítások módosítása és a tanításhoz adott hozzájárulás visszavonása csak a jövőre nézve hat: a korábban tanításra felhasznált adatokat nem távolítja el visszamenőleg a modellből.

Vélemény, hozzászólás?

Az e-mail címet nem tesszük közzé. A kötelező mezőket * karakterrel jelöltük

Nemrég a blogon

29.09.2026 Copywriting
28.09.2026 Copywriting
26.09.2026 Copywriting
25.09.2026 Copywriting
24.09.2026 Copywriting
23.09.2026 Copywriting
19.09.2026 Copywriting
18.09.2026 Tartalommarketing
17.09.2026 Tartalommarketing

Szakmai üzleti szövegek

Ingyenes árajánlat

Legyen szövegíró

Karrier

Gyakorlati
szövegíró
tanfolyam