Kunstmatige intelligentie vindt zijn weg naar alles, van kattenluiken tot 'slimme' achtertuingrills – en natuurlijk kun je geen moderne bedrijfssoftware openen zonder een soort AI-assistent te zien die wordt aangestuurd door een groot taalmodel (LLM). Maar nu de technologie steeds moeilijker te vermijden is, moeten we misschien eens nadenken over hoe mensen er misbruik van kunnen maken.
We hebben het hier niet over hoe cybercriminelen grote taalmodellen (LLM's) kunnen gebruiken om phishing-e-mails te schrijven of websites te hacken. We kijken eerder naar hoe aanvallers legitieme AI-systemen kunnen compromitteren om gegevens te stelen, misinformatie te verspreiden of zelfs machines op hol te slaan.
De kwetsbaarheden die op de loer liggen in LLM's
Een van de meest voorkomende aanvallen van dit type betreft manipulatie van prompts. Aanvallers hebben laten zien hoe ze de beveiligingsmechanismen van verschillende LLM's kunnen omzeilen (bekend als jailbreaking) met behulp van technieken zoals rollenspel en zelfs het invoeren van onzinnige tekens.
Prompt-injecties kunnen meer dan alleen een LLM instructies laten geven voor illegale activiteiten of phishing-e-mails laten schrijven. Onderzoekers hebben ze ook gebruikt voor data-exfiltratie. Zo misleidde AI-beveiligingsbedrijf PromptArmor bijvoorbeeld de AI-assistent van Slack om geheimen zoals API-sleutels uit privékanalen te lekken.
Het ontwikkelen van prompts creëert mogelijkheden voor datadiefstal. AI-systemen kunnen onbedoeld gevoelige gegevens blootleggen door bugs of ontwerpfouten. Soms gaat het om kleine storingen, zoals toen een bug in ChatGPT in maart 2023 de privégegevens van gebruikers, waaronder betaalgegevens, lekte . Andere aanvallen maken gebruik van promptinjectie met slinkse tactieken, zoals het aanpassen van tekst, zodat een kwaadaardige prompt een LLM ertoe aanzet gegevens over te dragen, terwijl deze prompt voor menselijke slachtoffers onbegrijpelijk is.
In sommige scenario's kunnen onderzoekers prompt engineering gebruiken om de originele trainingsdata van het model bloot te leggen. Bij een model inversion-aanval kan een tegenstander de LLM ondervragen, de antwoorden gebruiken om dingen over de trainingsdata af te leiden en uiteindelijk een deel van die data achteraf te reverse engineeren.
Sommigen hebben voorgesteld om modelinversie te gebruiken om nauwe benaderingen van de afbeeldingen te extraheren die worden gebruikt om gezichtsherkenningsmodellen te trainen. Dit riskeert het identificeren van gevoelige of kwetsbare personen of het verlenen van ongeautoriseerde toegang tot bronnen.
Het hoeft niet alleen om tekstuele invoer te gaan die tot schadelijke resultaten leidt. Ook afbeeldingen en andere data kunnen een negatieve invloed hebben op AI. Zo hebben onderzoekers zelfrijdende auto's bijvoorbeeld gedwongen om stopborden te negeren door er stickers op te plakken , en om stopborden te zien die er niet zijn door een paar beelden op een reclamebord te projecteren – beide met mogelijk catastrofale gevolgen op de weg.
Vergiftiging stroomopwaarts
Aanvallers kunnen ook verder stroomopwaarts in AI-workflows ingrijpen door de data te manipuleren waar AI-systemen van leren. Dit kan het gedrag van het model veranderen en de eindresultaten vervuilen. Sommige van deze aanvallen worden om economische of politieke redenen uitgevoerd. Onderzoekers ontwikkelden bijvoorbeeld de tool Nightshade om kunstenaars te helpen hun digitale afbeeldingen subtiel te veranderen door onzichtbare pixels in te voegen als protest tegen LLM's die getraind worden op auteursrechtelijk beschermd materiaal. Dit zorgt ervoor dat programma's voor beeldgeneratie onvoorspelbare resultaten produceren.
Het vergiftigen van data hoeft niet wijdverspreid te zijn om effect te hebben, en wanneer het wordt toegepast op specifieke datasets zoals die in medische systemen worden gebruikt, kunnen de gevolgen catastrofaal zijn. Een onderzoek wees uit dat het wijzigen van slechts 0.001% van de trainingsdata met medische desinformatie de kans op medische fouten aanzienlijk vergrootte.
Naarmate AI het dagelijks leven blijft doordringen, neemt de kans toe dat systeemcompromissen de maatschappij beïnvloeden. Een sluwe aanvaller kan van alles doen, van het creëren van desinformatie tot het veroorzaken van ongelukken op de weg, het beïnvloeden van veiligheidskritieke beslissingen op gebieden zoals geneeskunde, of het verhinderen dat AI frauduleuze transacties detecteert.
AI-modellen beschermen
De mogelijkheden voor compromittering van AI zijn zo wijdverspreid – en de gevolgen ervan zo ingrijpend – dat een veelzijdige aanpak van AI-governance cruciaal is. ISO 42001 , een internationale standaard voor AI-managementsystemen, hanteert een holistische benadering, inclusief aspecten zoals de organisatorische context van AI en de betrokkenheid van het leiderschap. Het omvat ook planning, ondersteuning, werking en continue evaluatie en verbetering. De standaard schrijft de ontwikkeling van technische specificaties voor, inclusief beveiliging en datakwaliteit, samen met de documentatie van beveiligingsprotocollen ter bescherming tegen bedreigingen zoals datavergiftiging en modelinversieaanvallen.
Overheden hebben maatregelen genomen om veiligheidsbeperkingen op te leggen aan AI. De EU-wetgeving inzake AI schrijft een conformiteitsbeoordeling voor voor systemen met een hoog risico, waarbij onder andere moet worden voldaan aan testvereisten die nog in ontwikkeling zijn. In de VS had het National Institute of Standards and Technology (NIST) al een raamwerk voor risicobeheer van AI (AI Risk Management Framework, RMF) voordat de regering-Biden in oktober 2023 haar uitvoeringsbesluit 14110 over AI-veiligheid publiceerde (dat inmiddels door de regering-Trump is ingetrokken). Dit raamwerk riep op tot een aanvullende bron voor risicobeheer van generatieve AI, die NIST afgelopen juni publiceerde .
In tegenstelling tot NIST's AI RMF is ISO 42001 certificeerbaar. En terwijl NIST zich sterk richt op de veiligheid en beveiliging van AI-systemen, onderzoekt ISO 42001 hun rol binnen een bredere zakelijke context.
Waarom AI-bestuur nu belangrijk is
Frameworks zoals deze worden steeds belangrijker naarmate aanbieders van fundamentele LLM-modellen (Learning Learning Models) de concurrentie aangaan om nieuwe functies te bieden die consumenten versteld doen staan. Daarmee vergroten ze echter het aanvalsoppervlak van de AI-modellen, waardoor beveiligingsonderzoekers nieuwe kwetsbaarheden kunnen ontdekken. Bedrijven zoals OpenAI en Google hebben bijvoorbeeld mogelijkheden voor langetermijngeheugen in hun LLM's geïntegreerd, waardoor ze gebruikers beter leren kennen en betere resultaten kunnen leveren. Dit stelde onderzoeker Johann Rehberger in staat om via promptinjectie valse langetermijngeheugens in Google's Gemini LLM te plaatsen .
Het is ook de moeite waard om de beveiliging van AI-modellen te onderzoeken in de context van elementaire cyberhygiëne. In januari 2025 ontdekten onderzoekers een datalek bij DeepSeek, een door Chinese ontwikkelaars ontwikkeld en toonaangevend LLM-model dat de publieke belangstelling had gewekt met zijn hoge prestaties. De oorzaak van het datalek had niets te maken met snelle ontwikkeling, modelinversie of magische AI-capaciteiten; het kwam voort uit een openbaar toegankelijke clouddatabase met chatgeschiedenissen en gebruikersgegevens. In de opwindende nieuwe wereld van AI zijn sommige van de meest schadelijke kwetsbaarheden helaas ouderwets.







