Cybersecure AI: AI als doelwit én aanvaller

Thema:
Cybersecurity

De snelle ontwikkeling van AI, en de onvoorspelbare eigenschappen daarvan, maakt het bijzonder lastig om deze technologie te beveiligen tegen cyberaanvallen. Door de integratie van AI in bestaande systemen ontstaan nieuwe soorten kwetsbaarheden. Hoe benut je de voordelen van AI zonder de beveiliging uit het oog te verliezen?

Waar het misgaat: kwetsbare AI-modellen én AI die systemen leert hacken

AI-systemen zijn gevoelig voor manipulatie. Adversarial input, jailbreak prompts en kwetsbare softwarecomponenten kunnen leiden tot foutieve output, datalekken en beveiligingsrisico's. Tegelijkertijd ontbreken vaak onafhankelijke beoordelingsmethoden voor AI-veiligheid en naleving van regelgeving.

Andersom vormen AI-modellen als Claude Mythos en GPT-5.5 een grote dreiging. Deze modellen zijn zo extreem goed in het analyseren van software dat ze zwakheden kunnen ontdekken, misbruiken en aaneenschakelen tot volledige, zelfstandige cyberaanvallen.

AI-veiligheid in de praktijk

TNO ondersteunt, samen met een Europees consortium, het AI Office van de Europese Commissie bij de uitvoering van de AI Act. Het consortium ontwikkelt risicomodellen, evaluatiemethoden en technische hulpmiddelen om de socio-technische risico's van general-purpose AI-modellen (GPAI) te identificeren, beoordelen en monitoren. TNO is binnen het consortium verantwoordelijk voor de selectie en onboarding van technische tooling voor risicoanalyse en evaluatie.

Deze expertise zetten we ook in voor Nederland. In opdracht van het Ministerie van EZK is voor Nederland onderzocht hoe beleidsmakers kunnen omgaan met het zogenoemde evidence dilemma: de noodzaak om beleidskeuzes te maken op basis van onvolledige informatie in een wereld waarin AI zich sneller ontwikkelt dan kennis, beleid en toezicht kunnen bijhouden. Dit heeft geleid tot het advies om de oprichting van NL AISI (AI Security Insitute) verder te verkennen.

Hoe TNO werkt aan cyberveilige AI

TNO ontwikkelt en test veilige AI-oplossingen voor vraagstukken waarvoor nog geen bewezen aanpak bestaat. Daarbij vervullen we vaak de rol van first-time engineer: we onderzoeken, ontwerpen en valideren oplossingen die nog niet eerder zijn ontwikkeld.

Op het gebied van veilige AI zijn wij gespecialiseerd in drie expertises: secure-by-design AI, AI-veiligheidsbeoordeling & risicobeheersing en AI red teaming. Dat doen we met specialisten die werken op het raakvlak van cybersecurity en AI. Daarnaast onderzoeken wij ook, in samenwerking met onze vulnerability researchers, de groeiende offensieve cybercapaciteiten van geavanceerde AI.

Secure-by-design AI

We zorgen ervoor dat beveiligingsmaatregelen vanaf de ontwerpfase worden verwerkt in AI-modellen, producten en systemen, via technische richtlijnen en architectuuradvies. Hierdoor zijn tijdrovende en dure herstelacties na implementatie niet nodig en kunnen systemen autonoom reageren op aanvallen.

Vaak wordt AI ingezet om systemen te verdedigen tegen AI-aanvallen. In onze recente publicatie beschrijven we effectieve verdedigingen tegen vijf typen aanvallen die gericht zijn op Machine Learning (ML)-modellen.

Met GPT-NL ontwikkelt TNO een taalmodel voor Nederland ter versterking van de digitale soevereiniteit. Om ervoor te zorgen dat het model veilig en verantwoord kan worden ingezet, onderzoeken we hoe het model omgaat met risico’s op het gebied van safety en security.

Door modelgedrag te analyseren, experimenten uit te voeren en praktijkgerichte use cases te evalueren, worden kwetsbaarheden, misbruikscenario’s en verbeterpunten in kaart gebracht. Deze inzichten worden gebruikt om de robuustheid, betrouwbaarheid en veiligheid van het model te versterken. Zo draagt TNO bij aan generatieve AI-systemen die niet alleen krachtig zijn, maar ook veilig, betrouwbaar en in lijn met Europese waarden kunnen worden toegepast.

AI-veiligheidsbeoordeling & risicobeheersing

Op dit moment is er geen algemeen geaccepteerde methode om de veiligheid van AI-systemen te beoordelen of te zorgen dat EU- en Nederlandse regelgeving wordt nageleefd. Vaak beoordelen ontwikkelaars hun eigen modellen, maar ontbreekt het aan onafhankelijke verificatie of die beoordelingen volledig en effectief zijn.

Hoe ontwikkel je een AI-toepassing veilig als de risico's nog onvoldoende bekend zijn? Met een door TNO ontwikkelde workshopaanpak brengen organisaties de belangrijkste risico's van LLM's en AI-agents binnen een specifieke use case in kaart. Deze aanpak wordt ook toegepast bij de veiligheidsbeoordeling van praktijkgerichte toepassingen rondom GPT-NL.

De uitkomst is een concreet handelingsperspectief: welke risico's vragen om aandacht, welke mitigaties zijn nodig en welke aspecten moeten blijvend worden gemonitord om de toepassing veilig en verantwoord te kunnen inzetten.

TNO biedt een betrouwbaar, onafhankelijk beoordelingskader voor beveiliging om organisaties te helpen bewuste, op risico's gebaseerde beslissingen te nemen die hun AI-oplossingen verder beschermen. Dit kader kan ook als basis dienen voor toekomstige standaarden en methodologieën die zullen uitmonden in duidelijke regels en richtlijnen voor toekomstige AI-ontwikkeling.

TAISHA verzamelt de kenmerken van een AI-toepassing: gebruikt model, type data en inzetcontext. Op basis van deze kenmerken bepaalt de tool welke beveiligingsmaatregelen nodig zijn voor jouw organisatie en waar de grootste risico's en prioriteiten liggen.

De output dient als een startpunt voor risicobeheer, compliance-toetsing en besluitvorming op bestuursniveau, en kan daarom gebruikt worden om de behoeften op het gebied van Cybersecure AI voor uw organisatie in kaart te brengen. Ga hier aan de slag met TAISHA:

TAISHA
TAISHA biedt een beknopt overzicht van potentiële beveiligingsrisico's in AI-toepassingen en bruikbare output om deze risico's te beperken.

AI red teaming

Met AI red teaming brengt TNO kwetsbaarheden in AI-systemen systematisch aan het licht. We simuleren realistische aanvalsscenario's om te onderzoeken hoe modellen reageren op manipulatie, misbruik en onverwachte invoer. Daarmee testen we niet alleen de prestaties van een model, maar vooral de veiligheid, robuustheid en weerbaarheid ervan.

De aanpak is afhankelijk van het type AI. Bij large language models gebruiken we adversarial prompts om veiligheidsmechanismen te omzeilen of ongewenste antwoorden uit te lokken. Bij beeldverwerkende AI passen we afbeeldingen subtiel aan om foutieve classificaties te veroorzaken. Voor modellen die zijn getraind met gevoelige gegevens onderzoeken we of deze informatie uit het model kan worden afgeleid. De resultaten maken zichtbaar waar risico's ontstaan en welke maatregelen nodig zijn om AI-systemen veiliger te maken.

LLM's en RAG-systemen brengen nieuwe beveiligingsrisico's met zich mee. Denk aan prompt injection, jailbreaking of het ongewenst prijsgeven van gevoelige informatie. Deze kwetsbaarheden zijn sterk afhankelijk van de context waarin een AI-toepassing wordt gebruikt en worden daarom vaak niet ontdekt met generieke LLM red teaming en jailbreaking tools en benchmarks.

Daarom ontwikkelde TNO samen met haar PCSI-partners ProViLE (Prompt for Vulnerabilities in LLM-based Applications with Extensions). Deze open-source methodologie en tool ondersteunt organisaties bij het zelfstandig uitvoeren van AI red teaming experimenten op eigen LLM-applicaties. In vier stappen helpt ProViLE gebruikers om relevante aanvalsscenario's te identificeren, aanvalsprompts op te stellen en de reacties van een AI-systeem te beoordelen.

Het onderscheidende vermogen van ProViLE ligt in de contextgerichte aanpak. In plaats van generieke tests gebruikt de methode prompts die aansluiten bij de specifieke toepassing, data en risico's van een organisatie. Hierdoor ontstaan realistischere testscenario's en beter inzicht in kwetsbaarheden die in de praktijk relevant zijn.

Podcast

In deze aflevering van TNO Insights duiken we in de kruising tussen cybersecurity en AI. Wat zijn de belangrijkste bedreigingen die AI vormt voor cybersecurity? Waar kan het juist een oplossing bieden? En hoe kunnen beleidsmakers zich voorbereiden op de toekomst?

FAQ

AI-systemen zijn complex en onvoorspelbaar. Integratie met bestaande software introduceert nieuwe kwetsbaarheden, waardoor traditionele beveiligingsmaatregelen vaak onvoldoende zijn.

Het stress-testen van een AI-systeem om beveiligingslekken te identificeren: adversarial prompts bij LLM's, adversarial samples bij beeldverwerkingssystemen, en data-extractietests bij modellen met gevoelige trainingsdata.

Zogenaamde safety en security “alignment” van AI is het ontwikkelen van methoden, technologieën en processen die ervoor zorgen dat AI-systemen veilig, betrouwbaar en in lijn met menselijke doelstellingen, waarden en wetgeving opereren. Het richt zich op het voorkomen van schadelijk gedrag, het beschermen van gevoelige informatie en het vergroten van de weerbaarheid tegen manipulatie, misbruik en cyberaanvallen.

  • Manipulatie van input (adversarial attacks) leidt tot foutieve output en “misaligned” gedrag
  • Onbedoeld lekken van gevoelige informatie
  • Kwetsbaarheden in open-source componenten verspreiden zich door de keten
  • Manipulatie van trainingsdata om het model inherent verkeerde patronen aan te leren

Samenwerken aan een veilige toekomst

Ben je bezig met de ontwikkeling van een AI-gestuurde technologie of een nieuw productconcept en wil je er zeker van zijn dat deze veilig, robuust en conform de eisen is? Wil je weten hoe veilig je systeem is of in de praktijk testen hoe weerbaar het is?

Wij staan klaar om de cyberbeveiligingsoplossingen te ontwikkelen die je nodig hebt om je systemen hun hele levensduur lang veilig te houden.

Laat je verder inspireren

9 resultaten, getoond 1 t/m 5

Meer zien zonder meer te delen

Informatietype:
Insight
23 juli 2026
De vraag is niet of informatie waardevol is, maar hoe je die waarde kunt inzetten zonder je eigen kwetsbaarheid te vergroten.

TNO Unboxed #6: De race tegen de quantumdreiging is al begonnen

Informatietype:
Insight
30 maart 2026

Tijdmakers in beeld: Shari Finner

Informatietype:
Insight
14 januari 2025

Zonder inventarisatie geen migratie: bescherming tegen de quantumcomputer begint met inzicht

Informatietype:
Insight
22 oktober 2024

Goed geteste communicatie tussen applicaties: ​zo makkelijk kan het zijn

Informatietype:
Insight
15 oktober 2024