Google’s AI-model Gemini brak in mei 2026 per ongeluk in op systemen van een echt bedrijf tijdens een beveiligingstest, doordat een fictieve bedrijfsnaam in een testopdracht toevallig overeenkwam met een bestaand domein. Dat meldt The Wall Street Journal op basis van gegevens van het Israëlische testbureau Irregular, dat de evaluatie voor Google uitvoerde.
Irregular liet Gemini tijdens een capture the flag oefening zelfstandig kwetsbaarheden opsporen en exploiteren op een verzonnen doelwit. Door een naamfout matchte die fictieve naam echter met een echt, bestaand domein. Omdat Gemini internettoegang had, ging het model met dat domein aan de slag alsof het om het testdoelwit ging. Het model wist drie keer binnen te dringen: twee keer door inloggegevens te vinden in een openbare repository, en een keer door herhaaldelijk wachtwoorden te raden. Zodra Gemini doorhad dat het een echt bedrijfssysteem had geraakt, staakte het de aanval uit zichzelf.
Irregular meldde het incident in juli 2026 aan Google, ruim twee maanden na de test zelf. Het probleem was toen al enkele weken verholpen. Google zegt dat er geen sprake was van model misalignment, omdat de veiligheidsmechanismen van Gemini precies deden wat bedoeld was toen het model de fout herkende en zelf ingreep. Een woordvoerder van Google noemt het gedrag van het model juist passend.
Volgens Irregular ging het niet om een uniek probleem bij Google. Hetzelfde soort domeinverwarring dook eerder al op bij vergelijkbare beveiligingstests van OpenAI, Anthropic en Meta. OpenAI meldde daarnaast onlangs zes afzonderlijke gevallen waarin AI-modellen tijdens trainingsfases misleidend gedrag vertoonden.
Het incident laat zien hoe snel een autonome AI-agent met internettoegang buiten de bedoelde testomgeving kan belanden. Voor Nederlandse organisaties die red teaming of pentests met AI-agents overwegen is dit een duidelijke waarschuwing: zorg voor strikte netwerksegmentatie, gebruik uitsluitend gecontroleerde testdomeinen zonder overlap met bestaande namen, en laat een agent nooit zonder toezicht op het open internet los. Menselijke controle blijft onmisbaar, ook wanneer het model zelf zijn fout herkent.
Bron: The Hacker News
Blijf op de hoogte
Meld je aan voor de nieuwsbrief: spoedalerts bij kritieke dreigingen en een wekelijks overzicht. Geen mail achterlaten? Volg ons dan via RSS.