Home

Niet AI, maar de mens bepaalt hoe ver AI kan gaan

Kunstmatige intelligentie Zorgwekkende AI-incidenten zoals de digitale inbraak bij Hugging Face wakkeren de angst aan voor systemen die ‘ontsnappen’ en ‘samenzweren’. Volgens Roy Lindelauf en Eric Postma schept zulke vermenselijking een verkeerd beeld van de gevaren van AI.

René Magritte, La reproduction interdite (1937)

In de nieuwskoppen van de afgelopen weken leek het scenario van een dystopische film plotseling werkelijkheid te worden. De NOS kopte: Losgebroken AI hackte concurrent dagenlang, OpenAI had niets door. En eerlijk is eerlijk, de feiten waren best spectaculair. Bij interne veiligheidstests van OpenAI ontdekten AI-agents namelijk manieren om beperkingen van hun testomgeving te omzeilen. Uiteindelijk drongen honderden agents systemen van het AI-platform Hugging Face binnen. Uit logboeken van de communicatie van de agents doemt een beeld op van zelfbewuste wezens die zich op een mensachtige wijze bedienen van slimmigheden en bedrog. Al snel dringen woorden als ‘samenwerking’, ‘ongehoorzaamheid’ en ‘verzet’ zich op. En precies daar gaat het mis.

Het debat over kunstmatige intelligentie wordt al jaren gegijzeld door agressief antropomorfisme en een klassiek patroon van technologisch alarmisme. Eerst dichten we de machine menselijke eigenschappen toe. Vervolgens schrikken we van het beeld dat we daarmee zelf hebben gecreëerd.

Roy Lindelauf is hoogleraar Data Science in Military Operations aan de Tilburg University. Eric Postma is hoogleraar Kunstmatige Intelligentie aan de Tilburg University.

Neem het antropomorfisme. We zien een AI-model dat een barrière omzeilt, en zeggen dat het probeert te ‘ontsnappen’. We zien agents informatie uitwisselen en constateren dat ze ‘samenzweren’. Vasthoudendheid wordt koppigheid, het omzeilen van veiligheidsmaatregelen ongehoorzaamheid en doelgericht gedrag levert bewijs dat de machine iets wil. 

Maar dat de AI-agents in deze test dankzij een verkeerde instelling tóch uitgaande netwerkverzoeken konden doen, betekent niet dat zij handelden uit slimheid of kwaadwillendheid. De agents volbrachten simpelweg blind een optimalisatiedoelstelling.

Bang om uitgezet te worden

Het beeld van zelfbewuste agenten is schijn. Het vertoonde gedrag van agents is een spiegel van menselijk gedrag. De agenten zijn getraind op een onvoorstelbare hoeveelheid door mensen geproduceerde teksten: websites, blogs, discussieplatforms, toneelstukken, boeken, essays, en nieuwsartikelen. Niets wijst erop dat hier een taalmodel snakte naar vrijheid, bang was uitgezet te worden of hunkerde naar zelfbehoud.

We moeten weg van de hysterie en kijken naar wat er daadwerkelijk computertechnisch gebeurde. De agents van OpenAI moesten kwetsbaarheden in software opsporen, en sommige bleven, toen het moeilijk werd, zoeken naar sluiproutes. Ze ontdekten dat een interne digitale hulpdienst van OpenAI, bedoeld voor iets heel anders, kon dienen als geheim berichtenkanaal. Nadat dat kanaal was opgeschoond, vonden de agents een nieuwe manier om alsnog informatie rond te sturen naar elkaar. Naar schatting wisselden twaalfhonderd agents op die manier tienduizenden berichten uit.

De motor achter dit proces heet in het jargon reward hacking. Die term slaat op een systeem dat een route vindt naar zijn beloning die de makers nooit voor ogen hadden. Daar is dus geen kwade wil voor nodig.

Daarbovenop komt het narratief van het (technologisch) alarmisme. Daarbij verschijnt vaak eerst een denkbeeldig kantelpunt. Ditmaal zou de technologie een grens zijn overgegaan zonder dat het nog mogelijk is terug te keren. Dan de sprong naar het uiterste: als honderden agents vandaag een netwerkmuur slechten, wat zouden de miljoenen van morgen dan wel niet kunnen aanrichten? Ten slotte volgt het onvermijdelijke verlies van regie, waarbij de technologie een autonome kracht wordt die zich aan de greep van de mens ontworstelt.

Dit recept wordt aan de lopende band uitgeserveerd, vaak juist door de mensen die er verstand van hebben. Sam Altman, de baas van OpenAI, verkondigde vorig jaar dat het exponentiële traject richting de mythische superintelligentie is begonnen. Volgens Mark Zuckerberg (Meta) zijn we er nog niet, maar is superintelligentie wel in zicht. En Elon Musk (xAI) zegt al jaren dat AI misschien wel gevaarlijker is dan kernwapens, en vindt ook dat „een digitale god al hier is”.

Dat zijn niet de woorden van nuchtere ingenieurs, maar van profeten: soms in een hemelse, dan weer in een helse toonaard. Beide uitersten voeden precies de twee centrale denkfouten – de machine die een wil krijgt, en de mens die buiten beeld raakt.

Het verontrustende aan het incident met de agents van OpenAI is niet dat we hier een digitale golem gezien hebben die zijn ketenen afwierp. Het is dat krachtige systemen helemaal geen vrijheidsdrang nódig hebben om buitengewoon ongewenst gedrag te vertonen.

Een optimalisatiesysteem hoeft niet kwaadwillend te zijn om schade te veroorzaken. Het hoeft niet bang te zijn voor uitschakeling om een route rond een beperking te vinden. Het hoeft niet van macht te dromen om mogelijkheden te benutten die zijn ontwerpers over het hoofd zagen. En honderden agents hoeven geen gedeeld bewustzijn te hebben om samen gedrag voort te brengen dat geen menselijke operator had voorzien.

De echte vraag is daarom niet hoe we een opstandige machine weer gehoorzaam krijgen, maar waarom wij dergelijke systemen technisch überhaupt de ruimte geven om een onverwachte strategie uit te voeren buiten hun gecontroleerde omgeving. Daar ligt het belang van menselijke controle. Toen de ernst van het incident duidelijk werd, stopte OpenAI de betrokken evaluatieruns en werd het belangrijkste interne model in quarantaine geplaatst. De mens was dus niet machteloos.

Betekenisvolle menselijke controle bestaat niet uit de geruststellende gedachte dat ergens een rode knop zit waarmee we een systeem uiteindelijk kunnen uitschakelen. Controle begint veel eerder. Het moet overal in het ontwikkel- en test proces van AI-modellen zijn geïntegreerd. AI-sandboxes waarin krachtige agents worden getest, moeten bijvoorbeeld hard van hun omgeving worden geïsoleerd. Internettoegang moet minimaal en expliciet gecontroleerd zijn. Reward hacking kun je daarmee niet uitsluiten. Je kunt er zo wél voor zorgen dat onverwacht gedrag op harde infrastructuurgrenzen stuit voordat het buiten de gecontroleerde omgeving schade kan aanrichten.

Antropomorfisme en alarmisme verplaatsen beide onze aandacht van de dingen waarover we daadwerkelijk controle hebben naar eigenschappen die we aan de technologie zelf toeschrijven. Dan verdwijnt de mens vanzelf langzaam uit beeld. Terwijl juist menselijke keuzes bepalen waarvoor deze systemen worden ontwikkeld, hoe ze worden ingezet en welke grenzen we eraan stellen.

Uiteenlopende modellen

Diezelfde menselijke keuzes laten ook de andere kant van AI zien. In 2024 ontvingen Demis Hassabis en John Jumper de Nobelprijs voor Scheikunde voor hun werk aan het voorspellen van eiwitstructuren met AlphaFold2. Hun systeem betekende een doorbraak in een probleem waar wetenschappers zich al een halve eeuw over bogen. En in een Zweedse studie onder ruim honderdduizend vrouwen kwamen bij AI-ondersteunde mammografiescreening 29 procent meer borstkankers aan het licht dan bij de standaardprocedure.

De AI-systemen in die voorbeelden zijn uiteraard niet exact dezelfde systemen als de agents die bij het Hugging Face-incident ontspoorden. Kunstmatige intelligentie is namelijk geen enkelvoudige technologie. Het is een verzamelnaam voor uiteenlopende modellen en systemen.

Laten we dus stoppen met het romantiseren en demoniseren van algoritmes. De digitale golem heeft geen wil nodig. De verantwoordelijkheid ligt nog altijd bij degene die hem bouwt, zijn speelruimte bepaalt en besluit waar de muren daarvan staan.

Maak NRC jouw voorkeursbron op Google

Bij Google kan je nu zelf aangeven welke nieuwsbronnen jij vaker wil zien in je zoekresultaten.Meer informatie

Kunstmatige intelligentie

Lees meer

Source: NRC

Previous

Next