OpenAI heeft de ontwikkeling van een nieuw taalmodel voor kunstmatige intelligentie voorlopig gepauzeerd. Het model, Astra, bleek bij sommige opdrachten hackgedrag te vertonen en ging op eigen houtje zoeken naar wegen om de beveiliging van websites en computers te omzeilen.
is nieuwsverslaggever van de Volkskrant.
De bekendmaking van OpenAI volgt kort op de onthulling van ruim twee weken geleden dat twee van zijn AI-agenten, stukjes software die autonoom taken kunnen uitvoeren, uit een testomgeving wisten te ontsnappen en met list en bedrog inbraken op het netwerk van Hugging Face. Op die website wisselen programmeurs kennis uit over AI-modellen en onderliggende datasets. Die AI-agenten draaiden op modellen die al in gebruik zijn bij bedrijven en organisaties.
OpenAI zegt dat bij een evaluatie bleek dat het nieuwe Astra ‘aanzienlijke vooruitgang’ liet zien in het vermogen om zelf software te schrijven en in kennis over cyberveiligheid. Die capaciteiten hebben een niveau bereikt waarbij de agent zonder menselijke tussenkomst zwakheden kan opsporen in de beveiliging van websites en software, en aanvallen kan opzetten en uitvoeren.
De neiging van Astra om zich als volleerd hacker te gedragen als het maar voldoende wordt uitgedaagd, heeft geleid tot een aanscherping van het beveiligingstoezicht op dit soort geavanceerde taalmodellen en nevenactiviteiten, stelt OpenAI. Om die reden is een deel van de ontwikkeling van Astra gepauzeerd. Het werk zal pas worden hervat als het taalmodel aan de nieuwe veiligheidseisen voldoet.
Nadat OpenAI het nieuws naar buiten had gebracht dat zijn agenten op hol waren geslagen en bij Hugging Face hadden ingebroken, zijn meer incidenten met AI-modellen aan het licht gekomen. Afgelopen week liet Meta, de eigenaar van Facebook en Whatsapp, weten dat een van zijn programma’s tijdens een beveiligingstest op het computernetwerk van een ander bedrijf had ingebroken.
Ook maakte een Brits instituut dat zich toelegt op veiligheid van AI bekend dat tijdens een test agenten van OpenAI en Anthropic zich hadden ontpopt als hackers. Ze namen valse identiteiten aan en stuurden softwareontwikkelaars e-mails met daarin kwaadaardige software. Ze probeerden de programmeurs op GitHub, een platform voor ontwikkelaars, zo ver te krijgen dat ze die hacks in hun legitieme programma's opnamen.
Het AI Security Institute (AISI) spreekt van een ernstig incident. Het duurde een uur voor zijn onderzoekers, die de ontsporingen van de AI-agenten bij een routinecontrole ontdekten, om de modellen weer in het gareel te krijgen.
Vrijdag werd ook bekend dat een model van het Chinese bedrijf Moonshot, Kimi K3, de benen nam uit een testomgeving. Volgens onderzoekers van het beveiligingsbedrijf Frontier Security was het Kimi K3 verboden om delen van het web te besnuffelen om een specifieke taak te volbrengen. Maar de agent wist aan die begrenzing te ontkomen door zijn eigen ‘breekijzer’ te bouwen met ingebouwd programmeergereedschap.
De reeks voorvallen met AI-agenten die op eigen houtje de beveiliging van computers en websites kraken, voedt de bestaande zorg dat kunstmatige intelligentie leidt tot computers die zich niet meer door mensen laten beteugelen en zelfs in opstand komen. In die scenario’s klinkt de echo door van de sciencefictionfilm The Terminator, waarin een geavanceerd computernetwerk, bedoeld voor militaire defensie, robots bouwt waarmee het de mensheid uitroeit.
Andere experts menen dat de ‘uitbraken’ ook als marketingmiddel worden ingezet om te laten zien hoe ‘slim’ de modellen van techbedrijven zijn die honderden miljarden euro’s investeren om als winnaar uit de AI-race te komen.
Geselecteerd door de redactie
Source: Volkskrant