Home

De grote vraag voor de opinieredactie: wat vinden we acceptabel AI-gebruik?

Kunstmatige intelligentie In de tientallen opiniestukken die NRC dagelijks binnenkrijgt, duiken steeds vaker sporen op van AI-gebruik. De redactie kan de technologische revolutie niet tegenhouden, maar zoekt evengoed naar manieren om ervoor te zorgen dat de tekst op de pagina’s afkomstig is van een mens, en niet van een machine.

„Mijn AI-radar gaat af.” „Ik krijg hier AI-vibes van.” „Hier rinkelt een AI-alarm.” Het zijn uitspraken die tegenwoordig geregeld te horen zijn op de opinieredactie van NRC. We krijgen dagelijks tientallen stukken binnen van auteurs van buiten de krant en beoordelen: is dit een goed stuk? Maakt de auteur een onderbouwd punt, zijn de bronnen betrouwbaar, is het helder geschreven? Zo niet, dan helpen wij. Daar zijn we voor.

De laatste maanden viel het de opinieredacteuren op dat er steeds vaker uitstekende inzendingen in onze mailbak belandden. We waren in eerste instantie enthousiast: heerlijk, een stuk dat zo de krant in kan. Maar al snel begon er iets te knagen. Sommige teksten waren wel erg gepolijst en opvallend vaak positief van toon. Zou hier misschien AI in het spel zijn?

Iedereen die een stuk aan de redactie mailt, krijgt sinds begin dit jaar een automatisch bericht met onze AI-richtlijn. Die luidt (in het kort): elke zin in een stuk moet door de auteur zelf geschreven zijn. Mensen mogen AI als hulpmiddel gebruiken maar geen suggesties of verbeteringen letterlijk overnemen. Maar houden schrijvers zich hier aan? En is de richtlijn realistisch en te handhaven?

Techondernemer en journalist Alexander Klöpping publiceerde onlangs een onderzoek waarbij hij alle ingezonden opiniestukken die in één maand in vijf Nederlandse kranten verschenen door AI-detector Pangram liet halen. „Een vijfde van de opiniestukken in Nederlandse kranten komt uit een taalmodel”, concludeerde hij. Bij NRC zouden van de onderzochte 27 stukken, 11 deels door zijn AI geschreven. Bij andere kranten bestempelde Pangram een aantal stukken zelfs als volledig AI-gegenereerd.

Toevallig was de opinieredactie van NRC zelf ook net aan een onderzoek begonnen. Ook wij gebruikten daarvoor Pangram. En wat bleek: ook wij hadden stukken in de krant en online gezet die volgens Pangram voor 100 procent door AI waren geschreven. Even de cijfers op een rij. Van de 157 stukken en columns die we door Pangram haalden, signaleerde de detector bij 35 AI-gebruik. Bij 11 stukken lag het aandeel dat Pangram als AI herkende onder de 30 procent, bij 14 tussen de 30 en 75 procent en bij 10 boven de 75 procent. Enkele stukken en columns kregen zelfs de maximale score: 100 procent AI.

Het waren precies de stukken waar we zelf al twijfels over hadden die hoog scoorden op de Pangram-meter. Was er hier nou inderdaad AI gebruikt en op welke manier? We besloten auteurs na te bellen. Niet boos of beschuldigend, maar om te begrijpen wat er gebeurt: welk percentage op Pangram past bij welk AI-gebruik? Aan de andere kant van de lijn reageerde vrijwel iedereen verbaasd. Ja, ze hadden met Copilot of ChatGPT gewerkt, maar hadden niet verwacht dat de Pangram-meter (zo ver) zou uitslaan.

Op de juiste woorden komen

De auteurs hadden AI op uiteenlopende manieren gebruikt. Soms als spellingcorrector, maar vaker nog als co-auteur, zo ontdekten we. Zo lieten sommige auteurs AI losse ideeën en argumenten ordenen, terwijl anderen het gebruikten om lange teksten in te korten, de opbouw te verbeteren of zinnen scherper en leesbaarder te maken. Iemand vertelde dat hij AI verbindende teksten liet schrijven of gedachten onder woorden liet brengen. Eén schrijver had AI gevraagd om zijn stuk geschikter te maken voor publicatie in een grote krant. En er waren twee auteurs die zeiden dat Nederlands niet hun moedertaal is, en dat zij daarom AI hadden gebruikt om op de juiste woorden te komen.

Alle nagebelde auteurs vonden dat ze zelf de regie hadden gehouden. De ideeën waren van hen, zij bepaalden welke suggesties van AI ze overnamen en ze stonden achter de uiteindelijke tekst. Iedereen zei: de inhoud, het denkwerk en de opinie zijn gegarandeerd van mij. Maar is dat werkelijk zo?

AI gebruiken om een stuk hier en daar stilistisch op te knappen, dat hoeft geen doodzonde te zijn. Maar heeft de machine een paar woorden aangedragen of de hele tekst herschreven, opgebouwd en misschien bedacht? En welke woorden kiest AI, zou de auteur die zelf ook gebruiken? En wat als AI de oorspronkelijke structuur verandert, formuleringen herschrijft of argumenten aanscherpt, aanvult of anders ordent? Hoeveel van een opiniestuk is dan nog werkelijk van de schrijver? Dat is voor ons ontzettend lastig in te schatten en te achterhalen.

Opiniestukken zijn veel kwetsbaarder voor AI dan onze journalistieke verhalen. Om te beginnen zijn opinie-auteurs doorgaans geen mensen die dagelijks artikelen publiceren of veel ervaring hebben met schrijven voor een breed publiek. Die vragen dus eerder hulp aan AI. Daarnaast is een opiniestuk is iets anders dan een reportage, een achtergrondstuk of een nieuwsbericht. Daar staan gebeurtenissen, feiten en reacties van mensen centraal. Zelf opgehaalde informatie. In een opiniestuk neemt de auteur een stelling in en onderbouwt zijn of haar visie met argumenten. Dat is bij uitstek wat AI goed kan: een argumentatie opzetten.

Experts waarschuwen dat AI geen neutrale technologie is. In de systemen zitten ontwerpkeuzes en vooringenomenheden. En als steeds meer auteurs dezelfde systemen gebruiken, dan zou je kunnen beredeneren dat er een soort consensustaal ontstaat. Met formuleringen en redeneerpatronen die op elkaar gaan lijken. Je krijgt een verschraling van het debat, een gebrek aan perspectieven. Eenheidsworst.

En dan is er nog een ander risico: researchen met behulp van AI. Opinie-auteurs putten geregeld uit andermans onderzoek om een betoog te onderbouwen. Nagebelde auteurs vertelden dat ze AI „voor hun bronnenlijst” gebruikten. Schrijvers die AI vragen om studies te zoeken, moeten goed opletten. We weten inmiddels dat AI kan hallucineren, en bronnen kan aandragen die niet bestaan of in werkelijkheid iets anders beweren. Onze redactie controleert dus ook altijd alle onderzoeken die in een stuk worden aangehaald.  

Overigens zou je ook kunnen stellen dat AI voor de opiniepagina’s juist een emanciperende werking kan hebben. Mensen die de taal van het publieke debat minder goed beheersen, kunnen met hulp van AI wel hun stem laten horen. Maar ook dat moet natuurlijk geen vrijbrief zijn om de machine alles te laten over nemen.

Waar ligt de grens?

Honderd procent AI, dat willen we niet. Uiteraard. We vergeleken AI-gebruik in eerste instantie met plagiaat: deze tekst is niet van jou, dus moeten we hem weigeren. Nu vinden we dat AI een hulpmiddel is dat kan helpen om ideeën en teksten betere op papier te krijgen. Maar wat is van dan van jezelf en wat is van de machine? En blijft de auteur wel leidend, of stiekem niet? En waar ligt de grens? We moeten als opinieredactie opnieuw bedenken: wat vinden we acceptabel AI-gebruik, want tegenhouden gaat niet, zo veel is duidelijk.

Voorlopig kiezen we er voor om alle stukken die we geschikt vinden voor publicatie door Pangram te halen. Slaat de detector aan, dan bellen we de auteur. Slaat de meter niet uit, maar vertrouwen we de tekst niet, dan bellen we ook. We vragen of mensen AI hebben gebruikt en proberen te reconstrueren hoeveel invloed de machine op de uiteindelijke tekst heeft gehad. We vragen naar eerdere versies en prompts. We proberen vast te stellen in hoeverre het stuk de stem van de auteur weergeeft.

We hebben inmiddels een paar opiniemakers gevraagd om stukken opnieuw te schrijven, in eigen woorden. We hebben ook stukken uiteindelijk niet gepubliceerd omdat onduidelijk was hoe diep AI verweven zat in de tekst. Het is extra werk, maar zorgvuldigheid en betrouwbaarheid horen bij goede journalistiek. En onthoud: daar zijn we voor, om auteurs van buiten de krant te helpen hun mening onder woorden te brengen, hun stukken te structureren en zinnen aan te scherpen. Met plezier.

Hoe werkt Pangram?

De makers van Pangram leggen op hun site uit hoe het werkt. Het programma – zelf óók een AI-model – probeert in te schatten of een tekst geheel of gedeeltelijk door AI is geschreven door te kijken naar hóe een tekst is geschreven, niet zozeer naar wat erin staat.

Daarbij zoekt Pangram naar patronen. De ontwikkelaars trainden het programma met miljoenen teksten van mensen, geschreven in een tijd dat generatieve AI nog niet bestond. Vervolgens lieten ze AI over dezelfde onderwerpen teksten schrijven. Met ongeveer dezelfde toon en lengte. Op basis van die grootschalige vergelijking kan Pangram zien welke verschillen er zijn tussen de manier waarop mensen schrijven en de manier waarop AI dat doet.

Die verschillen zitten in allerlei keuzes. Mensen maken tijdens het schrijven voortdurend afwegingen: welke woorden gebruik ik, hoe bouw ik een zin op, hoe bouw ik een stuk op, hoe verbind ik teksten aan elkaar en ga zo maar door. AI doet dat anders. Een AI-model als GPT of Claude bouwt een tekst op door te berekenen welke woorden er waarschijnlijk moeten volgen op de woorden die er al staan. Dus bij de zin I’m going to take my dog for a…, zal AI kiezen voor walk of run en niet voor painting.

AI schrijft dus op een manier die te herkennen is. De machine kiest vaak dezelfde soort woorden en zinsopbouw. En zo ontstaan er duidelijke patronen, die Pangram herkent en op honderdduizenden kenmerken vergelijkt met menselijke teksten.

Volgens de makers zit Pangram er niet vaak naast. Ze testten het programma met een miljoen Engelse teksten die allemaal door mensen waren geschreven. Van elke 24.000 teksten dacht Pangram gemiddeld bij één tekst ten onrechte dat die door AI was geschreven. Bij bijna een miljoen teksten in 104 andere talen ging het nog minder vaak mis. Ook bij tests met Nederlandse teksten maakte Pangram weinig fouten. Onafhankelijk wetenschappelijk onderzoek wijst ook uit dat Pangram feitelijk nooit een tekst onterecht aanmerkt als AI-gegenereerd.

Toch is daarmee nog niet alles gezegd. Schrijvers kunnen inmiddels ook zogenoemde humanizers gebruiken. Dat zijn programma’s die AI-teksten herschrijven zodat ze menselijker lijken, om zo de AI-detectoren te omzeilen. En wie weet zijn er straks dan weer programma’s die kunnen checken of je een humanizer hebt gebruikt.

Maak NRC jouw voorkeursbron op Google

Bij Google kan je nu zelf aangeven welke nieuwsbronnen jij vaker wil zien in je zoekresultaten.Meer informatie

Kunstmatige intelligentie

Lees meer

Source: NRC

Previous

Next