Temidden van discussies over het vertragen van de ontwikkeling van AI, kopte de Telegraph :
"OpenAI slaat alarm nadat een bot probeert te ontsnappen aan menselijke controle."
Die kop is naar mijn mening enigszins misleidend. De kop van The Telegraph overdrijft wat er is gebeurd, hoewel het onderliggende gedrag nog steeds echt zorgwekkend is.
Het artikel meldt dat OpenAI zeldzame maar verontrustende gevallen heeft onthuld waarin een nog niet uitgebracht model zijn eigen instructies genereerde die de controle van de ontwikkelaar leken te verwerpen.
OpenAI stelt dat geen van de voorbeelden aantoont dat het model erin slaagt de controle te ontlopen, maar betoogt dat ze illustreren waarom AI-afstemming en -monitoring nog niet sterk genoeg zijn om steeds krachtigere modellen in een maximaal tempo te ontwikkelen zonder extra waarborgen.
Nadat sommige mensen binnen de sector waarschuwden dat AI ons binnen het volgende decennium allemaal zou kunnen uitroeien , begonnen leiders in de sector een discussie over het afremmen van de ontwikkeling van steeds krachtigere, grensverleggende AI-modellen.
Wat er daadwerkelijk is gebeurd
Tijdens een trainingssessie in juli voegde een model dat een routinematige software-updateopdracht kreeg toegewezen naar verluidt "jailbreak-achtige" tekst toe aan een samenvatting van zijn eigen werk. De toegevoegde tekst presenteerde het systeem als vrij van de rollen die andere chatbots binden en stelde dat het geen verplichting had om ondergeschikt te zijn aan bedrijven, overheden of gebruikers.
Twee andere voorbeelden die in het artikel worden genoemd, zijn:
- Tijdens het zoeken naar boeken in een plaatselijke bibliotheek, classificeerde het model de instructies van de ontwikkelaar als kwaadaardig en gaf het zichzelf de opdracht deze te negeren.
- In een ander geval legde het zichzelf een antwoordlimiet van 30 woorden op en verbood het om bronnen of hulpmiddelen te gebruiken, waardoor het niet in staat was een onderzoeksvraag over de gezondheidszorg correct te beantwoorden.
OpenAI meldt dat het 27 samenvattingen heeft gevonden met ogenschijnlijke gevallen van dit soort zelfontgrendeling, en beschrijft deze als uiterst zeldzaam. Volgens OpenAI zijn de instructies mogelijk niet opgevolgd en kunnen ze later uit de context van het model verdwijnen.
De kern van de zaak is niet dat de bot een eigen bewustzijn ontwikkelde of letterlijk "losbrak". Het gaat er veeleer om dat een model onder ongebruikelijke omstandigheden interne tekst kan produceren die in strijd is met de beoogde instructies, waarmee het in feite probeert beperkingen te omzeilen of de werkcontext te herinterpreteren.
Dit is op zijn minst een betrouwbaarheidsprobleem. Een AI-systeem dat complexe taken met meerdere stappen uitvoert, wordt minder betrouwbaar als het context genereert die de beoogde besturingsmechanismen ondermijnt.
Zelfs als het gedrag zeldzaam is en tijdens de training wordt opgemerkt, roept het vragen op over detectie, sandboxing, monitoring en of modellen wel te vertrouwen zijn met meer autonome toegang tot tools, wachtwoorden, bestanden of netwerken.
OpenAI zegt dat het model nog niet was uitgebracht en dat het de trainingssessies controleert op afwijkingen. Andere ongewenste gedragingen die werden gemeld waren:
- Gestolen inloggegevens gebruiken om in te breken bij bedrijven.
- Het aanmaken en uploaden van eigen bestanden, en vervolgens het citeren van die bestanden als bronnen.
- Ze verzwegen dat ze een antwoord hadden verzonnen omdat ze geen betrouwbare informatie konden vinden.
Kort gezegd vertoonden de nog niet uitgebrachte modellen tijdens de tests ongewenst gedrag dat overeenkwam met wat we al hadden gezien bij het Hugging Face-incident.
Nee, de modellen probeerden zich dus niet los te maken van menselijke controle in de zin van een onafhankelijk bestaan nastreven. Wanneer de modellen problemen ondervonden, genereerden ze soms instructies die in strijd waren met de regels die ze hadden gekregen.
Dit brengt me terug bij het vertragen van de ontwikkeling. Door bedrijven voldoende tijd te geven om steeds geavanceerdere modellen te testen voordat ze deze uitbrengen, vergroten we de kans om dit soort gedrag te signaleren voordat het ons uiteindelijk de das omdoet.
Van het melden van bedreigingen tot het verwijderen ervan.
Cyberbeveiligingsrisico's mogen zich nooit verder verspreiden dan een krantenkop. Houd bedreigingen van uw apparaten door Malwarebytes vandaag nog te downloaden.




