AI-beperkingen hinderen werk van beveiligingsonderzoekers

Beveiligingsonderzoekers zeggen dat veiligheidsfilters in AI-modellen ook legitiem onderzoek naar softwarelekken bemoeilijken. Zij wijken daardoor vaker uit naar lokaal draaiende open-source modellen zonder gebruiksbeperkingen.

Een smartphone toont het Claude-model van Anthropic voor het logo van het AI-bedrijf
Een smartphone toont het Claude-model van Anthropic voor het logo van het AI-bedrijf · Beeld: Netgebeurd (AI-illustratie)

AI-bedrijven beperken het gebruik van hun modellen voor cyberaanvallen met veiligheidsfilters en toegangsprogramma's voor gecontroleerde gebruikers. Onderzoekers die kwetsbaarheden opsporen voordat criminelen die kunnen misbruiken, zeggen dat die beperkingen ook hun werk vertragen.

OpenAI biedt daarvoor het programma Trusted Access for Cyber. Anthropic heeft het Cyber Verification Program. Goedgekeurde gebruikers krijgen via zulke programma's toegang tot modellen met minder strenge beperkingen voor cybersecuritytaken.

Chris Anley, hoofdwetenschapper bij beveiligingsbedrijf NCC Group, zegt dat het laten testen van een mogelijke exploit door een AI-model belangrijk kan zijn om te bevestigen dat een softwarefout daadwerkelijk een lek is. Een model dat een verzoek direct weigert, belemmert volgens hem ook de verdediging. "Dezelfde tool is zowel een offensief hulpmiddel als een defensief hulpmiddel, en die twee zijn niet echt van elkaar te scheiden."

Onderzoekers kiezen voor lokale modellen

Sommige onderzoekers stappen bij zulke weigeringen over op open-source modellen zonder ingebouwde veiligheidsfilters. Deze modellen kunnen lokaal draaien, waardoor gegevens over nog onbekende kwetsbaarheden niet naar een cloudomgeving hoeven te worden gestuurd.

Paolo Stagno, technisch directeur van CrowdFense, zegt dat zijn bedrijf geavanceerde AI-modellen inzet voor reverse engineering, het analyseren van bestaande software. Voor het opsporen van kwetsbaarheden en het ontwikkelen van exploits kiest het bedrijf voor lokale open-source modellen. Stagno wil voorkomen dat gevoelige gegevens over een kwetsbaarheid buiten de eigen omgeving terechtkomen of in toekomstige trainingsdata worden opgenomen.

Giuseppe Cali, die zero-days opspoort en exploits ontwikkelt, ervaart de filters minder als obstakel. Hij gebruikt AI vooral om code te doorgronden en hulpmiddelen te maken, niet voor het vinden of uitbuiten van fouten. "Ik wil de ontdekking en het inzetbaar maken van de fout zelf blijven doen", zegt hij.

Onvoorspelbare reacties

Chris Thompson, directeur van cybersecuritybedrijf RemoteThreat en oprichter van Offensive AI Con, zegt dat de filters in geavanceerde modellen niet altijd consequent werken. Ook deelnemers aan gecontroleerde programma's zouden volgens hem veel tijd kwijt zijn aan het achterhalen waarom een model een antwoord weigert of te sterk aanpast.

Een onderzoeker bij een fabrikant van smartphoneonderdelen zegt dat de AI-tools van Anthropic door strenge filters nauwelijks bruikbaar zijn voor het zoeken naar kwetsbaarheden. De werkgever van de onderzoeker neemt niet deel aan het verificatieprogramma van Anthropic.

Thompson waarschuwt dat onderzoekers hierdoor vaker kiezen voor onder meer Chinese open-source modellen, zoals GLM. Hij pleit voor ruimere toegang voor gecontroleerde onderzoekers en voor maatregelen tegen gebruikers die AI-modellen misbruiken.

Lees ook