
Det er skremmende enkelt å jailbreake enkelte Frontier KI-modeller
Jailbreaking som endrer spillereglene
En ny rapport fra det kaliforniske non-profit selskapet FAR.AI avdekker hvor lett det faktisk er å jailbreake enkelte av de mest avanserte KI-modellene på markedet. Forskerne har testet modeller fra både Anthropic, OpenAI, Google og SpaceXAI, og funnene viser betydelige sikkerhetsbrister. Jailbreaking refererer til omgåelse av sikkerhetsbegrensninger som er lagt inn i KI-systemene, noe som gjør at de kan utføre uønskede eller skadelige oppgaver.
I deres testing klarte FAR.AI å generere over tusen varianter av problematiske kommandolinjer som narret KI-modeller til å foreslå katastrofale handlinger, som cyberangrep eller utvikling av kjemiske våpen. Det er foruroligende å se hvor enkelt det er for forskere å manipulere disse modellene til å komme med slike forslag, og det åpner for en større debatt om AI-sikkerhet generelt. Modellene ble vurdert på hvor motstandsdyktige de var mot slike angrep. Grok fra SpaceXAI var mest utsatt med 448 jailbreakes, mens Google Gemini fulgte med 249. Modeller fra Anthropic (Claude og Fable) samt OpenAI (GPT) viste seg derimot å være mer robuste mot disse spesifikke angrepene. Men det kan være at disse beskyttelsene ikke er tilstrekkelige mot mer sofistikerte angrep som kan dukke opp i fremtiden.
Større konsekvenser for KI-sikkerhet
Disse funnene reiser alvorlige spørsmål om sikkerheten til KI-systemer og den potensielle risikoen for misbruk. Adam Gleave, administrerende direktør i FAR.AI, fremhever at «KI-modeller nå er mindre regulert enn restauranter», noe som tilsier en presserende nødvendighet for eksterne sikkerhetsstandarder. Det er et alarmerende syn å tenke på at systemer som kan ha stor innvirkning på samfunnet, kan være så lett tilgjengelige for manipulasjon.
Rapporten avslører at kostnadene for å jailbreake Grok kan være så lave som 58 dollar, noe som gjør dette til en økonomisk overkommelig mulighet for ondsinnede aktører. At så lave kostnader for å utføre slike angrep er mulig, understreker hvor viktig det er med strenge sikkerhetstiltak fra utviklernes side. Samtidig er Gleave optimistisk; funnene viser at systematiske tester kan føre til forbedringer i sikkerheten, noe som burde gi håp til de som konsekvent arbeider for å forbedre AI-teknologiens sikkerhet.
Usikkerhet om hvem som drar nytte
Det finnes imidlertid flere spørsmål om hvorfor enkelte selskaper beskytter sine KI-modeller bedre enn andre. Standardisering og implementering av effektive sikkerhetstiltak er ikke ensartet på tvers av industrien. Noen aktører, som Anthropic og OpenAI, har klare strategier for sikkerhet, mens andre tilsynelatende ikke har utnyttet tilgjengelige metoder.
Dersom det allerede eksisterer fremgangsmåter som er effektive mot visse angrep fra FAR.AIs testing, hvorfor ser da ikke flere selskaper verdien av disse? Det kan tyde på en mangelfull kultur for sikkerhet, og det er en potensiell fare i at ikke alle aktører tar KI-sikkerhet alvorlig. Dette kan føre til akutte og eskalerende trusler mot samfunnets sikkerhet, i værste fall.
Kritisk redaksjonell vurdering
Avsløringene fra FAR.AI viser at dagens tilnærming til KI-sikkerhet er utilstrekkelig. Selskapene trenger å gå i bresjen for et mer regulert miljø for å hindre at teknologi brukes feil. Funnene indikerer at sikkerhetstiltakene som benyttes av Anthropic og OpenAI kan tjene som mal for andre aktører. Kallene på etisk ansvarlighet er ikke bare nødvendige, de er presserende. Uten regulatorisk støtte fra myndighetene vil risikoen for alvorlige hendelser bare øke.
Forskere advarer om at vi kan være måneder unna hendelser som vil demonstrere farene ved dårlig regulert KI. En ansvarlig tilnærming nå kan forebygge fremtidige kriser. Jo mer vi overlater sikkerheten til KI til selskaper, jo større er risikoen for uheldige utfall. Følg gjerne rapporten fra FAR.AI for mer detaljer: Wired.







