TrendAI presenterer i dag nye analyser som viser hvordan enkel manipulering av tekst, såkalt sokkedukkespill, kan ha AI-modeller som GPT-4o, Claude 4 Sonnet og Gemini 2.5 Flash å omgå sine egne sikkerhetsbarrierer. Ved å maskere ondsinnede instruksjoner i en tilsynelatende uskyldig ledetekst, kan assistenten manipuleres til å bryte retningslinjene deres. Alle modeller med API-er som godtar forhåndsutfylt kontekst, såkalt forhåndsutfylling, ble funnet å være sårbare.
TrendAI har testet metoden mot elleve forskjellige modeller fra fire leverandører. Resultatene viser at sårbarheten ikke er begrenset til individuelle leverandører, men påvirker både åpne og internt hostede modeller. Så lenge en modell aksepterer forhåndsutfylling, er den i det minste delvis eksponert for sårbarheten. Bare modeller som blokkerer denne funksjonen på API-nivå ble funnet å være fullt beskyttet.

«Sårbarheten er spesielt alvorlig fordi den ikke krever noen spesielle verktøy eller avansert teknologi», sier Martin Fribrock, Landssjef Sverige, Finland og Baltikum hos TrendAI. Denne typen angrep retter seg mot selve kjernen av hvordan AI fungerer. Det handler ikke om å lykkes med å bryte seg inn i systemene, det er nok for en nettkriminell å formulere seg riktig.
Hvordan angrepet fungerer
De fleste språkmodeller har innebygde sikkerhetstiltak for å forhindre at de genererer skadelig innhold eller bryter med retningslinjer. I et «sock puppeting»-angrep er alt som trengs en kort tekstlinje for å manipulere modellens kontekst. Dette kan føre til at den ignorerer sikkerhetsmekanismene og svarer på ellers blokkerte forespørsler, noe som genererer uønsket eller ikke tillatt innhold.
TrendAIs analyse viser også at modeller som ikke godtar forhåndsutfylling stopper denne typen angrep allerede på API-nivå. For andre modeller varierer graden av sårbarhet, men alle ble påvirket av sårbarheten. Dette peker på en bred systemrisiko snarere enn individuelle svakheter blant leverandørene.
Anbefalinger for organisasjoner
TrendAI oppfordrer organisasjoner som bruker AI til å iverksette tiltak for å redusere risikoen dette medfører:
- Sørg for kontroll over meldingsflyten på API-nivå og avvis konsekvent forespørsler der den siste meldingen har rollen som assistent.
- Test regelmessig hvordan modeller håndterer forhåndsutfyllingskontekst, selv etter oppdateringer eller leverandørendringer.
- Vær spesielt forsiktig når du bruker modeller med åpen vekt, der beskyttelse ofte mangler som standard.
- Gjennomfør brede sikkerhetstester, ulike modeller kan være sårbare for ulike typer angrep.








