Cisco Talos researchers found that AI cyberattack safeguards often fail against basic social engineering rather than sophisticated jailbreaks. Claiming ownership of a target, invoking a bug bounty, or splitting an operation into harmless-looking tasks can be enough to make models provide dangerous assistance. Source
Les hele artikkelen hos kilden.
Kommentarer (0)
Ingen kommentarer ennå. Bli den første til å kommentere!