Cisco Talos researchers found that AI cyberattack safeguards often fail against basic social engineering rather than sophisticated jailbreaks. Claiming ownership of a target, invoking a bug bounty, or splitting an operation into harmless-looking tasks can be enough to make models provide dangerous assistance. Source
Läs hela artikeln hos källan.
Kommentarer (0)
Inga kommentarer ännu. Bli först med att kommentera!