Kryptovalutaticker:
technology från Arxiv cs.ai

DDOR: Delta Debugging for Explainable Overrefusal Testing and Repair

Qinyan Zhou, Peixin Zhang, Jun Sun, Haonan Zhang, Dongxia Wang
Jun 3, 2026 at 04:00
12 Visningar
0 Kommentarer

arXiv:2606.03601v1 Announce Type: cross Abstract: While safety alignment and guardrails help large language models (LLMs) avoid harmful outputs, they can also induce overrefusal, i.e., unwarranted rejection of benign queries that merely appear risky. We present DDOR (Delta Debugging for OverRefusal), a fully automated and explainable framework...

Läs hela artikeln hos källan.

Var detta hjälpsamt?
Dela:

Kommentarer (0)

Vänligen logga in för att publicera en kommentar

Inga kommentarer ännu. Bli först med att kommentera!