AOR-Bench: Do Large Audio Language Models Over-Refuse Pseudo-Harmful Queries?
A benchmark for over-refusal in large audio language models — how often they decline pseudo-harmful but benign spoken queries, and what drives it.
jiaxi-yang
A benchmark for over-refusal in large audio language models — how often they decline pseudo-harmful but benign spoken queries, and what drives it.