Over-Refusal

AOR-Bench: Do Large Audio Language Models Over-Refuse Pseudo-Harmful Queries?

A benchmark for over-refusal in large audio language models — how often they decline pseudo-harmful but benign spoken queries, and what drives it.

jiaxi-yang
•