SVHalluc: Benchmarking Speech-Vision Hallucination in Audio-Visual Large Language Models

Chenshuang Zhang, Kyeong Seon Kim, Chengxin Liu, Tae-Hyun Oh

Jun 3, 2026 at 04:00

11 Visningar

0 Kommentarer

arXiv:2606.02642v1 Announce Type: cross Abstract: Despite the success of audio-visual large-language models (LLMs), they can produce plausible but ungrounded outputs, termed hallucination. Existing benchmarks focus on environmental sounds (e.g., dog barking) to indicate event occurrence. In contrast, human speech carries fundamentally different,...

Läs hela artikeln hos källan.

Läs originalartikeln

Var detta hjälpsamt?

Dela:

Kommentarer (0)

Vänligen logga in för att publicera en kommentar

Inga kommentarer ännu. Bli först med att kommentera!

Relaterade nyheter

Länk kopierad till urklipp

SVHalluc: Benchmarking Speech-Vision Hallucination in Audio-Visual Large Language Models

Kommentarer (0)

Relaterade nyheter

Gör det själv: Kom igång med Arduino

[Ekstra] Splitter nytt Microsoft-alternativ på vei til danske kommuner

Dansk minister bekræfter deltagelse i lukket Peter Thiel-netværk

Aldersgrense gjør oss sårbare og vil ikke fungere i praksis

GTA 6 - all you need to know about Rockstar's blockbuster game

Bläddra efter kategori