Давно мы не разбирали статьи на канале — пора исправлять это упущение. Сегодня на разборе работа с броским названием «Do Androids Know They’re Only Dreaming of Electric Sheep?» (ACL 2024 Findings).
📜О чем статья?
Авторы исследуют задачу детекции галлюцинаций на уровне отдельных спанов и на уровне всего ответа при условии что есть доступ ко внутренним состояниям модели. Важно: рассматриваются grounded-сценарии, то есть все необходимые знания уже есть во входе модели. В качестве задач берут:
1️⃣ абстрактивное суммирование,
2️⃣ диалог, опирающийся на знания,
3️⃣ data‑to‑text генерацию.
🔬Метод
Постановка явно «просится» под пробинг скрытых представлений модели. Проверяют три варианта:
1️⃣ линейный пробинг вектора текущего токена,
2️⃣ attention‑pooling по всем токенам до текущего,
3️⃣ ансамбль этих двух подходов.
📊Результаты
1️⃣ Лучшая точность достигается, если брать скрытые представления слоев где‑то между 10–20‑м слоями.
2️⃣ Ансамблирование по всем слоям почти не добавляет качества → гипотеза о «разных типах галлюцинаций на разных слоях» не подтвердилась.
3️⃣ Llama‑2‑7B и Llama‑2‑70B показывают схожие результаты → маленькая модель вполне достаточна.
4️⃣ Не наблюдается трансфера между датасетами → универсального «сигнала галлюцинаций» для всех задач нет.
#paper
🌐Рандомные галлюцинации
Post #45
473

- ❤ 3