TGViewer
Рандомные галлюцинации Рандомные галлюцинации @nlpbotan · 291 subscribers
Post #45 473
Давно мы не разбирали статьи на канале — пора исправлять это упущение. Сегодня на разборе работа с броским названием «Do Androids Know They’re Only Dreaming of Electric Sheep?» (ACL 2024 Findings).

📜О чем статья?

Авторы исследуют задачу детекции галлюцинаций на уровне отдельных спанов и на уровне всего ответа при условии что есть доступ ко внутренним состояниям модели. Важно: рассматриваются grounded-сценарии, то есть все необходимые знания уже есть во входе модели. В качестве задач берут:
1️⃣ абстрактивное суммирование,
2️⃣ диалог, опирающийся на знания,
3️⃣ data‑to‑text генерацию.

🔬Метод

Постановка явно «просится» под пробинг скрытых представлений модели. Проверяют три варианта:
1️⃣ линейный пробинг вектора текущего токена,
2️⃣ attention‑pooling по всем токенам до текущего,
3️⃣ ансамбль этих двух подходов.

📊Результаты

1️⃣ Лучшая точность достигается, если брать скрытые представления слоев где‑то между 10–20‑м слоями.
2️⃣ Ансамблирование по всем слоям почти не добавляет качества → гипотеза о «разных типах галлюцинаций на разных слоях» не подтвердилась.
3️⃣ Llama‑2‑7B и Llama‑2‑70B показывают схожие результаты → маленькая модель вполне достаточна.
4️⃣ Не наблюдается трансфера между датасетами → универсального «сигнала галлюцинаций» для всех задач нет.

#paper
🌐Рандомные галлюцинации
  • ❤ 3
More from @nlpbotan
  1. Jun 3, 2026Сегодня мы рады представить результаты нашей работы последних месяцев — семейство специали…
  2. Jun 3, 2026https://huggingface.co/papers/2606.00683
  3. May 4, 2026Продолжаем неторопливо разбирать статьи с #ICLR 2026 🇧🇷 в этот раз LiteCoST — двухэтапны…
  4. May 4, 2026photo post
  5. Apr 28, 2026🔥 ICLR 2026: детекция LLM-контента через галлюцинации в библиографии? Подошла к концу одн…
  6. Apr 27, 2026📣 CFP AIST 2026 Приглашаем подать статью на AIST 2026 – 13-ю международную конференцию по…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →