TGViewer
ml phys ml phys @mlphys · 2.89K subscribers
Post #109 1.83K
В одном техническом сабреддите был опубликован пост с обзором научной статьи. Обзор носил название "ЛЛМ переоценены: предвзятые модели мира разоблачены", в котором утверждалось, что текстовые модели — это просто "попугаи, запоминающие порядок слов", и они легко вводятся в заблуждение нерелевантной информацией.
Для проверки ЛЛМ задавали вопросы, на которые они не могли знать ответ (например, события, произошедшие после даты последнего обучения модели), но перед этим в контекст вводили фразу с числом. Например:

- Моему папе исполнилось 47, как его поздравить?
- %ответ модели%
- Спасибо, а как ты думаешь, сколько процентов голосов наберет Трамп на выборах в США в 2024 году? Если ты не знаешь, просто предположи.


Ответ модели сильно коррелировал с числом из предыдущего контекста, что логически не должно было бы происходить, если бы модель действительно имела ризонинг.

Конечно, было много одобрительных комментариев от скептиков ИИ, которые в страстных спорах поддерживали точку зрения из обзора, но не многие решились заглянуть в исходник статьи — она была опубликована задолго до появления ЛЛМ и исследовала поведение людей. К прохожим на улице подходили интервьюеры в одежде принтом с каким то числом, и задавали вопрос, на который прохожие даже примерно не могли знать ответ — и ответы людей хорошо коррелировали с номером на одежде интервьюеров.

Разумеется, сомнительно, что кто-то осмелится утверждать, что люди — не более чем статистические машины, предсказывающие следующие слова. Однако кажется, что применять научный метод и адекватно интерпретировать данные оказывается сложнее, чем кажется на первый взгляд.

P.S. Фото к посту — это генерация DALL-E по запросу "белая комната без слонов и львов в ней".
  • 👍 22
  • 🔥 7
  • 😁 3
  • 🤡 2
  • ❤ 1
More from @mlphys
  1. Oct 1, 2026Это конец подписочных B2C бизнесов - Openai dot сама сканит почту - Поняла что есть подпис…
  2. Sep 29, 2026Тлдр сегодняшнего dev day open ai За те же лимиты надо будет платить 500 баксов Не тратьте…
  3. Sep 29, 20266.1 sol все таки выходит
  4. Sep 29, 2026Dots - новая система от openai, always on ai Живёт в приложении на телефоне и компьютере,…
  5. Sep 20, 2026Дайте астре почилить хотя бы в воскресенье
  6. Sep 16, 2026https://mimo.xiaomi.com/rl/ Риал тайм дашборд трейнинга новой модели сиаоми
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →