TGViewer
FAANG Master FAANG Master @faangmaster · 2.94K subscribers
Post #598 1.76K
On the Biology of a Large Language Model

Ученые из компании Anthropic (которая делает Claude) периодически публикуют работы, которые исследуют то, как LLM думают, рассуждают, как можно сделать их безопасными.

Очередная интересная работа: On the Biology of a Large Language Model. Они использовали новый метод - Attribution Graphs. Он позволяет более понятно и наглядно показать, как в реальности LLM приходит к ответу на запрос.
Например, для запроса: Fact: the capital of the state containing Dallas is
В LLM активируется кластера фич, которые отвечают за каждое отдельное слово: capital, state, Dallas.
Далее capital и state активируют фичу "say capital", которая активируется, когда нейросеть хочет предсказать столицу. Фича Dallas активирует фичу Texas. И наконец фича "say capital", Dallas, Texas активируют фичу "say Austin", которая предсказывает Austin следующим словом.
Аналогично, нейросеть работает при сложении. Она не размышляет в виде формальных логических законов арифметики. А также работает ассоциативно (интуитивно). Но если ее попросить объяснить, как нейросеть додумалась до ответа - она ответит совсем другое! Она ответит то, что мы хотим услышать, а не то, как она в реальности дошла до ответа. Про это есть отельное исследование, где исследуется CoT (chain of thought). Это когда модель проводит рассуждения. И оказывается, что то, что она выводит в качестве рассуждения - это не совсем то, как она в действительности рассуждает внутри.
Видео в тему статьи:
https://www.youtube.com/watch?v=-wzOetb-D3w

https://youtu.be/mU3g2YPKlsA?si=acOhiF5o19DChonN
  • 👍 11
  • 😁 4
  • ❤ 1
  • 🙉 1
More from @faangmaster
  1. Sep 13, 2026Навье-Стоксгейт 8 сентября OpenAI заявила, что её невыпущенная модель решила одну из семи…
  2. Sep 3, 2026Uber совместно с британским стартапом Wayve запускает роботакси в Лондоне Пришла нотификац…
  3. Aug 20, 2026Новый HTTP метод QUERY Этим летом в спецификацию HTTP добавили новый метод - QUERY. Добавл…
  4. Aug 15, 2026IOI 2026 В Ташкенте прошел межнар школьников по информатике. Результаты: https://stats.ioi…
  5. Jul 30, 2026В свое время я закончил МФТИ. Относительно непростой вуз для обучения. Закончил неплохо. З…
  6. Jul 18, 2026Документалка про Java В продолжение темы документалок, вышла документалка про Java. Трейле…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →