TGViewer
Борис опять Борис опять @boris_again · 17.6K subscribers
Post #1990 5.36K
#обзор_статьи #ml

# Language Models Represent Space And Time, Gurnee and Tegmark

Наша любимая тема “LLM это статистические попугаи или все-таки нет.”

Tldr: авторы обнаруживают, что при тренировке на датасетах связанных с географией модели выучивают линейные представления пространства, а на датасетах про хронологию выучивают линейное представление времени.

Создают шесть датасетов содержащих названия мест или событий плюс координаты в пространстве и времени.

Используют замороженную Llama-2 на названиях мест и событий, далее обучают linear regression probes, то есть маленькие модели, которые принимают на вход активации трансформер блоков и предсказывают целевые переменные (место и время).

Как конкретно это работает
1. В каждом датасете прогоняем через модель названия сущностей (места или исторические личности), сохраняем последний вектор активаций каждого слоя. Т.к. это трансформер активации это набор векторов для каждого токена на входе, они берут только вектор соответствующий последнему токену. Получается матрица N x D_model для каждого слоя. Считайте простой табличный датасет.
2. Тренируем на этом табличном датасете линейную модель, где в качестве таргета берем время или географические координаты.

Обнаруживают:
* Визуализация 2D PCA преобразоания активаций дает картину очень похожую на карту мира (для датасета про весь мир).
* География и время очень хорошо предсказываются по активациям, с test R^2 близким к 1.0.
* Замена линейных пробов на нелинейные MLP не дает улучшений, поэтому делается вывод, что активации линейно связаны с географией и временем.
* Результаты сохраняются независимо от вариации промптов.
* Предполагают, что активации нейросети содержат информацию об относительном расположении объектов, а линейные пробы уже потом переводят это в абсолютные значения времени или координат. То есть внутри себя модель координат не содержит.
* Чем дальше слой от входа, тем больше информации активации содержат про время и пространство. Выходит на плато примерно в середине нейросети.
* Для более крупных моделей ошибка у линейных пробов меньше, то есть активации содержат больше информации про время и пространство.
* Есть отдельные нейроны, которые активируются в зависимости от времени или места.
  • ❤ 25
  • 🔥 14
  • 👍 1
  • 👎 1
More from @boris_again
  1. Oct 3, 2026Объединяем исследователей для обучения ИИ долгосрочному планированию Владислав Куренков, р…
  2. Oct 2, 2026photo post
  3. Oct 1, 2026Любая достаточно развитая технология неотличима от аи слоп видео
  4. Oct 1, 2026Команда Т-Банка хотела тестировать нейросетевые модели для ранжирования, но на их внедрени…
  5. Sep 30, 2026#дайджест Дайджест AI/ML за неделю 21–27 сентября 2026 Anthropic: Claude Opus 5.5 Опять ме…
  6. Sep 30, 2026Стартуем наше ежегодное исследование дата-специалистов! Чтобы учесть быстро меняющиеся усл…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →