Anthropic ищет «пространство мысли» в моделях ИИ
Ученые из Anthropic ищут «пространство мысли» внутри больших языковых моделей, пытаясь понять, как ИИ «вербально мыслит». В статье «Verbalizable Representations Form a Global Workspace in Language Models» они представили концепцию J-space.
Чтобы вычислить это «пространство», Anthropic использует математический аппарат — якобиан, который позволяет отследить, как небольшие изменения в одном слое модели влияют на будущие токены. Но есть нюанс: исследователи упрощают анализ, усредняя данные по множеству промптов и позиций токенов, чтобы получить единый «глобальный якобиан» для каждого слоя. Это означает, что они предполагают, будто модель всегда начинает «думать» с нулевого вектора, а изменения — это «возмущения».
Такая попытка «подслушать» внутренний монолог ИИ показывает, как далеко мы от полного понимания механизмов машинного «сознания», где даже базовые допущения остаются под вопросом.
Post #1625
38
