Новости мышления нейросеток на этой неделе, над которыми надо задуматься:
-- Learning Latent Action World Models In The Wild, https://arxiv.org/abs/2601.05230 (https://t.me/gonzo_ML/4614). Что надо вычитывать из этой статьи (кроме того, что LeCun в конце длинного списка авторов молодец): по размышлению над танцами и их моделированием я всё больше убеждаюсь, что значительная часть моделирования не поддаётся "в лоб" формализации -- они устроены как язык, "продукт эволюции и культуры", то есть там нельзя подобрать приличные правила, поскольку число исключений при любом наборе зашкаливает, если подбирать правила по FCA, то появляются чудовищные онтологии (и их выучивать вредно в силу ontology revision problem, что добавление одного-двух фактов заставляет переписывать огромные куски онтологии -- так что учить приходится зыбкое), культура продолжает действовать и сами эти нормы плывут. Поскольку правила подобрать нельзя, то любые парсеры-на-правилах загнулись, и выжили только нейросетевые парсеры, хорошо отражающие "голографическое", а не "членораздельное" (вот я писал в 2016, когда ещё не было даже трансформеров, https://ailev.livejournal.com/1281819.html). И дальше мы идём в методологию, и понимаем, что многие методы (а "как танцевать танго с данной партнёршей на данной милонге" -- это ж "применять метод") примерно так же устроены, никаких "структурированных описаний" получить нельзя, ты просто танцуешь как-то, пока тебя не одолевает дзен -- и нейросетка твоя как-то не справляется с получением модели хорошего танцевания (тангерос так и говорят: "как научиться хорошо танцевать танго? Танцевать 16 лет, всё само придёт, главное -- не останавливаться". Ага, обучение "без учителя", моделирование без локальной/символьной модели, распределённые представления. Но есть и вторая сторона вопроса: цивилизация развивается членораздельными моделями, символьным моделированием, сжатием информации с её лёгким транспортом из вычислителя в вычислитель. Появляются слова, воспроизводимые рассуждения по правилам с проверяемостью результатов и самих шагов рассуждения, учёт ограничений и инвариантов и всё такое из "научной картины мира", а не этой вашей "нейрогаллюцинированной картины мира" (хотя дай нейрогаллюцинатору внешнюю память и какой-нибудь калькулятор -- он и в рассуждения по правилам сможет). Статья бьёт в эту же точку, в методологию: как описать отдельные действия (вроде "человек через дверь входит в комнату") выделив какие-то инварианты. Вместо "языка операторов и их правил композиции" моделируется сразу "пространство возможных действий", которое позволяет объяснять/предсказывать следующее наблюдение (привет, active inference), например, при анализе видео предсказать, что будет в соседнем кадре -- и в фокусе тут действия, а не "предметы обстановки" или "кто там агент". Эта штука работает, и работает хорошо. Очень хотелось бы иметь, конечно, "нейро-символическую методологию" (где гибрид "голографического и членораздельного", то есть гибрид распределённых и локальных представлений), но если нет -- хотя бы не игнорировать необходимость "распределённых представлений в методологии". А дальше та самая "безъязыковая линия", мышление идёт в latent space (а не в видео, аудио, языковой или ещё какой-то модальности), и если уж пытаться "символьно моделировать действия", то прямой путь туда, а не в исходное или конечное пространства (скажем, пространства "что мы видим"). Это очень, очень мутное место, опыта мышления про распределённые представления нет, хотя у всех в голове есть мощный процессор именно для таких представлений. Так что идите пока танцевать танго, писать проникновенные тексты с вашим тонким чувством стиля и заниматься прочим таким: пока вас не прошибёт дзен и вы не построите ваше латентное пространство, модель этого куска мира и модель ваших действий в этом мире. Распределённая методология, да. Но западная цивилизация дальше придёт в этот дзен и что-нибудь предложит.
Post #45
284