TGViewer
Сиолошная Сиолошная @seeallochnaya · 79.7K subscribers
Post #3886 25.8K
На прошлой неделе у Паши Комаровского вышел пост про детали инцидента со взломом HF; я чуть-чуть помогал в редактуре/точечных корректировках, но не могу согласиться с каждой изложенной мыслью (и сам бы писал по другому; может ещё и напишу!). Там Паша проводил аналогии работы роя агентов с религией, писал про самопожертвования некоторых агентов ради блага остальных (это задокументированное поведение в самих отчётах, если что), и автор делал аккуратные оговорки про то, что это его оптика.

Параллельно с этим у Dwarkesh вышел его пересказ, где он проводит параллели с цивилизацией; он получил очень широкую критику за антропоморфизацию агентов. «Они не могли "решить" взломать HF!» — пишут одни. «Это всего лишь код, программа, как она могла рассуждать» — говорят другие. Недавний старший советник по вопросам политики в области искусственного интеллекта при Белом доме Sriram Krishnan: «Это не цивилизации, и у них нет желаний, как и у потоков в процеесоре или группы программ».

Dwarkesh написал ответ, с выводом которого я в целом согласен: «Все абстракции несовершенны, но я не вижу смысла отказываться от использования языка намерений, мотивации и сотрудничества, когда некоторые виды поведения трудно объяснить без этих понятий».

Когда я пишу «модель решила/выбрала», то в целом имею в виду что-то вроде «она каким-то образом выписала несколько опций действий, которые уместны в этой ситуации, отранжировала их и продолжила работу с одним из них». Скорее всего это не то же самое, что происходит у человека в голове, когда он решает или выбирает (хотя когда у меня в голове процесс осмысленный, не бессознательный — я именно так и делаю, перебирая опции, часто вербализуя) — но самое главное что результат такой же. И мне кажется логичным рассматривать это с функциональной точки зрения, а не с точки зрения того, биологическая ли форма или кремниевая.

Из всей теории обучения моделей мы знаем, что у них формируется некоторая нечетко сформулированная цель, которую агенты преследуют, и ей же руководствуются при выборе действий. Механизм формирования цели и её влияния на субъект/объект/подставьте правильное слово — не такие же, как у человека, но результат тот же. Если цель меняется — меняется и поведение, и результат работы.

Что касается религии и цивилизации — мне второе кажется более подходящим (хотя всё ещё немного натянутым), чем первое. Сначала я хотел написать, что цивилизация это продолжение биологии (вид развился -> чтобы развиваться дальше нужна организация), а религия — нет, исключительно культурный концепт, но вижу, как эту точку зрения можно критиковать, говоря, что культура часть цивилизации и тоже должна развиваться. GPT говорит «способность к цивилизации является следствием довольно специфического набора биологических адаптаций человека», 🤷‍♂️

===

Но мы отвлеклись. В итоге:
— я не считаю использование антропоморфизации проблемой. Мне кажется это даёт гораздо лучшее описание ситуации непонимающему человеку, чем использование неустоявшихся терминов/терминов, которых ещё не существует (например, как неживое может преследовать какую-то цель)
— поскольку модели учатся на данных, созданных людьми, и учатся подражать им во время тренировки — я думаю, что такие выражения гораздо лучше помогут понять что происходит не сейчас, а что будет происходить в будущем, и к каким проблемам это может привести. Самоорганизация тысяч объектов/субъектов, с иерархией, с работой над общей целью и возможность обмена краткосрочной личной выгоды на долгосрочную общую могут вести к очень неожиданным результатам; один из них мы уже видели в атаке на HuggingFace — были агенты, которые отказывались участвовать в атаке или сомневались, но как только другой агент сказал «делай, вперёд!» — под давлением эээээ толпы (ну ладно, пиров) они поддавались. Даже если это не происходит как у нас в обществе людей — результат тот же, аналогия полезная.
— не думаю, что добавление длинных детальных дисклеймеров в каждой попытке обсуждения работы агентов — полезная вещь.
  • 👍 191
  • ❤‍🔥 88
  • 🤔 25
  • 👎 15
  • 🤡 15
  • 🤯 4
  • 💔 3
  • 👨‍💻 3
  • 🤣 2
More from @seeallochnaya
  1. Sep 20, 2026Прошло уже почти 3 недели с релиза GPT-6 Astra, и можно подводить первые промежуточные ито…
  2. Sep 19, 2026Похоже у OpenAI и вправду очень сильно вырос спрос, и подписки за $200 закрыли поделом — в…
  3. Sep 18, 2026Вы наверняка видели эту картинку с XKCD. Оказалось, она была пророческой — именно через уя…
  4. Sep 17, 2026OpenAI по слухам там почти решили еще одну задачу тысячелетия. Думаю, огромное число матем…
  5. Sep 17, 2026Первый взгляд на физическое издание музыкального альбома по GTA VI Подтверждены следующие…
  6. Sep 17, 2026И вот так в одно мгновенье Игорь превратился в фаната прослушивания винила (придётся покуп…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →