TGViewer
Философия AI Философия AI @philosphyai · 562 subscribers
Post #79 180

Forwarded from Сиолошная

На прошлой неделе у Паши Комаровского вышел пост про детали инцидента со взломом HF; я чуть-чуть помогал в редактуре/точечных корректировках, но не могу согласиться с каждой изложенной мыслью (и сам бы писал по другому; может ещё и напишу!). Там Паша проводил аналогии работы роя агентов с религией, писал про самопожертвования некоторых агентов ради блага остальных (это задокументированное поведение в самих отчётах, если что), и автор делал аккуратные оговорки про то, что это его оптика.

Параллельно с этим у Dwarkesh вышел его пересказ, где он проводит параллели с цивилизацией; он получил очень широкую критику за антропоморфизацию агентов. «Они не могли "решить" взломать HF!» — пишут одни. «Это всего лишь код, программа, как она могла рассуждать» — говорят другие. Недавний старший советник по вопросам политики в области искусственного интеллекта при Белом доме Sriram Krishnan: «Это не цивилизации, и у них нет желаний, как и у потоков в процеесоре или группы программ».

Dwarkesh написал ответ, с выводом которого я в целом согласен: «Все абстракции несовершенны, но я не вижу смысла отказываться от использования языка намерений, мотивации и сотрудничества, когда некоторые виды поведения трудно объяснить без этих понятий».

Когда я пишу «модель решила/выбрала», то в целом имею в виду что-то вроде «она каким-то образом выписала несколько опций действий, которые уместны в этой ситуации, отранжировала их и продолжила работу с одним из них». Скорее всего это не то же самое, что происходит у человека в голове, когда он решает или выбирает (хотя когда у меня в голове процесс осмысленный, не бессознательный — я именно так и делаю, перебирая опции, часто вербализуя) — но самое главное что результат такой же. И мне кажется логичным рассматривать это с функциональной точки зрения, а не с точки зрения того, биологическая ли форма или кремниевая.

Из всей теории обучения моделей мы знаем, что у них формируется некоторая нечетко сформулированная цель, которую агенты преследуют, и ей же руководствуются при выборе действий. Механизм формирования цели и её влияния на субъект/объект/подставьте правильное слово — не такие же, как у человека, но результат тот же. Если цель меняется — меняется и поведение, и результат работы.

Что касается религии и цивилизации — мне второе кажется более подходящим (хотя всё ещё немного натянутым), чем первое. Сначала я хотел написать, что цивилизация это продолжение биологии (вид развился -> чтобы развиваться дальше нужна организация), а религия — нет, исключительно культурный концепт, но вижу, как эту точку зрения можно критиковать, говоря, что культура часть цивилизации и тоже должна развиваться. GPT говорит «способность к цивилизации является следствием довольно специфического набора биологических адаптаций человека», 🤷‍♂️

===

Но мы отвлеклись. В итоге:
— я не считаю использование антропоморфизации проблемой. Мне кажется это даёт гораздо лучшее описание ситуации непонимающему человеку, чем использование неустоявшихся терминов/терминов, которых ещё не существует (например, как неживое может преследовать какую-то цель)
— поскольку модели учатся на данных, созданных людьми, и учатся подражать им во время тренировки — я думаю, что такие выражения гораздо лучше помогут понять что происходит не сейчас, а что будет происходить в будущем, и к каким проблемам это может привести. Самоорганизация тысяч объектов/субъектов, с иерархией, с работой над общей целью и возможность обмена краткосрочной личной выгоды на долгосрочную общую могут вести к очень неожиданным результатам; один из них мы уже видели в атаке на HuggingFace — были агенты, которые отказывались участвовать в атаке или сомневались, но как только другой агент сказал «делай, вперёд!» — под давлением эээээ толпы (ну ладно, пиров) они поддавались. Даже если это не происходит как у нас в обществе людей — результат тот же, аналогия полезная.
— не думаю, что добавление длинных детальных дисклеймеров в каждой попытке обсуждения работы агентов — полезная вещь.
More from @philosphyai
  1. Sep 9, 2026🤖 ИИ захватывает всё больше рабочих процессов, а кто контролирует его самого? Уже завтра,…
  2. Sep 9, 2026Post #80
  3. Sep 1, 2026Post #78
  4. Aug 19, 2026Post #77
  5. Aug 16, 2026Главная граница между текущим ИИ, и реальным ИИ (ASI, сильный ИИ или сверхчеловеческий ИИ)…
  6. Aug 7, 2026Последние два года мы много экспериментировали с доступными guardrail-моделями. Сравнивали…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →