TGViewer
Manufacturing the future Manufacturing the future @staatliche_plankomission · 431 subscribers
Post #36 375
Недавно в сообществе по категорной кибернетике (об этом позже) засветилась статья об algorithmic collusion -- это ситуация, в которой независимые друг от друга алгоритмы могут учиться сговору (as in картельному), с целью манипулировать ценами и максимизировать прибыль, вредя потребителю. О гипотетической возможности такой ситуации говорят сравнительно небольшое время, по упомянутым в статье ссылкам -- примерно с 2016-2018г. Предположение о возможности такой ситуации строится на известной тенденции обучаемых алгоритмов к оверфиттингу на тренировочных данных -- имея на руках окружение, которое i.e. содержит информацию о предыдущих сговорах и поощряет их формирование, есть вероятность, что несколько компаний могу получить сговаривающиеся ценообразующие алгоритмы независимо друг от друга.

В статье исследователи сначала определяют некий формальный фреймворк, в рамках которого можно выделить два ключевых пункта:
1) Окружения тренировки и тестирования разделены -- т.к. фирмы обычно не тренируют алгоритмы в онлайн-режиме, опасаясь потерь при обучении
2) Окружение обучения определено как POMG -- Partially Observed Markov Game, и потом как CPOMG -- то же самое, но "Contextual"

POMG и CPOMG в данном случае формализована как кортеж ряда элементов, которые в итоге формируют динамическую систему со следующими условиями:
1) игроки (в данном случае алгоритмы) не всегда могут производить наблюдения за состоянием самой системы
2) игроки могут выбирать действия, которые приводят к переходу в другое состояние
3) цель обучения с подкреплением в том, чтобы привести игроков к policy, которая производит действия над наблюдениями состояния, приводящие к вероятностному распределению с наибольшей кумулятивной прибылью
4) в случае CPOMG выполняется условие (1) формального фреймворка выше -- окружения тренировки и тестирования разделены

Сама модель определяется несколькими функциями: классической функцией спроса, функцией награды исходя из прибыли за период, моделью перехода из одного состояние в другое, и, что заинтересовало меня больше всего -- мерами результата

Кроме непосредственно меры прибыли, которая довольно проста сама по себе, исследователи вводят также "индекс сговора" относительно эквилибриума Нэша -- чтобы вычислить, что алгоритмы все-таки могут сговариваться и сохраняют эту способность в окружениях тестирования.

К каким выводам приходят исследователи?

Сначала они видят разную скорость, с которой алгоритмы могут достичь сговора, оверфиттинг на имеющиеся в тренировке данные, и слабую устойчивость алгоритмов к изменению окружения.

Затем они сужают поле возможных policy для каждого алгоритма, и получают, на этот раз, оверфиттинг на policy игрока-противника, который в тестовом окружении приводит к policy, ведущей к эквилибриуму.

Исследователи далее пытаются подвести алгоритмы к устойчивому ко всем факторам выше обучению сговору и приходят к выводу, что это возможно, если фирмы заранее договорятся о параметризации окружения -- при том, что сами алгоритмы будут учиться независимо. Интересным наблюдением мне также показался вывод исследователей, что алгоритмы сами движутся в сторону сговора (!), но при этом самостоятельно достигнуть его не могут.

Какие соображения показались мне в эттой статье интересными?
Кроме непосредственно выводов, интересной оказалась сама структура исследования -- в политических кругах до сих пор принято говорить об экономике и ценах в терминах 19-го века, тогда как матэкономика уже давно рассуждает об автоматических алгоритмах ценообразования и прочей квантификации.

Далее, мне кажется интересным вывод о возможности картельного сговора: если возможен картельный сговор с целью максимизации прибыли (даже в резко меняющемся по параметризации окружении), то возможно и обучение алгоритмов с другими reward functions, которые обеспечивают экономическую координацию и ценообразование там, где классическое планирование выглядит intractable -- например, на рынках товаров широкого потребления.
  • 👍 3
More from @staatliche_plankomission
  1. Jun 12, 2025Проводил эти ресерчи для своих друзей-юристов, отсюда такие резвые подборки, тщ далее пого…
  2. Jun 12, 2025Отличная подборка статей по теме цифровизации права. Я чуть-чуть уже писал об этом вот тут…
  3. Jun 9, 2025При этом само собой разумеется, что несмотря на провал регуляции относительно других систе…
  4. Jun 9, 2025В этом канале давно не было обновлений -- каждая из идей как будто стопорилась о вопрос, к…
  5. Jun 9, 2025Aligning
  6. Feb 12, 2025В недавнем эксперименте исследователи предложили GPT-4 попробовать себя в роли биржевого т…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →