Недавно в сообществе по категорной кибернетике (об этом позже) засветилась статья об algorithmic collusion -- это ситуация, в которой независимые друг от друга алгоритмы могут учиться сговору (as in картельному), с целью манипулировать ценами и максимизировать прибыль, вредя потребителю. О гипотетической возможности такой ситуации говорят сравнительно небольшое время, по упомянутым в статье ссылкам -- примерно с 2016-2018г. Предположение о возможности такой ситуации строится на известной тенденции обучаемых алгоритмов к оверфиттингу на тренировочных данных -- имея на руках окружение, которое i.e. содержит информацию о предыдущих сговорах и поощряет их формирование, есть вероятность, что несколько компаний могу получить сговаривающиеся ценообразующие алгоритмы независимо друг от друга.
В статье исследователи сначала определяют некий формальный фреймворк, в рамках которого можно выделить два ключевых пункта:
1) Окружения тренировки и тестирования разделены -- т.к. фирмы обычно не тренируют алгоритмы в онлайн-режиме, опасаясь потерь при обучении
2) Окружение обучения определено как POMG -- Partially Observed Markov Game, и потом как CPOMG -- то же самое, но "Contextual"
POMG и CPOMG в данном случае формализована как кортеж ряда элементов, которые в итоге формируют динамическую систему со следующими условиями:
1) игроки (в данном случае алгоритмы) не всегда могут производить наблюдения за состоянием самой системы
2) игроки могут выбирать действия, которые приводят к переходу в другое состояние
3) цель обучения с подкреплением в том, чтобы привести игроков к policy, которая производит действия над наблюдениями состояния, приводящие к вероятностному распределению с наибольшей кумулятивной прибылью
4) в случае CPOMG выполняется условие (1) формального фреймворка выше -- окружения тренировки и тестирования разделены
Сама модель определяется несколькими функциями: классической функцией спроса, функцией награды исходя из прибыли за период, моделью перехода из одного состояние в другое, и, что заинтересовало меня больше всего -- мерами результата
Кроме непосредственно меры прибыли, которая довольно проста сама по себе, исследователи вводят также "индекс сговора" относительно эквилибриума Нэша -- чтобы вычислить, что алгоритмы все-таки могут сговариваться и сохраняют эту способность в окружениях тестирования.
К каким выводам приходят исследователи?
Сначала они видят разную скорость, с которой алгоритмы могут достичь сговора, оверфиттинг на имеющиеся в тренировке данные, и слабую устойчивость алгоритмов к изменению окружения.
Затем они сужают поле возможных policy для каждого алгоритма, и получают, на этот раз, оверфиттинг на policy игрока-противника, который в тестовом окружении приводит к policy, ведущей к эквилибриуму.
Исследователи далее пытаются подвести алгоритмы к устойчивому ко всем факторам выше обучению сговору и приходят к выводу, что это возможно, если фирмы заранее договорятся о параметризации окружения -- при том, что сами алгоритмы будут учиться независимо. Интересным наблюдением мне также показался вывод исследователей, что алгоритмы сами движутся в сторону сговора (!), но при этом самостоятельно достигнуть его не могут.
Какие соображения показались мне в эттой статье интересными?
Кроме непосредственно выводов, интересной оказалась сама структура исследования -- в политических кругах до сих пор принято говорить об экономике и ценах в терминах 19-го века, тогда как матэкономика уже давно рассуждает об автоматических алгоритмах ценообразования и прочей квантификации.
Далее, мне кажется интересным вывод о возможности картельного сговора: если возможен картельный сговор с целью максимизации прибыли (даже в резко меняющемся по параметризации окружении), то возможно и обучение алгоритмов с другими reward functions, которые обеспечивают экономическую координацию и ценообразование там, где классическое планирование выглядит intractable -- например, на рынках товаров широкого потребления.
Post #36
375
- 👍 3