Как вы могли заметить, количество обнов в нём уменьшилось, но с чем это связано?
Что? Как? Зачем? Давайте по порядку, это длинная история.
V1 - В июле я задумался над тем, что было бы круто, если стражник сам мог модерировать поток стикеров в ансабе, дав возможность нам включить их там без страданий, тогда я стал собирать на коленке первую версию модели. Она была кривая, очень кривая, невероятно кривая. Тогда работа встала и я забил.
V2 - В августе-сентябре я решил вернуться к этой идее, я изменил подход к модели, собрал маленький (реально маленький) датасет и попробовал. Моделька стала работать и даже давала результаты, но этого было мало, тогда в стражнике в тестовом режиме появилась модерация стикеров (сейчас не работает). Особенностью второй версии модели было в том, что я не доверял ей и лично перепроверял каждый стикер.
V3 - В определённый момент я попал в тупик, есть стикеры где изображены аниме-тян, но без наготы, есть стикеры с наготой, а есть с 18+, но согласно прошлой модели угроз, всё это шло в 1 категорию, меня это смущало, по этому в 3 версии модели я разделил все такие подтипы на отдельные категории, позволяя более чательно относится к содержимому. Тогда же появилась небольшая фича, которая при автоматическом нахождении ЦП контента, отправляла мне шаблон письма для репорта команде Telegram (боремся с этим вместе :3)
V4 - Когда в очереди на проверку стало 20 ТЫСЯЧ СТИКЕРПАКОВ, я понял что моих сил не хватит. В этот момент образовалась небольшая команда модерации контента, они доблестно проверяли стикерпаки, сообщали мне об ошибках в модели, на основе которых я корректировал обучение. Тут она стала реально умнее и чаще справлялась с задачей, но был один недостаток - архитектура. Всё было устроено так, что модель проверяла весь стикерпак, не вдаваясь в подробности каждого стикера. Это создавало много проблем.
V5 (текущая) - Сейчас модель, в отличие от прошлой версии, записывает данные отдельно по каждому стикеру, следит за изменениями стикерпаков и работает в распределённом режиме на 2 серверах (и моём ноуте когда мне скучно). В данный момент она активно занимается проверкой накопившегося багажа данных, готовясь к публичному релизу. На текущий момент ей осталось проверить 12 тысяч стикерпаков и 500 тысяч отдельных стикеров. А команда модерации в это время отдыхает и морально готовится к новому циклу проверки и корректировки результатов этой системы.
Когда она будет полностью готова, бот сможет используя базу уже изученных стикеров (или проверяя новые налету), автоматически модерировать наши чатики от NSFW контента. А на этом пока всё, в комментариях к посту я отправлю немного скринов о внутренней жизни модели и обучения.
#updates
