TGViewer
Бессонный кодер Бессонный кодер @sleeplesscode · 4.24K subscribers
Post #322 5.64K
Кстати, а давайте поговорим об имперском стражнике! Ну и немного спойлеров.

Как вы могли заметить, количество обнов в нём уменьшилось, но с чем это связано? Нас держат в подвале. Мы пилим большую обнову, которая требует много проверок, кодовой базы и невероятно много вычислительных ресурсов. Так что это такое? Собственная нейронная сеть для проверки медиа контента. Помогите.

Что? Как? Зачем? Давайте по порядку, это длинная история.

V1 - В июле я задумался над тем, что было бы круто, если стражник сам мог модерировать поток стикеров в ансабе, дав возможность нам включить их там без страданий, тогда я стал собирать на коленке первую версию модели. Она была кривая, очень кривая, невероятно кривая. Тогда работа встала и я забил.

V2 - В августе-сентябре я решил вернуться к этой идее, я изменил подход к модели, собрал маленький (реально маленький) датасет и попробовал. Моделька стала работать и даже давала результаты, но этого было мало, тогда в стражнике в тестовом режиме появилась модерация стикеров (сейчас не работает). Особенностью второй версии модели было в том, что я не доверял ей и лично перепроверял каждый стикер.

V3 - В определённый момент я попал в тупик, есть стикеры где изображены аниме-тян, но без наготы, есть стикеры с наготой, а есть с 18+, но согласно прошлой модели угроз, всё это шло в 1 категорию, меня это смущало, по этому в 3 версии модели я разделил все такие подтипы на отдельные категории, позволяя более чательно относится к содержимому. Тогда же появилась небольшая фича, которая при автоматическом нахождении ЦП контента, отправляла мне шаблон письма для репорта команде Telegram (боремся с этим вместе :3)

V4 - Когда в очереди на проверку стало 20 ТЫСЯЧ СТИКЕРПАКОВ, я понял что моих сил не хватит. В этот момент образовалась небольшая команда модерации контента, они доблестно проверяли стикерпаки, сообщали мне об ошибках в модели, на основе которых я корректировал обучение. Тут она стала реально умнее и чаще справлялась с задачей, но был один недостаток - архитектура. Всё было устроено так, что модель проверяла весь стикерпак, не вдаваясь в подробности каждого стикера. Это создавало много проблем.

V5 (текущая) - Сейчас модель, в отличие от прошлой версии, записывает данные отдельно по каждому стикеру, следит за изменениями стикерпаков и работает в распределённом режиме на 2 серверах (и моём ноуте когда мне скучно). В данный момент она активно занимается проверкой накопившегося багажа данных, готовясь к публичному релизу. На текущий момент ей осталось проверить 12 тысяч стикерпаков и 500 тысяч отдельных стикеров. А команда модерации в это время отдыхает и морально готовится к новому циклу проверки и корректировки результатов этой системы.

Когда она будет полностью готова, бот сможет используя базу уже изученных стикеров (или проверяя новые налету), автоматически модерировать наши чатики от NSFW контента. А на этом пока всё, в комментариях к посту я отправлю немного скринов о внутренней жизни модели и обучения.

#updates
  • 🔥 57
  • ❤ 9
  • ❤‍🔥 6
  • 👏 5
  • 🐳 3
  • 👍 1
  • 🙈 1
  • 😇 1
More from @sleeplesscode
  1. Oct 5, 2026Post #923
  2. Oct 1, 2026Post #914
  3. Sep 18, 2026Post #913
  4. Sep 17, 2026Post #912
  5. Sep 15, 2026Post #911
  6. Sep 14, 2026Post #909
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →