Цензурирование текстов
Речь о нецензурной лексике. Положите ручку, товарисч. Все кто играл в WoW на этапе личкинга должны помнить как близзард ввели сервис цензуры в текстах. И особенно всем должен был запомниться квестовый персонаж Змеебой. Или как его пару лет называли близы Зме@!#%ой.
Задачка частая, особенно в промо. Ники, UGC и тому подобное не должны содержать похабщины. А в детских промо тем более, так как дети любят баловаться. Стандартный подход это выделение матерщиных корней, как и поступили близы. Просто цензура дала осечку и забанила персонажа (на сколько близы недоверяют разрабам, что поставили это на все тексты, а не только на пользовательские. Статический ресурс локализации в целом проверять будто бы необязательно)
Но ведь сейчас эра LLM, может можно отгрузить эту задачу им? Ничего же не мешает системным промтом сказать «отвечай да или нет, цензурное ли слово». И парсить ответ модели. И в целом это относительно работает. Но задача забавно глубже. Потому что по идее там нужны региональные системные промты. Возьмем слово Huesos. На наш слух звучит так себе, но это всего лишь по испански кости, и вполне себе имя. Поэтому если решать задачу так, то региональными системными промтами :) Это конечно на уровне рассуждений, так как дорогой сервис получится учитывая стоимость запросов в сетки. Но забавно, что в таком контексте можно применить LLM.
#мысли
Post #1850
1.08K

- 🔥 2