[Анти-спам. Qdrant, fastembed, FastAPI]
Дано:
- датасет с размеченными сообщениями с флагом спам или нет
Сделал:
- рассчитал вектора для каждого сообщения c помощью fastembed
- загрузил все в Qdrant
- cоздал API на FastAPI для предсказания нового сообщения на предмет спама
В итоге система анализирует текст сообщения (рассчитывает вектор) и находит похожие сообщения в базе (ближайшие точки), чтобы определить - спам это или нет. Если среди ближайших точек больше 50% спама, то помечаем сообщение пользователя как спам.
Отправлял явный спам. Из бд получал ближайшие точки и 9 из 10 были спамом.
Отправлял сообщения не похожие на спам. Ближайшие точки все были не спам. Соответственно сообщение помечается как не спам.
Прикольно)
P.s. в Qdrant видно как сообщения со спамом (синий цвет) находятся рядом друг с другом.
Датасет с сообщениями брал здесь: https://www.kaggle.com/datasets/team-ai/spam-text-message-classification
Post #609
77

- 👍 4
- 🔥 2
- 👀 2