Ну и раз уж мы заговорили о теме детекции сгенерированного контента, то с текстами дела обстоят так же плохо. Детектить их супер сложно. Сейчас не существует подхода, который бы давал приемлемое качество детекции.
Я текстами не занимаюсь, но ими занимается Юра, автор канала New Yorko Times. У него было несколько постов по этой теме:
- Доклад автора на DataFest-2023 про детекцию сгенерированного научного контента;
- Даже OpenAI не может сделать нормальный детектор;
- Важность задачи детекции фейкового научного контента. Индустрия paper mills. Можно почитать хотя бы ради того, чтобы ужаснуться, как в "научной среде" торгуют авторством статей;
- Факап на соревновании по детекции сгенерированного контента;
- Обратная задача: генерация фейковых текстов, которые для детекторов выглядят настоящими;
- Обзор детекторов фейкового текста.
(Юра, завел бы ты хэштег для fake_text_detection, ато постов накопилось)
А еще Лаида занимается текстами. И у нее есть научные статьи по детекции сгенерированного текста на основе исследования матриц внимания BERT-подобных моделей. Полгодика назад она писала об одной такой статье пост у себя на канале.
Если я что-то пропустила, может быть, авторы этих каналов придут в комментарии и что-то добавят. А в целом, я бы советовала прочитать эти посты хотя бы затем, чтобы ясно понять, насколько эта задача сложна. И в следующий раз, когда появится супер-стартап, заявляющий, что "мы детектируем фейковые тексты с точностью 99%", вы такому стартапу деньги не давали)
Post #806
10.3K
- 👍 34
- ❤ 17
- 🔥 7
- 🤮 1