TGViewer
The Layer The Layer @layercv · 853 subscribers
Post #123 1.68K
Встречайте GigaCheck – наш внезапный, удивительный и потрясающий продукт для детектирования русскоязычных текстов, сгенерированных LLM.

Всего за год экспериментальный проект эволюционировал до серьёзного продукта и технологии с SOTA качеством среди всего известного на данный момент. Понимаю, заявление громкое, но подождите, мы в скорости выпустим статью и расставим все точки во флоатах.

То, что задача горячая, думаю, доказывать не нужно: чего сейчас только LLM ассистенты не делают за людей – и знакомятся, и дипломы пишут, и бизнес планируют. Не сомневаюсь, что вы встречали это в новостях.

Больше хочется поговорить про решаемость задачи. Мнения тут сильно разнятся – не специалисты почему-то зачастую крепко убеждены, что распознать текст, сгенерированный LLM очень просто, в то время как в профессиональной среде популярно ровно обратное мнение: задача нерешаема. Подливает масла в огонь и то, что OpenAI делали свой собственный детектор, но спустя непродолжительное время его спрятали, посчитав нерабочим.

В пабликах по всему Телеграму можно найти много достаточно близких мнений: раз, два, три... имя им легион.
Да, задача, безусловно, очень сложная, а ещё для решения требуется много данных, кропотливого труда, усердия и постоянной поддержки в проде.

Но, если очертить ей какие-то практические рамки, то всё меняется.

Сделаю маленькое отступление: во многих сферах, например, в вопросах противодействия угону автомобиля, известен такой феномен, что пытаться сделать защиту абсолютной – бессмысленно, если прямо очень понадобится, злоумышленники всё равно решат вопрос. У борьбы меча и щита просто нет конца, это основа мироздания. Но зато можно защититься в такой мере, что риски и затраты перевесят выгоду.

Тут история близкая. В практическом применении совершенный детектор не нужен. Нужно, чтобы текст для обхода детектора пришлось бы достаточно сильно исказить и он стал бесполезен для использования. Ну или вынудить переписывать и подбирать текст так долго, что гораздо дешевле окажется сразу написать самому.
Это та цель, которую мы преследовали, и, в рамках первой итерации, достигли.
Конечно, детектор ещё иногда ошибается (например, есть проблемы со стихами), но и мы ещё не закончили.

GigaCheck доступен:
- На сайте developers.sber.ru.
- Как Телеграм бот: @layer_ai_detector_bot
- Как API для бизнеса [скоро].

Интересный факт:
Ради интереса мы прогнали 220 000 текстов, взятых за последний месяц из крупных новостных изданий. Оказалось, что 6% из них были сгенерированы LLM, а в случае некоторых конкретных изданий эта доля больше трети!


А ещё мы скоро выпустим дополнение – интервальную детекцию, которая позволяет работать со смешанными текстами.
  • 🔥 12
  • ❤ 3
More from @layercv
  1. Aug 21, 2025✨Big Tech Night: не пропусти первую «Ночь музеев» в мире IT 12 сентября в Москве пройдёт B…
  2. Jul 22, 2025Ещё раз напомню, что доступно бесплатное демо нашего файнтюна Bagel-NHR-Edit на HuggingFac…
  3. Jul 22, 2025Абсолютно всё в этих примерах создано без участия человека, мы просто задали направление.…
  4. Jul 22, 2025NoHumansRequired: Autonomous High-Quality Image Editing Triplet Mining Вышел наш первый пр…
  5. Jul 8, 2025⚡Полная версия MiVOLO на HuggingFace! Наша молниеносная модель в 29 млн. параметров для оп…
  6. Jul 8, 2025Вакансия: Deep Learning Engineer, ASR 🎧 Ищем инженера-исследователя в ML команду распозна…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →