🔐 CAPTCHA — это аббревиатура от Completely Automated Public Turing test to tell Computers and Humans Apart — полностью автоматизированный публичный тест Тьюринга для различения компьютеров и людей. Простыми словами, это тест, который должен подтвердить, что вы человек, а не бот.
👨💻 reCAPTCHA — развитие этой технологии. Проект был создан в университете Карнеги—Меллона под руководством Луиса фон Ана (который позже основал Duolingo) в 2007 году. Изначально цель была двойной: защищать сайты от ботов и параллельно решать полезную задачу.
🤝 Краудсорсинг (от англ. crowd — «толпа» и sourcing — «использование ресурсов») — это модель, при которой большая группа людей массово выполняет небольшие задачи, создавая значимый результат. Проще говоря, решение задач силами «толпы».
Теперь самое интересное — как это работало.
📖 Этап 1. Помощь в оцифровке книг (2007–2011)
Компьютерные программы распознавания текста (OCR) часто не могли разобрать слова в старых книгах и газетах из-за выцветших чернил или плохого шрифта. Тогда reCAPTCHA начала показывать пользователям два слова:
— Контрольное слово (его система знала) — для проверки, что вы человек.
— Неизвестное слово — то самое «бракованное», которое не смогла распознать программа при сканировании реальной книги.
Результат: Вы вводите оба слова. Если контрольное слово верно — система считает, что и второе вы расшифровали правильно. Одно и то же «сломанное» слово показывали десяткам людей, и вариант, который встречался чаще всего, становился верным и сохранялся в цифровую копию книги.
Масштабы впечатляют:
✅ Полностью оцифрованы архивы газеты The New York Times за 140 лет (с 1851 года) — более 13 миллионов статей.
✅ За год пользователи помогали расшифровывать объём, эквивалентный 2,5 миллионам книг.
✅ К 2011 году эта задача для Google Books была в основном завершена.
🚦 Этап 2. Разметка данных для компьютерного зрения (с 2012 года)
Когда книги оцифровали, Google нужно было учить нейросети распознавать объекты реального мира. Начиная с 2012 года в reCAPTCHA начали появляться не слова, а картинки из Google Street View. Вас просят: «Выберите все квадраты со светофором» или «отметьте все автобусы».
Эти данные помогают улучшать алгоритмы распознавания объектов (например, дорожной инфраструктуры) и обучать модели компьютерного зрения. Кстати, слухи о прямом использовании этой разметки для беспилотных автомобилей официально не подтверждены, но очевидно, что такие навыки ИИ пригождаются и в картах, и в поиске.
🤫 Этап 3. Эпоха невидимых капч (наши дни)
Сегодня Google постепенно отказывается от старых «клетчатых» капч (версия v2). Современные нейросети научились решать их практически безошибочно, поэтому они перестали быть надёжной защитой.
Компания перешла к reCAPTCHA v3 — версии, которая не требует кликать по картинкам. Теперь мы всё чаще видим просто кнопку «I’m not a robot» или вообще ничего — Invisible reCAPTCHA работает незаметно. Оказывается, анализировать поведение человека эффективнее, чем мучить его картинками.
💡 А что в итоге?
По сути, миллиарды CAPTCHA в день — это огромный бесплатный краудсорсинг для Google. Сам Луис фон Ан, создатель reCAPTCHA, называл это
«миллионами часов человеческого труда в день, направленных на полезные цели»
Эффективность схемы оказалась настолько высока, что он использовал ту же модель в Duolingo: пользователи бесплатно учат языки, а заодно переводят фрагменты текстов из интернета.
Если хочется углубиться, стоит посмотреть TED-выступление Луиса фон Ана о создании CAPTCHA (https://www.youtube.com/watch?v=xs78HfZtNgE). Ролик очень интересный и смешной, но, к сожалению, для просмотра нужен VPN.
#Что_это_такое