Патент, поданный в 2023 году и опубликованный в апреле 2026-го, описывает флоу генерации ответа.
Алгоритм сначала выбирает источник по совпадению картинки, а уже потом подтягивает окружающий текст для формирования ответа.
Это лишь заявка, а не подтвержденная механика в проде.
Google регистрирует их тысячами, и многие никогда не выходят в прод в описанном виде.
Если рассматривать это как вектор развития, а не как факт, патент переворачивает все правила, на которых строилось
image SEO.Картинка решает, какая страница попадет в ответ, а текст рядом с этой картинкой решает, что именно скажет ответ.
Операционное следствие — это плейсмент.
Факт, нужный покупателю, должен висеть прямо под картинкой в виде подписи или тега, а не в трех скроллах ниже по странице.
Распознавание не гарантировано.
На одном из рекламных кадров
Cartier модель компьютерного зрения выдала браслет и часы, но в упор не заметила кольцо.То, что креативная команда пыталась донести, и то, что фиксирует алгоритм — это разные сущности.
И только вторая попадает в движок ответов.
Текст на картинке отваливается при измеримых условиях.
Пороги отказа, вытянутые из литературы
Cognex и arXiv, а не из спецификаций Google, показывают: OCR ломается при высоте символов ниже ~30px, контрасте менее ~40 оттенков серого, на стилизованных шрифтах и бликах от отражающей упаковки.Сжатие, заточенное исключительно под скорость загрузки, вычищает текст с упаковки, который модель должна была спарсить.
Большую часть слоя измерений берет на себя
Google Cloud Vision API:—
Web Detection отдает fullMatchingImages, partialMatchingImages, visuallySimilarImages и pagesWithMatchingImages. Это проверка на уникальность: реально ли hero image принадлежит вам, или это около-дубль, который юзает половина ниши.—
OBJECT_LOCALIZATION возвращает названия найденных объектов, mid-идентификаторы, скоринг уверенности алгоритма (confidence) и координаты (bounding boxes). Это дает список объектов-соседей в кадре, чтобы контролировать совместную встречаемость по бренд-гайдлайнам. Сам по себе API контекст не оценивает.—
TEXT_DETECTION прогоняет OCR-слой, отвечающий за метрику читаемости.—
FACE_DETECTION отдает faceAnnotations и классификаторы эмоций от UNKNOWN до VERY_UNLIKELY, UNLIKELY, POSSIBLE, LIKELY и VERY_LIKELY (где VERY_LIKELY — это таргет). Отсечка по confidence: 0.90 и выше — железобетонно, 0.70-0.89 — сойдет для второстепенных кадров, все, что ниже 0.60 — это мусор.— Масштабирование проверки идет через
Screaming Frog плюс OpenAI Vision API и остается качественным. Связка флагит запросы, которые страница уже могла бы забрать, если бы ее текст подтверждал то, что нарисовано на фото.За этими цифрами стоят два вопроса.
Первый: правильно ли машина прочитала то, что в кадре?
И второй: правильный ли объект туда вообще засунули на старте?
Первое — это слой денотации, который можно чекнуть на уровне объектов.
Второе — слой коннотации: проблема брифинга, которую не закроет ни один
API.https://searchengineland.com/images-new-job-ai-search-485840
#AIOverviews #ImagePack #Patents
@MikeBlazerX
📈 "Пушки" — в @MikeBlazerPRO