Мое постное рыло с рассказом про триплеты
Разумеется, после того, как я пнул коллег, вещающих про триплеты, было бы преступно не выпустить пост про триплеты самому.
Итак, сегодня в студии наш новый MCP semantic-pageoptimizer, расчехляйте ваши Клоды, дамы и господа.
Для начала - немного теории.
Поисковик не читает страницу как человек. Чтобы работать со смыслом, машины разбирают текст на минимальные утверждения: кто — что делает — с чем. «Доставка — занимает — два дня». «Гарантия — действует — 2 года». Google Research описал это в промышленном масштабе ещё в 2014–2015. Проект Knowledge Vault собрал из веба более полутора миллиардов таких троек, а в работе Knowledge-Based Trust исследователи извлекли 2,8 млрд фактов, оценили по ним 119 млн страниц и предложили считать надёжным тот источник, у которого выше доля корректных фактов: arxiv.org/abs/1502.03519
Оговорюсь: это исследовательские работы; действующий алгоритм Google они не описывают, и точных весов никто снаружи не знает. Но механизм понятен: чем чётче страница формулирует утверждения, тем проще машине их извлечь — и тем меньше шансов, что ваш смысл потеряется по дороге в индекс или в ответ нейросети.
Что делает инструмент
semantic-page-optimizer в lk.moab.tools разбирает страницу на те самые тройки — и к каждой прикладывает дословную цитату и место в коде, откуда она взята. Даёте URL, целевой запрос и до 5 конкурентов — получаете отчёт в чате с Claude: что страница реально утверждает, чего не хватает на фоне конкурентов, совпадает ли Schema.org с видимым текстом и какие правки отдать редактору.
В версии 1.1 появились гибридный движок (синтаксический разбор + правила) и правило уверенности: за уровень high движок ручается, всё сомнительное уходит в список «требуют проверки» с цитатой и готовым вопросом. Непроверенная связь не может попасть в задачи редактору — это гарантирует структура ответа. На контрольном наборе фраз, которых движок не видел, high-связи отработали без ошибок: ни одной перепутанной роли, ни одного отрицания, принятого за утверждение, — на русском, английском и испанском.
Прогнали на живых страницах
- страница тарифов SEO-копирайтинга (наша же, moab.pro) по самым частотным запросам о цене — за пределами топ-40. Вероятная причина нашлась за один прогон: в извлекаемом тексте нет слов «копирайтинг» и «цена», ноль собственных утверждений в базовом режиме против 18 у конкурентов.
- карточка флагманских наушников: по короткому названию модели — позиции 1–2, по полному имени линейки — 4–5 и CTR почти в девять раз ниже. Аудит поймал: один термин запроса на странице отсутствует — возможно, страница отвечает не на тот интент.
- обзор «топ-10 TWS-наушников»: 36 связей с цитатами, 7 задач редактору — сверить часы автономности, кодеки, влагозащиту с источником.
Где инструмент слабее
Листинги и прайсы почти без связного текста дают единичные связи. JavaScript он не выполняет: если текст приходит скриптами, отчёт скажет «данных недостаточно» — придумывать он не станет. Полнота гибридного движка — примерно от двух третей до четырёх пятых связей: отсутствие связи в отчёте не значит, что её нет на странице.
Как попробовать
Подключите https://semantic-page-optimizer.moab.tools как коннектор в claude.ai (вход по аккаунту lk.moab.tools) и попросите: «сделай аудит триплетов [URL] по запросу „…“». Гибридный движок — по фразе «в режиме hybrid»; он пока в бете, и если связь уровня high окажется ложной — напишите нам, это самый ценный сигнал.
Инструкция (PDF): https://share.moab.tools/dnq8c6eg/semantic-page-optimizer-user-guide.pdf
Кейсы с прогонами (PDF): https://share.moab.tools/042eaecb/semantic-page-optimizer-case-study.pdf
P.S.: ИИшка сделает умных умнее, а тупых - еще тупее; кто сказал - не помню. Пжлст, думайте своей головой, когда используете ИИ!
Перепроверяйте, не доверяйте, да хотя бы просто из принципа старайтесь придумать хоть что то, до чего Клод не додумался, чтобы мозг не превращался в студень.
Достали meat proxy с клодом в руках - простите, крик души.
Post #628
813
Ilya Iserson вместо одних и тех же постных рыл с рассказами про триплеты и аишкуarXiv.org Knowledge-Based Trust: Estimating the Trustworthiness of Web Sources The quality of web sources has been traditionally evaluated using exogenous signals such as the hyperlink structure of the graph. We propose a new approach that relies on endogenous signals,...
- 🔥 12
- ❤ 2
- 😁 2
- 👎 1