TGViewer
Крафтовое SEO | Вердыш Роман Крафтовое SEO | Вердыш Роман @craftseo · 741 subscribers
Post #448 227
Искал вчера замену GPT-5.4-mini

Тут речь идет о конкретной функции кластеризации сайтов по тематикам, определении языка (подтверждении скорее, т.к. определяет скрипт), подтверждение стоп-тематик, помочь извлечь доп. мусорные слова определяющие стоп-тематики для пополнения словаря и т.д.

Отправная точка: GPT 5.4 Mini, 0,0013$/запрос.

--

Боевой тест моделей

На выборке в 100 доменов потестил всё, что дешевле или равно по цене GPT 5.4 Mini. Эталоном была прошлая проверка GPT 5.4 Mini + ручной осмотр этих 100 сайтов. В кандидаты для дальнейших тестов попали:
- deepseek-v3.2 - работает медленней и не лучше v4 flash.
- deepseek-v4-flash - отличный вариант, с боевым промтом справился неплохо.
- deepseek-v4-pro - немного лучше v4 flash, но медленней и в несколько раз дороже, прирост вы пару % того не стоит.
- gemini-3.1-flash-lite - reasoning жрет непредсказуемо, а полностью выключить его нельзя. Иногда выходило дороже Mini даже.
- glm-5.2 - неплохой вариант, но слишком "округляет" ответы, мало внимания к деталям, Deepseek отработал лучше.

Увы, они не дотянули до Mini прям сильно. Но решил попробовать с лучшим кандидатом + самым дешевым, но быстрым. И главная ошибка тут - не потестить GPT 5.6 Luna, я что-то забыл про нее совсем. Возможно чуть позже или в других сценариях.

deepseek-v4-flash: в 5 раз дешевле по входу, в 16 по выходу. Переключили, качество просело. Нужно было понять насколько.

Увеличил выборку до 2000 доменов, размеченных mini: языки, стоп-тематики, заглушки и т.д. И взялся точить промты.

Что за варианты промптов гонял:
P0 — боевой, как есть. 43 кода тематик, порядок принятия решения, стоп-темы, правила приоритета, границы похожих кодов, правила для заглушек. 11к символов.
P1 — P0 + шапка-контракт: «ты классификатор, только JSON, до 60 токенов, не отказывайся на adult/gambling».
P2 — P1 + правила про мусорные страницы подняты в самое начало, с числовым порогом «меньше 30 слов = заглушка».
P3 — сжатие вдвое: те же решения, выброшены длинные объяснения.
P4 — P3 + три примера готовых ответов (заглушка хостера, escort-страница, японский гестхаус).
P5 — минимум: словарь кодов и 7 правил, 2 978 символов.
P6 — P3 + точечные фиксы: «заглушка ≠ other», «страница от хостера ≠ internet_web», мультикатегорийный магазин = shopping.

--

Результаты первой серии

Все на одних и тех же 2000 доменах. Колонки: тема, заглушки, язык, доля валидного JSON, цена запроса, устойчивость (на скольких доменах три прогона дали один и тот же результат, если меньше 100% - модель отвечала иначе, хоть и похоже, иногда это был лучше вариант, а иногда хуже).
промпт        симв   тема  junk  язык  JSON   $       уст.
mini P0 11159 88% 100% 100% 100% 0.0013 80%
P0 deepseek 11159 70% 90% 95% 95% 0.0002 100%
P1 контракт 11545 70% 85% 95% 100% 0.0003 100%
P2 junk верх 12275 60% 90% 95% 95% 0.0003 100%
P3 сжатый 6386 75% 88% 97% 97% 0.0002 75%
P4 +примеры 7019 75% 98% 95% 98% 0.0002 75%
P5 минимум 2978 70% 90% 95% 95% 0.0001 100%
P6 P3+фиксы 7404 75% 97% 98% 98% 0.0002 70%


▪️ Сжатие промпта вдвое улучшило результат (70% → 75%). Длинные объяснения, написанные под GPT, deepseek только путали.
▪️ Примеры ответов починили заглушки — 88% → 98%. Страницу в 98 символов модель раньше принимала за живой сайт.
▪️ Контракт вывода убрал обрывы. Reasoning-модель обрывала JSON на середине на adult-страницах: рассуждения съедали лимит токенов.
▪️ Перенос правил про мусор в начало уронил тему до 60% — модель цеплялась за проверку на заглушку и дальше решала хуже.

--

Еще 5 тестов и сравнение с лучшими

P7 — к каждому из 43 кодов дописал 4 реальные ниши из нашего реестра.
P8 — «сначала улики»: модель обязана выписать 3–6 слов прямо со страницы, и только потом выбрать код.
P9 — «два кандидата»: сначала два подходящих кода, потом выбор победителя, причём «развлечения», «покупки» и «другое» проигрывают второму кандидату.
P10 — сначала тип страницы (магазин / блог / компания / медиа / каталог / заглушка), потом тема; жёсткий запрет уходить в «другое».
P11 — словарь сгруппирован в 6 блоков (стоп-темы, дом, деньги, тело и разум, техника, досуг): сначала блок, потом код внутри.

промпт        симв   тема  junk  язык  JSON   $      уст.
P7 словарь 14927 73% 95% 95% 97% 0.0002 75%
P8 улики 7762 60% 80% 90% 90% 0.0002 100%
P9 кандидаты 7648 77% 97% 98% 100% 0.0002 75%
P10 тип стр. 8021 75% 85% 95% 95% 0.0002 100%
P11 дерево 7757 70% 90% 95% 95% 0.0002 100%


Гипотеза «дать подробнее нашу таксономию» не подтвердилась.
P7 — 73%, хуже голого списка кодов и в полтора раза дороже. Примеры работают как шум: модель подгоняет страницу под знакомую формулировку вместо того, чтобы читать содержимое. Отдельно проверили версию без русских вкраплений, целиком по-английски — на flash тот же результат, 79%, только заглушки подтянулись до 99%.

Победил P9: 77% темы, 100% валидного JSON. Он всё равно хуже Mini, но вопрос цены при одинаковой скорости и стабильности - в 7 раз на боевых тестах. Подогнав промты удалось выжать + 7% точности тематики и мусора, 8% точности языка и снизить стоимость на 20%. Безусловно, если вы в день делаете несколько тысяч запросов - я бы оставался на Mini, но на объемах - разница в цене в 7 раз, это больно 😁

промпт        симв   тема  junk  язык  JSON   $       уст.
mini P0 11159 88% 100% 100% 100% 0.0013 80%
P9 кандидаты 7648 77% 97% 98% 100% 0.0002 75%
  • 🔥 5
  • 👍 2
  • 🎉 1
More from @craftseo
  1. Aug 15, 2026Я люблю автоматику и не люблю делать что-то рутинное руками, т.к. в большинстве случаев в…
  2. Aug 13, 2026Чёта я смотрю накрутку попустило немного последнюю недельку. Растут стабильно проекты, кот…
  3. Jul 1, 2026Тестирую так же разные размещения от ребят, кто предлагает ссылочное. Цена это всегда спор…
  4. Jun 21, 2026🔗 Продажа ссылок с моей PBN #PBN #линкбилдинг #ссылки #услуги Предлагаю размещение на мое…
  5. Jun 16, 2026Как там позиции в Яндексе? 😁 Похоже гугловские технологии с обрезкой парсеров дошли и до…
  6. Jun 11, 2026Как всегда когда работы наваливается - писать и заниматься своими проектами тупо некогда �…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →