TGViewer
Влад на удалёнке Влад на удалёнке @vkremote · 184 subscribers
Post #101 347
⌨️ Лучшие нейронки для редакторов

Уже больше года я регулярно провожу в редакции sberbank ru тесты разных LLM, это помогает выбрать инструменты, которые подходят именно нам, и сформулировать гипотезы для улучшения промптов. Тестирование проходит в формате «слепого» оценивания: разные модели выполняют наши типичные редакторские задачи (от написания сторис, до генерации текстовых прототипов), а редакторы оценивают ответы — при этом «судьи» не знают, где какая модель.

На прошлой неделе закончили очередную пару тестов, результаты — на скринах.

Методология тестирования
В двух тестах агенты выполняли задачи с одинаковым ТЗ и на основе одинакового системного промпта. В первом тесте мы сравнивали 6 «быстрых» моделей без reasoning, во втором — 4 «думающие» модели с reasoning. Обезличенные ответы моделей оценивали редакторы и AI-оценщики (Opus 4.7, GPT-5.5 Thinking).

Критерии для оценки:
- соответствие ответа условиям задания
- отсутствие критических ошибок
- соблюдение редстандартов


Главное о результатах

🔝 1 место уверенно занимает Claude — единственная нейронка, которой все участники поставили оценку выше среднего в тесте «быстрых» и «вдумчивых» моделей.

🤖 2 место у ChatGPT, но за счёт аномально высоких баллов от ИИ-оценщиков. Если считать только «человеческие» голоса, Чат занял бы предпоследнее место среди «быстрых» и последнее место в ризонинге. При этом в прошлом году ChatGPT регулярно был фаворитом редакции — кажется, что-то поменялось в последних релизах.

🤔 При оценке ответов ИИ-судьями заметил self-preference bias — LLM легко узнавали «себя» и ставили своим ответам завышенные баллы. Сразу вспомнил недавний пост о том, что ИИ-рекрутёры предпочитают отклики, написанные «родственной» моделью. Этот bias важно учитывать при работе с LLM-as-a-Judge — например, перепроверять оценку несколькими агентами или валидировать оценку экспертами.

❕ Быстрые и дешёвые модели пишут не хуже «думающих», когда получают хороший системный промпт и подробное ТЗ — выполнять мелкие задачи с предсказуемым образом результата можно и не сжигая вагоны токенов. Часто вижу в сети советы использовать самые жирные модели для всех задач, но с таким подходом в том же Claude с подпиской за 20 баксов утыкаешься в лимиты уже утром.

Но если агентная система получает «грязные» вводные, которые нужно критически оценивать, или неполные инструкции, тут не обойтись без ризонинг-модели в роли планировщика/менеджера/оценщика.
  • 🔥 7
  • ❤ 3
  • ❤‍🔥 2
More from @vkremote
  1. Aug 20, 2026Post #119
  2. Aug 8, 2026Post #118
  3. Jul 2, 2026Кажется, все научились вычислять ленивый ИИ-слоп в соцсетях по синтаксису, пунктуации, хар…
  4. Jun 30, 2026Случайно наткнулся на очень важное видео, у которого преступно мало просмотров: Chelsea La…
  5. Jun 15, 2026Greatest hits Дайджест лучших постов «Влада на удалёнке» 🤖 о работе с ИИ • Как быстро пис…
  6. Jun 15, 2026Хочу сказать (да, с недельным лагом), что эфир с Ирой @redachredach получился душевным и п…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →