TGViewer
analyst_exe | инженерное мышление в IT analyst_exe | инженерное мышление в IT @analyst_exe · 507 subscribers
Post #678 393
Совет из моделей: зачем я собрал консилиум нейросетей

Недавно пересел на Orca как на оркестратор — и это редкий случай, когда инструмент прям заходит. Несколько папок, куча параллельных агентов, каждый в своём git worktree, удобный MD-редактор, встроенный браузер. Всё в одном окне, ничего не теряется.

И вот там я наткнулся на штуку, которая поменяла мой подход. Через Orca можно запустить рой агентов, которые проверяют и доделывают работу друг друга: управляющий раздаёт задачу дочерним (Claude Code, Codex, Grok), ждёт их анализ и сводит результат.

Смотрю на это и ловлю дежавю — где-то я такое уже видел. Ну конечно: LLM Council Карпатого. Та же механика, только в чате: вопрос уходит нескольким моделям, каждая отвечает сама, потом анонимно рецензирует чужие ответы, а «председатель» сводит вердикт. Тогда показалось игрушкой. А тут дошло, зачем оно на самом деле.

Модель с контекстом будет поддакивать сама себе. Она уже приняла решение, вложилась в него — и на вопрос «всё ли ок?» радостно ответит, что всё ок. Нужен второй взгляд без этого багажа: модель, которая не защищает своё решение, а разбирает чужое.

И это не просто ощущение — это замерено. Together AI в работе Mixture-of-Agents собрали слоёный «совет» из открытых моделей среднего калибра: Qwen-110B, Llama-3-70B, WizardLM, Mixtral. На AlpacaEval 2.0 эта сборка выдала 65,1% против 57,5% у GPT-4o — тогдашнего флагмана. Поодиночке ни одна из них к нему даже не приближалась. Кучка средних умов с разными датасетами обучения обошла передовую модель — именно за счёт того, что смотрели на задачу по-разному и правили слепые зоны друг друга.

Я под это сделал кастомный скилл, называется «совет». Но запускаю его далеко не всегда. В большинстве случаев зарядил одну флагманскую модель — и она себе спокойно работает. Совет на рутине — вчетверо дороже, втрое дольше, а прироста ноль.

Окупается он на дорогих развилках: выбор архитектуры, схема данных, которую потом не переделать, решение, которое сам не можешь оценить.

С насморком консилиум не собирают. А перед операцией второе мнение — нормальная практика.

Я, например, DeepSeek'у архитектуру не доверю, а OpenAI после 5.5 реабилитировал. А вы каких «врачей» зовёте — и кому доверяете?

@analyst_exe
  • ❤ 5
More from @analyst_exe
  1. Sep 21, 2026Ну это не дело, сами из резюме вытащить не могут? @analyst_exe
  2. Sep 20, 202614 моделей рисуют BPMN. Кто рабочая лошадь, а кто заставит зайца ждать? Взял историю про П…
  3. Sep 20, 2026Есть идеи, чем я таким сижу занимаюсь? Пишите варианты в комментариях) @analyst_exe
  4. Sep 19, 2026В субботу отдыхаем честно украденным мемом @analyst_exe
  5. Sep 16, 2026Господа, расскажите в комментариях, что происходит с рынком труда нынче? Кто смотрел? Кто…
  6. Sep 14, 2026Все ясно, вам нужны только мемы Их есть у меня @analyst_exe
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →