TGViewer
Machinelearning Machinelearning @ai_machinelearning_big_data · 278K subscribers
Post #10292 23.2K
🌟 LangChain сделала модуль самопроверки для ИИ-агентов

Компания выпустила RubricMiddleware, компонент для своего фреймворка Deep Agents, который заставляет ИИ-агента проверять собственный результат по заранее заданным критериям и при необходимости переделывать работу.

Инструмент позиционируется как решение типичной проблемы, когда агент выполняет задачу почти целиком, но упускает формат, тесты или обязательные разделы.

Механизм наиболее полезен для задач с чёткими и проверяемыми критериями приёмки.


🟡 Принцип работы

Разработчик задаёт список требований (рубрику) к выполненной задаче: например, код должен проходить тесты, а отчёт содержать определённые разделы.

Перед тем как агент завершит работу, отдельный проверяющий агент (грэйдер) оценивает результат по каждому пункту. Если что-то не выполнено, его замечания возвращаются основному агенту, и тот делает новую попытку.

Цикл останавливается, когда все критерии выполнены либо когда достигнут заданный лимит итераций.

По словам LangChain, проверяющий агент может не только рассуждать о качестве ответа, но и вызывать внешние инструменты, чтобы опираться на фактические данные, а не только на текст.

LangChain сравнивают подход с функцией /goal в Claude Code и Codex, но утверждают, что их реализация пластичнее за счёт выделенного агента-оценщика, который видит весь ход выполнения задачи.

RubricMiddleware пока в бете, но к нему есть документация, а посмотреть пример трейса можно тут.


@ai_machinelearning_big_data

#news #ai #ml
  • 🤓 96
  • 👍 50
  • 👏 17
  • ❤ 14
  • 🤔 10
  • 💯 6
  • 🔥 3
  • 🍾 1
More from @ai_machinelearning_big_data
  1. Oct 5, 2026🏅 Нобелевку по медицине дали за то, что нейроны научились включать светом Премию по физио…
  2. Oct 5, 2026✔️ Китайские инженеры разработали неинвазивный нейроинтерфейс весом 3 грамма Исследователи…
  3. Oct 4, 2026✔️ Runway показала генеративную оболочку ОС Исследовательское подразделение Runway анонсир…
  4. Oct 3, 2026✔️ Anthropic открыла моды для Claude Code Моды – небольшие функции на TypeScript, меняющие…
  5. Oct 3, 2026⚡️ OpenAI обнулила лимиты платных аккаунтов ChatGPT Главный по ресетам в OpenAI сообщил, ч…
  6. Oct 2, 2026⚡️ Одна и та же модель набирает 62% в одном агентном харнессе и 33% в другом. Hugging Face…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →