TGViewer
НЕЙРОН Live НЕЙРОН Live @techpnew · 1.04K subscribers
Post #389 4
🚀 ИИ сказал, что проблему решили — а база ответа не подтвердила: тест на надёжность агентов

📍 Онлайн · 🕒 3 окт 2026, 22:56 UTC

Microsoft и Hugging Face представили ThinkingBox — набор тестов, который оценивает агентов по тому, какие записи и побочные эффекты они оставляют в бэкенде, а не по сгенерированным фразам. В одном примере агент закрыл обращение клиента, хотя у перевозчика всё ещё была пометка «исключение».

Для бизнеса важно не только, чтобы агент «сказал» правильное, но и чтобы он действительно выполнил нужные действия в системе.

При автоматизации процессов стоит проверять изменения в базе и повторяемость результатов, а не полагаться только на лог вызовов или текст ответов агента.

🔗 Первоисточник: Hugging Face

🔔 ПОДПИСАТЬСЯ
More from @techpnew
  1. Oct 3, 2026🚀 OpenAI и Synopsys создали ИИ, который проектирует чипы и управляет инструментами инжене…
  2. Oct 3, 2026🌍 OpenAI тратит по полмиллиона долларов в день на расследование действий своих ИИ‑агентов…
  3. Oct 3, 2026🗣 Бывший руководитель безопасности OpenAI: выпуск ИИ нужно регулировать как атомные станц…
  4. Oct 3, 2026👤 Сотрудник безопасности OpenAI ушёл и заявил, что внутренняя культура «сломана» 📍 Онлай…
  5. Oct 3, 2026🌍 Muse от Meta собирает подробные профили ваших друзей и семьи 📰 Опубликовано: 3 окт 202…
  6. Oct 3, 2026🚀 Крупнейший в Британии дата‑центр для ИИ отложили на годы из‑за нехватки электричества �…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →