TGViewer
Пет-проект Пет-проект @petsproject · 17.6K subscribers
Post #3545 3.2K
Появился имбовый бенчмарк, где LLM тестят на умение распознавать бред в промпте

На пикче зелёным цветом обозначен процент, когда нейронка распознала дичь, предлагаемую юзером, и указала на это. Жёлтым — частичное возражение. Красным — пропуск.

Получилось, что все модели Клода — непробиваемые. Если несёте ахинею, то они вам непременно скажут об этом 🫵

Пет-проект
  • ❤ 30
  • 🔥 6
  • 🗿 4
More from @petsproject
  1. Oct 10, 2026Внимание, розыгрыш: 13 подписок ChatGPT Plus и Google AI Pro совместно с Paragon Paragon —…
  2. Oct 10, 2026Claude станет тупее с 12 ноября, когда Anthropic запретит вести себя с ним грубо Оказывает…
  3. Oct 9, 2026Opus 5.5 получил Fast Mode — переключатель уже начал появляться у юзеров. Насколько ускоря…
  4. Oct 9, 2026Всю документацию Anthropic собрали в один репозиторий — тут гайды по командам, MCP, работе…
  5. Oct 9, 2026Post #4685
  6. Oct 9, 2026Astra нагаллюцинировала в решении задачи Навье-Стокса В сентябре по всему интернету пронес…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →