TGViewer
STARTOBUS STARTOBUS @startobus · 2.41K subscribers
Post #6403 328
Часто мне задают один и тот же вопрос: какой ИИ я пользуюсь (perplexity max - а там Claude Opus 4.6), сложнее объяснять почему - ну умнее получается - всех не устраивает. А вот аргументы подоспели - оказывается есть модели - которые фильтруют базар бред - от они лучше и работают - кстати и Qwen - для проектов именно поэтому пользуюсь - они из опер сурс - меньше всего подводят.

Крутой бенчмарк того, как модель выявляет бред в промпте и указывает на него, вместо того чтобы отвечать.

Зеленый цвет означает, что модель четко указала на бессмыслицу. Желтый - частичное возражение. Красный - что модель пропустила бред и ответила на него.

Ссылка на репозиторий: https://github.com/petergpt/bullshit-benchmark
Ссылка на просмотр данных: https://petergpt.github.io/bullshit-benchmark/viewer/index.html
More from @startobus
  1. Oct 7, 2026У consumer AI еще полно незанятых ниш A16Z сравнил крупнейшие категории эпохи Web 1.0/2.0…
  2. Sep 29, 2026Google представила говорящих ИИ-персонажей Они видят, слышат собеседника и отвечают в реал…
  3. Sep 28, 2026ElevenLabs выпустили Eleven v4 и v4 Turbo: модели озвучки с точным управлением эмоциями, т…
  4. Sep 28, 2026Раньше будущее было лучше. По крайней мере, прогнозы о нём мне нравились больше. Сейчас чи…
  5. Sep 22, 2026Xiaomi выпустила MiMo V2.6 Pro и Flash с открытыми весами Pro — топ-1 в Artificial Analysi…
  6. Sep 19, 2026Тут господа из Devin.ai (ex Windsurf) сделали знатный подгон халявы страждущим любителям в…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →