TGViewer
Futuris Futuris @futuris · 6.02K subscribers
Post #3038 2.37K
Представлен "Последний экзамен человечества" от CAIS и Scale AI: новый бенчмарк из 3000 сложнейших вопросов по более чем 100 предметам. Созданный почти 1000 экспертами из 500+ учреждений в 50 странах, HLE призван оценить предел возможностей ИИ, поскольку существующие тесты (MMLU) покорились моделям с точностью выше 90%. Первые результаты шокируют: даже GPT-4o показал всего 3.3% точности, а лучший результат – 9.4% принадлежит китайской R1. Организаторы считают HLE ключевым инструментом для измерения прогресса ИИ и прогнозируют достижение 50% точности к концу 2025 года. Издания New York Times и Reuters уже назвали HLE важным этапом в развитии искусственного интеллекта👌

Делаем ставки как быстро этот "экзамен" покорят нейронки

https://agi.safe.ai/
Humanity's Last Exam Humanity's Last Exam Dataset
  • 🤯 10
  • 👍 5
  • 🔥 1
  • 🐳 1
  • 👾 1
More from @futuris
  1. Sep 24, 2026Пока все говорят о замедлении ИИ — мы ускоряемся.⚡️ Сегодня стартуем вместе с Paragon и ра…
  2. Sep 24, 2026Opus 5.5 спроектировал LEGO-копию робота Microduck 🦆 Автор попросил Claude сделать модель…
  3. Sep 24, 2026Хм, теперь понятно почему релиз Gpt-6 Sol был таким слабеньким - Сэм Альтман выступил на С…
  4. Sep 24, 2026Opus 5.5 возрождает пиксельарт, может и в таком стиле ещё игру забацать? 🎮 кстати расход…
  5. Sep 23, 2026Ого-го как Антропики расщедрились -Claude Code теперь может продолжать работу, даже когда…
  6. Sep 23, 2026Ладно пора и новости почитать: Вы слышали про биологическую лабораторию Anthropic? О ней с…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →