Post #451
674

Наверняка многие уже видели график дня — талантливые ребята из Poetiq применили свою надстройку к GPT 5.2, и смогли набрать 75% на ARC-AGI-2. Официальная валидация на внутренних тестах ещё впереди, поэтому итоговые оценка будет несколько скромнее, но учитывая, что год назад лучшие решения набирали меньше 5%, а сам бенчмарк часто рассматривался скептиками в качестве подтверждения того, что «ИИ не способен думать и делать выводы за пределами обучающих данных», это отличный результат, соответствующий очень оптимистичному сценарию развития способностей искусственного интеллекта.
- ❤ 8