Как ИИ сдал экзамен по финансовому анализу и победил в математической олимпиаде — лучшие статьи декабря 2025
В декабре 2025 года ИИ-агенты вышли на новый уровень: они прошли экзамен для профессиональных финансовых аналитиков, взяли золото математической олимпиады, научились собирать рабочие репозитории по научным статьям и находить уязвимости в реальных инфраструктурах. В декабрьском обзоре:
1. Когда команда ИИ-агентов помогает, а когда делает только хуже
И один в поле воин. Не всегда команда агентов работает лучше. Эффект появляется лишь в задачах, которые можно декомпозировать и проверить, а в линейных сценариях агенты могут мешать друг другу.
🔍 Обзор статьи | 📜 Полная статья
2. DeepCode: как ИИ научился собирать репозиторий по статье
DeepCode умеет сжимать научную статью в план, хранить репозиторий как систему контрактов и постоянно проверять себя запуском кода. Теперь к каждой статье можно легко собрать код для проверки.
🔍 Обзор статьи | 📜 Полная статья | 💾 Код
3. ИИ-агент против людей-безопасников: кто кого в реальном пентесте?
Агент ARTEMIS научился искать уязвимости в живой инфраструктуре на уровне профессиональных пентестеров-людей, но стабильнее, быстрее и дешевле.
🔍 Обзор статьи | 📜 Полная статья | 💾 Код
4. DataFlow: PyTorch для дата инженеров в эпоху LLM
Качество агентов начинается с качества данных. А подготовка данных для обучения моделей — это сложный, итеративный процесс. Фреймворк DataFlow предлагает удобный модульный пайплайн для комплексной работы с данными.
🔍 Обзор статьи | 📜 Полная статья | 💾 Код
5. Как измерить SGI «общий научный интеллект» у LLM
Ученые определили SGI как способность системы решать сложные исследовательские задачи. Так ИИ-модели хорошо справляются с отдельными исследовательскими шагами, но плохо собирают целостное исследование. Есть куда расти, но теперь уже по понятным критериям.
🔍 Обзор статьи | 📜 Полная статья | 💾 Код
6. Когда цифр недостаточно: язык как скрытый сигнал в экономических ИИ-моделях
Теперь новости и посты в соцсетях встраиваются в экономические модели как полноценный фактор. Это делает ИИ более устойчивым к кризисам и ближе к реальным экономическим процессам.
🔍 Обзор статьи | 📜 Полная статья
7. Когда тесты молчат: как ИИ-агент чинит баги
Фреймворк InfCode делает тесты активной частью разработки: агенты усиливают проверки, чинят код и отбирают лучшие решения.
🔍 Обзор статьи | 📜 Полная статья | 💾 Код
8. Как ИИ-агенты решают задачи международной олимпиады по математике
За счет формирования лемм, их хранения и повторного использования проверенных лемм, ИИ завоевывает золото китайской олимпиады и серебро на международной.
🔍 Обзор статьи | 📜 Полная статья
9. Сможет ли ИИ пройти сложный экзамен по финансовому анализу?
Рассуждающие модели прошли CFA на уровне лучших финансистов. Основные ошибки — в этике и интерпретации. Поэтому людей ИИ полностью не заменит в финансовых задачах.
🔍 Обзор статьи | 📜 Полная статья
10. Почему простые задачи оказались для ИИ самыми сложными
AI Consumer Index показывает, что даже лучшие ИИ-модели справляются с покупкой товаров лишь в половине случаев, часто галлюцинируя. Надежность и, как следствие, полезность персональных ассистентов — следующий критический рубеж.
🔍 Обзор статьи | 📜 Полная статья | 💾 Код
Размер моделей перестал быть определяющим фактором успеха для ИИ. Агенты уже конкурируют с людьми благодаря правильной “инженерии мышления”.
Надеюсь, в новом году мы увидим значительный прогресс во внедрении ИИ в бизнес с заметными экономическими эффектами: ведь у нас уже есть все детали конструктора. Осталось научиться собирать из них такие ИИ-системы, которые можно встраивать глубоко в бизнес-процессы.
Желаю всем в это захватывающее время сохранять огонь в глазах, отдать ИИ все самое скучное и заниматься тем, что действительно приносит удовольствие от жизни. С Новым годом!
👉 Подробный обзор
#исследования
Post #274
3.09K