Команда InternScience представила SciEvalKit — амбициозный опенсорсный фреймворк для оценки научного интеллекта (Scientific General Intelligence, SGI). В первую неделю января 2026 года разработчики SciEvalKit сравнили новейшие ИИ-модели GPT-5.2, Gemini 3 Pro и Qwen 3 в решении научных задач.
Выяснилось, что хотя Gemini 3 Pro лидирует в мультимодальном восприятии (понимание графиков и схем), GPT-5.2 все еще удерживает первенство в «символьных рассуждениях» (математика и физика).
На текущий момент SciEvalKit зафиксировал, что даже лидеры рынка показывают значительное падение точности при переходе от «школьных» задач к реальным научным вызовам, где требуется мультимодальное мышление.
Как работает SciEvalKit❓
SciEvalKit переносит фокус с «проверки знаний» на «проверку способностей действовать» в условиях научной неопределенности. Оценка научных способностей ИИ обычно страдает от трёх «болезней»:
➡️ Загрязнение данных: модели просто зазубривают ответы из учебников, которые есть в обучающей выборке. Высокий балл в тесте больше не означает наличие интеллекта — это лишь хорошая память.
➡️ Текстоцентричность: реальная наука — это нелинейный анализ графиков, формул, молекулярных структур и кода. Обычно бенчмарки проверяют только текст, игнорируя мультимодальную природу открытий.
➡️ Оторванность от практики: модель может знать закон Бойля-Мариотта, но не уметь написать рабочий скрипт для симуляции давления в конкретном эксперименте.
Фреймворк охватывает 6 фундаментальных областей, объединяя более 15 специализированных бенчмарков в единый пайплайн: физику, астрономию, химию, материаловедение, биологию и науки о Земле.
🔍 Как именно тестируют модели?
SciEvalKit оценивает то, что авторы называют SGI, через 7 ключевых компетенций:
1️⃣ Мультимодальное восприятие: способна ли модель «увидеть» аномалию на графике или считать данные с диаграммы рассеяния?
2️⃣ Символьные рассуждения: решение сложных уравнений и работа с математической нотацией без арифметических галлюцинаций.
3️⃣ Научный кодинг: генерация исполняемого кода для моделирования. SciEvalKit проверяет код не по «похожести», а по результату его выполнения.
4️⃣ Генерация гипотез: умение предлагать новые направления исследований на основе предоставленных данных.
5️⃣ Понимание текстов: глубокая аналитика научных статей, выделение методологии и результатов.
6️⃣ Научное обоснование: способность выстроить логическую цепочку «наблюдение -> гипотеза -> эксперимент -> вывод».
7️⃣ Академическое письмо: оформление результатов в соответствии со стандартами научных публикаций.
Система оценки в SciEvalKit гибридная и максимально объективная:
- Rule-based: жесткая проверка ответов там, где есть однозначная истина.
- Execution-based: запуск сгенерированного моделью кода в изолированной среде и проверка выходных данных.
- LLM-as-a-Judge: использование продвинутых моделей (уровня GPT-5 или Qwen-Max) для оценки творческих и аналитических задач по строгим научным рубрикам.
🚀 Почему это важно для науки?
Это «полигон», который показывает реальные слабые места модели. SciEvalKit модульный: вы можете легко добавить свой проприетарный датасет и прогнать его через готовый пайплайн оценки, получив подробный радар-график компетенций.
Инструмент помогает выбрать «цифрового лаборанта». Вместо того чтобы верить маркетинговым заявлениям о «самой умной модели», ученый видит, какая нейросеть лучше справляется, например, именно в химии белков или написании Python-скриптов для обработки данных.
💬 Тест Тьюринга. События в сфере ИИ. Подписаться
