TGViewer
Тест Тьюринга Тест Тьюринга @testuring · 2.13K subscribers
Post #2132 541
🧬 Современные ИИ-модели — это всё ещё "дилетанты" в науке

Команда InternScience представила SciEvalKit — амбициозный опенсорсный фреймворк для оценки научного интеллекта (Scientific General Intelligence, SGI). В первую неделю января 2026 года разработчики SciEvalKit сравнили новейшие ИИ-модели GPT-5.2, Gemini 3 Pro и Qwen 3 в решении научных задач.

Выяснилось, что хотя Gemini 3 Pro лидирует в мультимодальном восприятии (понимание графиков и схем), GPT-5.2 все еще удерживает первенство в «символьных рассуждениях» (математика и физика).

На текущий момент SciEvalKit зафиксировал, что даже лидеры рынка показывают значительное падение точности при переходе от «школьных» задач к реальным научным вызовам, где требуется мультимодальное мышление.


Как работает SciEvalKit❓

SciEvalKit переносит фокус с «проверки знаний» на «проверку способностей действовать» в условиях научной неопределенности. Оценка научных способностей ИИ обычно страдает от трёх «болезней»:

➡️ Загрязнение данных: модели просто зазубривают ответы из учебников, которые есть в обучающей выборке. Высокий балл в тесте больше не означает наличие интеллекта — это лишь хорошая память.
➡️ Текстоцентричность: реальная наука — это нелинейный анализ графиков, формул, молекулярных структур и кода. Обычно бенчмарки проверяют только текст, игнорируя мультимодальную природу открытий.
➡️ Оторванность от практики: модель может знать закон Бойля-Мариотта, но не уметь написать рабочий скрипт для симуляции давления в конкретном эксперименте.

Фреймворк охватывает 6 фундаментальных областей, объединяя более 15 специализированных бенчмарков в единый пайплайн: физику, астрономию, химию, материаловедение, биологию и науки о Земле.

🔍 Как именно тестируют модели?

SciEvalKit оценивает то, что авторы называют SGI, через 7 ключевых компетенций:

1️⃣ Мультимодальное восприятие: способна ли модель «увидеть» аномалию на графике или считать данные с диаграммы рассеяния?
2️⃣ Символьные рассуждения: решение сложных уравнений и работа с математической нотацией без арифметических галлюцинаций.
3️⃣ Научный кодинг: генерация исполняемого кода для моделирования. SciEvalKit проверяет код не по «похожести», а по результату его выполнения.
4️⃣ Генерация гипотез: умение предлагать новые направления исследований на основе предоставленных данных.
5️⃣ Понимание текстов: глубокая аналитика научных статей, выделение методологии и результатов.
6️⃣ Научное обоснование: способность выстроить логическую цепочку «наблюдение -> гипотеза -> эксперимент -> вывод».
7️⃣ Академическое письмо: оформление результатов в соответствии со стандартами научных публикаций.

Система оценки в SciEvalKit гибридная и максимально объективная:
- Rule-based: жесткая проверка ответов там, где есть однозначная истина.
- Execution-based: запуск сгенерированного моделью кода в изолированной среде и проверка выходных данных.
- LLM-as-a-Judge: использование продвинутых моделей (уровня GPT-5 или Qwen-Max) для оценки творческих и аналитических задач по строгим научным рубрикам.

🚀 Почему это важно для науки?

Это «полигон», который показывает реальные слабые места модели. SciEvalKit модульный: вы можете легко добавить свой проприетарный датасет и прогнать его через готовый пайплайн оценки, получив подробный радар-график компетенций.

Инструмент помогает выбрать «цифрового лаборанта». Вместо того чтобы верить маркетинговым заявлениям о «самой умной модели», ученый видит, какая нейросеть лучше справляется, например, именно в химии белков или написании Python-скриптов для обработки данных.

💬 Тест Тьюринга. События в сфере ИИ. Подписаться
  • 🔥 3
  • ❤ 2
  • 👍 1
More from @testuring
  1. Sep 25, 2026🧬 Claude открыл неизвестную генетическую систему Anthropic запустила собственную группу п…
  2. Sep 24, 2026💊 Claude выходит в лабораторную науку Novo Nordisk и Anthropic заключили соглашение об ис…
  3. Sep 23, 2026ИИ, который не умеет генерить текст и картинки, но зато умеет выбирать Соавтор статьи об I…
  4. Sep 22, 2026🧪 Новый инструмент проверки научных гипотез AlphaXiv выпустила OpenResearch — открытую ра…
  5. Sep 21, 2026👿 Новости из Японии: снова оркестрация вместо одной гигантской ИИ-модели 11 сентября япон…
  6. Sep 18, 2026⚠️ ИИ уже нарушает правила, которые люди только начинают писать На этой неделе произошло с…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →