Искусственный интеллект уже давно не ограничивается простыми ответами. Сегодняшние большие модели рассуждений (LRM) могут разворачивать целые цепочки размышлений, что позволяет им решать более сложные задачи. Но как понять структуру этих рассуждений? Как близко ИИ приближается к человеческому мышлению? Одна из идей для анализа рассуждений — это использование теории эпизодов Шёнфельда, которая помогает понять, как люди решают нестандартные задачи.
Эпизодичность рассуждений: от человека к машине
Шёнфельд, создав свою теорию для анализа решения математических задач, заметил, что опытный решатель двигается по определённым этапам. Он читает задачу, анализирует, планирует шаги, выполняет действия, проверяет результаты и иногда возвращается к предыдущим этапам для уточнений. Современные LRM, такие как DeepSeek‑R1 или GPT‑o1, также демонстрируют аналогичное поведение, переходя от чтения к анализу, а затем к выполнению. Эти модели даже делают паузы для размышлений, что делает их решения удобными для разметки по эпизодам.
Как это исследовалось?
Для анализа исследователи использовали задачу SAT по математике и генерировали решения с помощью LRM DeepSeek‑R1. Далее проводилась двухуровневая разметка: абзацы разделялись на категории (например, General, Explore, Verify), а каждое предложение помечалось одной из меток эпизодов. Это дало возможность собрать первый открытый корпус данных, который можно использовать для анализа машинных рассуждений.
Что показал анализ?
Переходы между эпизодами в решениях моделей выглядят логично. Чаще всего модели идут от чтения к анализу, от планирования к выполнению, а этап Explore часто возвращается к анализу для уточнений. Эти паттерны напоминают поведение человеческих экспертов, что позволяет говорить о развитии управляемой структуры решения у ИИ.
Могут ли ИИ автоматически размечать такие эпизоды?
Когда исследователи сравнили модели GPT‑4.1, GPT‑4o и Gemini‑2.0‑flash в разных режимах разметки, результаты показали, что точность размечающих систем значительно улучшалась при добавлении инструкции. Например, для GPT‑4.1 точность на уровне абзацев выросла с 0.444 до 0.740, а для предложений — до 0.681. Это подтверждает важность детальных инструкций для точной аннотации.
Зачем это нужно?
Работа с эпизодами не ограничивается просто анализом решений. Это открывает новые возможности для интерпретации ИИ, контроля его действий и обучения. Например, можно усиливать важные эпизоды, как проверки, и наказывать модели за бессмысленные циклы размышлений. Также это помогает сделать системы рассуждений более управляемыми и интерпретируемыми.
Методика эпизодичной разметки может стать важным инструментом для улучшения интерпретируемости и управления рассуждениями ИИ. Это открывает новые горизонты для анализа решений, от понимания, где модель ошибается, до создания более стабильных и предсказуемых систем. ИИ уже приближается к человеческому рассуждению?
Data Science
