Пока мы с вами ждем эфир, вот вам выжимка из свежей статьи от Anthropic про то, как они научили модель "думать" по-новому. И нет, речь не про Extended Thinking, о котором я писал еще с релизом модели.
Речь идет об инструменте, который значительно расширяет возможности модели в решении сложных задач. Компания рассказывает о так называемом "think" tool, который позволяет Claude выделять специальное пространство для структурированного мышления в процессе работы над задачей.
Что это за "think" tool и как он работает?
По сути, это дополнительный "шаг мышления" для Claude при генерации ответа. Если раньше Claude просто выдавал результат, то теперь, особенно когда информации для ответа недостаточно, или задача требует обработки внешних данных, модель может использовать этот инструмент, чтобы "подумать" над задачей.
Важно отметить, что это не то же самое, что "extended thinking". "Extended thinking" относится к процессу, который Claude выполняет перед генерацией ответа, когда модель глубоко анализирует задачу и планирует свои действия. А "think" tool, наоборот, используется в процессе генерации ответа, позволяя Claude остановиться и проанализировать, достаточно ли у него информации для дальнейших действий.
Подход, на мой взгляд, очень интересный. Но не напоминает ли это вам что-то? Подумайте!
Нечто похожее можно увидеть у разных компаний. Например, примерно так работает DeepResearch у ряда ИИ-сервисов, когда модель задает нам доуточняющие вопросы, чтобы лучше понять задачу.
Вообще, дать модели "подумать" - это вполне логичный шаг с точки зрения промптинга. Подобная стратегия широко применяется, чтобы снизить баяс (предвзятость) модели и направить ее в нужное русло. Разница сейчас будет в том, что теперь модель сама определяет, когда это надо сделать.
В целом, такой подход позволяет развивать LLM в сторону принятия автономных решений, что необходимо для создания ИИ-агентов. Поэтому сам подход - не является чем-то новым и удивительным, но прикольно, что они идут в сторону автоматизации. Тем не менее, моделям все равно необходима будет валидация, и лучше всего это работает в сочетании с подсказками от человека, что как раз отметили в исследовании.
Звучит прикольно, но как это работает в реальности?
От себя точно могу сказать, что подобный подход - очень эффективен. В Pollux AI мы как раз даем моделям доп шаг на “размышление” при брифинге клиента, это позволяет модели лучше следовать сценарию.
Разработчики Claude, в свою очередь, протестировали "think" tool на базе τ-bench, бенчмарка для оценки способности модели использовать инструменты в реалистичных сценариях обслуживания клиентов.
Тесты показали значительное улучшение результатов в задачах, требующих:
- Анализа вывода инструментов.
- Соблюдения строгих политик.
- Принятия последовательных решений, где каждый шаг зависит от предыдущего.
Как отмечал выше, лучше всего использование "think" tool работало в сочетании с оптимизированными подсказками, дающими модели примеры рассуждений для анализа запросов пользователей.
В общем, мы уверенно движемся к созданию более автономных ИИ-систем, о которых как раз сегодня поговорим 😉