Новый метод под названием SAE Match показывает, как работают механизмы принятия решений ИИ и почему модель делает то или иное заключение в процессе вычисления.
С помощью нового метода можно отслеживать, как ИИ генерирует ответы, и вовремя скорректировать их. Это первый шаг на пути к более прозрачным, точным и понятным алгоритмам, что особенно важно при внедрении ИИ в критически важные сферы, такие как медицина, финансы и безопасность.
➡️ В чем суть открытия?
Современные LLM состоят из нескольких слоев, каждый из которых использует результат предыдущего. Таким образом модель старается улучшить свои предсказания слой за слоем. Однако иногда модель может выдавать недостоверную информацию.
Ранее не существовало метода, который позволял бы проследить, как концепции изменяются от слоя к слою.
🌟 SAE Match — первый инструмент, который не просто фиксирует концепции на отдельных слоях, а анализирует их эволюцию в процессе вычислений.
Эксперименты на ряде моделей показали, что он помогает отслеживать признаки, которые остаются неизменными на нескольких слоях сети. Это делает поведение ИИ более предсказуемым и понятным.
📌 Мы задали несколько вопросов о новом методе Никите Балаганскому, руководителю научной группы LLM Foundations T-Bank AI Research. Ниже его комментарии специально для Теста Тьюринга⬇️
Про ограничения нового метода:
Метод SAE Match в текущем виде — это первый шаг к пониманию внутренней структуры языковых моделей и процесса генерации текста. В рамках нашей работы мы допускали, что концепции, возникающие по ходу генерации, последовательно передаются от слоя к слою внутри LLM. Однако на практике это работает намного сложнее – новые концепции могут появляться где-то внутри модели, объединяться или, наоборот, распадаться на отдельные компоненты.
На практике это ограничение проявляется так, что небольшая часть связей, которые мы находим, на самом деле оказывается неправильной. Но мы активно продолжаем работу в этом направлении и новых работах уже нашли способы понимать структуру LLM более точно.
Про развитие технологии в будущем:
Мы не видим принципиальных ограничений, которые могли бы помешать использовать этот метод для ещё более масштабных моделей, чем те, с которыми мы работали в наших экспериментах.
Эта и другие технологии, над которыми мы работаем в области интерпретируемости, в перспективе позволят воспринимать ИИ как прозрачный и понятный механизм, чью структуру и работу можно осознать и при необходимости изменять под конкретные задачи.
Мы уверены, что по мере развития таких методов появятся инструменты, которые позволят смотреть на модели так же, как мы сейчас смотрим на обычный программный код — и быстро устранять возникающие проблемы.
Про экологичность технологии:
Методы интерпретируемости, в том числе наш, действительно могут внести вклад в повышение экологичности и энергоэффективности ИИ-индустрии. Прозрачные и управляемые модели позволяют точечно вносить изменения в поведение ИИ без необходимости полного переобучения, что снижает нагрузку на вычислительные ресурсы. Это, в свою очередь, уменьшает энергозатраты. Вряд ли такие изменения произойдут в ближайшем будущем, но мы точно движемся в этом направлении и работаем над тем, чтобы это будущее стало реальностью.
Про отрасли или сферы, которые могут извлечь наибольшую выгоду от внедрения технологии:
Мы считаем, что, в первую очередь, наш метод может быть особенно полезен небольшим командам и компаниям, у которых нет возможности переобучать модели каждый раз при возникновении нежелательного поведения.
Кроме того, такие технологии особенно актуальны в сферах, где цена ошибки высока и критически важно понимать, как именно ИИ приходит к своим решениям. Это, в частности, медицина, финансы и системы безопасности — области, где прозрачность и надежность моделей имеют решающее значение.
💬 Тест Тьюринга. События в сфере ИИ. Подписаться
#новостьдня
