🤖 Ученые лаборатории исследований искусственного интеллекта (ИИ) T-Bank AI Research создали метод SAE Match, который позволяет понять, почему модель приняла то или иное решение в процессе вычисления. В перспективе можно будет влиять на ответы ИИ, повышая их точность и качество.
«Наши исследования в области интерпретируемости ИИ направлены на то, чтобы сбои можно было заметить и быстро исправить их без дорогостоящего переобучения модели», – рассказал руководитель научной группы LLM Foundations T-Bank AI Research Никита Балаганский. Он также добавил, что это научное открытие станет первым шагом к созданию более надежного ИИ.
По данным ученых, новый метод обеспечивает прозрачность работы нейросети, позволяя отслеживать, как меняются концепции от слоя к слою в процессе вычислений. В отличие от традиционных подходов, требующих дорогостоящего обучения модели, разработка, в частности, позволяет напрямую контролировать процесс генерации текста.
Отмечается, что ключевое преимущество SAE Match в том, что для работы не нужны дополнительные данные и вычислительные ресурсы. Это делает технологию особенно ценной для небольших исследовательских групп, не обладающих возможностями для масштабной обработки данных, уверены разработчики.
Источник: Ведомости