Большие языковые модели обучаются на огромных массивах текстов, включая книги, статьи и веб-сайты. В идеале они должны усваивать общие закономерности языка и факты, генерируя новый, уникальный контент, но на практике LLM нередко выдают фрагменты исходных данных слово в слово. Это может привести к нарушению авторских прав или раскрытию конфиденциальной информации.
Изучение этого вопроса является сложной проблемой для учёных, поскольку для проведения серьёзных исследований требуются огромные и дорогостоящие вычислительные мощности.
С 23 по 27 апреля 2026 года в Бразилии состоится одна из крупнейших конференций по машинному обучению ICLR-2026. На ней будет представлен Hubble — первый инструмент с открытым исходным кодом, предназначенный именно для анализа механизмов запоминания в LLM.
Мы очень надеемся, что “Хаббл” позволит проводить больше исследований в области запоминания,
— говорит Джонни Вэй, разработчик «Хаббла» и аспирант Университета Южной Калифорнии.
Исследователи из Университета Южной Калифорнии и Института программных систем имени Макса Планка получили доступ к вычислительным ресурсам через Национальный исследовательский ресурс в области искусственного интеллекта при Национальном научном фонде США, а гигант по производству чипов NVIDIA согласился предоставить 200 000 часов вычислительного времени, что позволило команде обучить и запустить почти два десятка специализированных больших языковых моделей.
Подробнее: https://www.science.org/content/article/ais-can-memorize-data-they-shouldn-t-can-they-be-forced-forget
❤PULSE SCIENCE 👍 ID SCIENCE 💙VK 💬MAX