Российские диссертации — один из самых трудоемких форматов научного знания. При этом их невозможно найти в международных базах статей, которые сейчас легко анализировать при помощи ИИ и ML-инструментов.
Конечно, каждая отечественная диссертация обязана поступать в РГБ по требованиям о хранении обязательного экземпляра. Но найти их тоже было почти невозможно: только по ключевым словам, или только если знаешь точный заголовок или фамилию автора.
На Всероссийском библиотечном конгрессе 2026 года РГБ объявила о запуске национальной ИИ-платформы, которая открывает беспрецедентный доступ к 200 млн единиц хранения. Это значит, что появился инструмент поиска всего, что было написано и защищено в российской науке за 200 лет существования «Ленинки».
➡️ В основе платформы лежит Аналитическая нейросетевая справочно-информационная система — АНСИС, разработанная на отечественном ПО, включённом в реестр Минцифры. Вся инфраструктура и данные находятся на серверах РГБ, что гарантирует суверенитет информации.
➡️ Партнёром в разработке стала MWS AI — AI-подразделение МТС Web Services, в 2025 году объединившее ключевые AI-активы МТС, включая VisionLabs и Big Data МТС. Проект реализован совместной командой — технологами РГБ и инженерами MWS.
В РГБ теперь работает семантический поиск
Старый поиск в библиотечном каталоге работал буквально: если в заголовке диссертации написано «нейронные сети», а автор использовал термин «многослойный перцептрон», поиск не найдёт ничего.
Семантический поиск преобразует каждый текст в числовой вектор — математическое «отображение смысла» в многомерном пространстве. Близкие по смыслу тексты дают близкие векторы, даже если в них нет ни одного общего слова.
Например, запрос «применение глубокого обучения в кардиологии» найдёт диссертации про нейросетевую диагностику аритмий, ИИ в ЭКГ-анализе и предсказательные модели сердечно-сосудистых рисков вне зависимости от конкретной терминологии автора.
Все публикации включены в граф знаний
NER (Named Entity Recognition) — технология, которая в тексте автоматически распознаёт именованные сущности: людей, организации, даты, географические названия, научные концепции. Из этих сущностей строится граф: каждая сущность — узел, каждая связь между ними — ребро.
Диссертация «Иванова А.П., МФТИ, 2018, о методах сжатия нейронных сетей» соединяется с другими работами по смежным темам, с публикациями той же научной школы, с последующими работами, которые цитировали те же концепции. Вместо изолированных документов получается сеть: кто с кем работал, какие темы пересекаются, где есть научные школы.
Что теперь доступно?
Принципиально важно, что фонд главной библиотеки страны, отражающий 200 лет истории и знаний, становится доступен не только в виде полных текстов, но и в формате структурированных датасетов, которые могут использоваться для обучения собственных языковых моделей и создания новых ИИ-сервисов.
Почему это важно именно сейчас?
В контексте ограничений на западные ИИ-платформы вопрос о том, на каких данных обучать отечественные LLM, стоит остро. 200 миллионов единиц РГБ с задокументированным происхождением, сохранённых на российских серверах и открытых для использования в ML-задачах — это ресурс, которого раньше не существовало.
💬 Тест Тьюринга. События в сфере ИИ. Подписаться
