TGViewer
Information Retriever Information Retriever @inforetriever · 4.12K subscribers
Post #41 2.56K
Про чтение статей (для R&D).

Доклад, по которому я планировал писать пост, был структурирован следующим образом — (1) мотивация, (2) где искать информацию, и (3) как её структурировать. Но как-то в текстовом виде нормально написать про мотивацию не получается, в голову лезут одни банальности, поэтому напишу следующее: я испытываю эстетическое удовольствие от получения новой информации по интересующим меня темам. У меня в голове есть образ архивного историка в гигантской библиотеке, копающегося в древних пергаментах в поисках истины.

Другие причины для ресерча: он влечёт долгосрочные улучшения качества базовых технологий, развитием которых вы занимаетесь. Помогает дотягиваться до высоко висящих фруктов и не застревать в локальных оптимумах. Еще можно приплести exploration vs exploitation аналогию, где exploration — это чтение литературы, а exploitation — копание в собственных идеях.

Для себя я выделил два основных сценария поиска информации:
1. Retrieval — поиск информации по конкретной теме. Вы уже знаете какая у вас задача, ну или просто хочется стать экспертом в конкретной теме. Т.е. более точечное, узконаправленное развитие знаний.
2. Discovery — вас интересует достаточно широкая область, без конкретики; целью является скорее не отставать от трендов, не упустить появление новых технологий. Это больше про широту (ширину?) познаний.

Более простой из двух — определенно retrieval:
1. Главное — найти хотя бы одну хорошую статью по теме. Дальше поможет граф цитирований. Надо смотреть на кого ссылаются авторы, кто ссылается на них (google scholar). Полезно смотреть другие публикации авторов (тоже google scholar); и прошлые, и будущие. Последний автор статьи это, как правило, руководитель группы, в публикациях которого отражена работа всей команды. Related works даёт чуть больше контекста про то, на что ссылаются авторы.
2. Поиск по arxiv и гугление: поиск по архиву, конечно, странно работает; иногда можно не найти статью по присутствующему в ней киворду.
3. У лидеров индустрии есть страницы с публикациями, инженерные/ресерч блоги. Полезно сформировать у себя понимание какие компании на чем специализируются, чтобы знать чьи блоги просматривать. E.g. Spotify, Pinterest, Twitter, Google
4. Тематические воркшопы на конференциях. Обзоры (статьи, блоги).

Основные источники discovery:
1. Регулярное чтение arxiv секции нужной области (e.g. cs.IR). Есть и ежедневные (new), и еженедельные (recent) списки новых публикаций. Просматривать надо не в лоб, а с некоторой процедурой отбора кандидатов (см. ниже).
2. Свежие конференции. Может быть небольшая задержка относительно arxiv, в который статьи часто попадают еще будучи пре-принтами.
3. Научные семинары на работе и общение с коллегами.
4. Дайджесты (e.g. #arxiv_weekly)

Процедура фильтрации нерелевантных статей в arxiv для discovery:
1. Чтобы отфильтровать 3/4 публикаций, достаточно названия, абстракта и авторов.
2. Введение и результаты. Введение — это расширенный абстракт, в котором ближе к концу тезисно расписаны достижения статьи.
3. Иногда что-то неладное получается отловить только на секциях моделирования, экспериментов, ablation study.
4. Есть еще такие критерии, как воспроизводимость и публикация на конференции, но на них я не смотрю.

Моя эволюция структурирования информации про статьи:
1. Никаких записей, всё в голове.
2. Рукописные заметки к статьям на бумаге, затем на планшете.
3. Выделение текста в пдфке, короткие заметки.
4. Выделение цельных предложений / абзацов вместо фраз, терминов, коротких кусочков предложений.
5. Использование Zotero для хранения и структурирования пдфок со статьями. Создание иерархий, использование тэгов. Потом стал вписывать аффилиацию авторов в отдельное поле.
  • 🔥 33
  • 🙏 1
More from @inforetriever
  1. Sep 19, 2026А я сегодня стал лауреатом премии Yandex ML Prize! В номинации “Преподаватели”. Спасибо вс…
  2. Sep 19, 2026Я не покемон, но меня можно сегодня поймать на Practical ML Conf :)
  3. Sep 18, 2026WARNING: пост на отвлеченную тему)) Я люблю историю. В детстве мне попадались различные кн…
  4. Sep 15, 2026Yandex Advanced Personal Intelligence Lab (лаборатория перспективных исследований персонал…
  5. Sep 15, 2026photo post
  6. Sep 13, 2026Небольшой тизер :) Таксую чисто для души (шучу)
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →