TGViewer
Knowledge Accumulator Knowledge Accumulator @knowledge_accumulator · 5.68K subscribers
Post #106 1.97K
Почему не бывает хороших и плохих статей

Наткнулся на статью об эксперименте, проведённом организаторами NeurIPS в 2014 году.
Случайные 10% статей, 166 штук, отправили на ревью не к одной комиссии, а к двум, причём первая набиралась из одной случайной половины людей, а вторая из другой. Получили следующий результат:
1) 22 статьи были приняты обеими комиссиями
2) 43 статьи были приняты только одной комиссией (по 22 и 21)
3) 101 статья была не принята ни одной комиссией
Так что половина статей на топовой конференции по ML попадает туда рандомно.

Спустя эти годы, организаторы посчитали цитируемость принятых статей с этой конференции (как логарифм от кол-ва цитат) и посчитали её корреляцию с разными оценками ревьюеров. Смотрели 3 вещи - оценка качества; предсказание того, что статья принесёт большой вклад; уверенность ревьюера в выданной оценке. Самая большая корреляция - аж 0.25! - у последнего.

К чему это я? На мой взгляд, идея того, что можно придумать процедуру, которая "объективно" отбирает хорошие статьи, изначально ошибочна. Это не значит, что все они одинаково полезные, они полезные каждому по-разному. И на большое количество статей сообщество могло бы отвечать более качественно, чем "выбрать 3 случайных желающих специалистов и поставить оценку".

А может быть, в ML статьи вообще не нужны?
1) Более прикладные исследования, нацеленные на результат, отлично можно оценивать с помощью вещей типа paperswithcode или kaggle, в зависимости от временного горизонта. Когда мы оцениваем результат, это нужно делать не с помощью метода "каждый сам у себя делает табличку и сравнивает себя с конкурентами". И, кроме того, прикладное исследование без публикации кода полезно примерно на 20%. Даже крупному бизнесу так было бы в рекламных целях интересно спонсировать "команды" - по сути как в киберспорте, и все бы ориентировались на результат, а не тупые отчёты.
2) Обмен идеями в процессе фундаментальных (теоретических) исследований с помощью статей - это доисторический формат, соответствующий письмам в конвертах и голубиной почте. Интернет позволяет исследователям по всему миру совместно работать, брейнштормить, спорить. Часто возникшая полезная мысль может быть написана как один твит. Уверен, что если бы исследователи не пытались высасывать из себя статьи без перерыва, а просто общались открыто в интернете и обсуждали идеи и темы, в которые искренне верят, даже 90% времени тратя просто на споры, брейнштормы и размышления, прогресс шёл бы гораздо быстрее.

А вы что думаете?

@knowledge_accumulator
  • 👍 39
  • 🔥 5
  • 👎 2
  • 🤷 2
  • 🤔 1
  • 🥴 1
More from @knowledge_accumulator
  1. Sep 20, 2026Почувствуйте AGI Все эти годы я писал о том, что не верю в потенциал LLM превратиться в су…
  2. Sep 5, 2026Предсказать среднее могут не только лишь все Классическая задача машинного обучения - трен…
  3. Aug 17, 2026Долина vs Нью-Йорк Если что-то находится далеко от нас, нам свойственно излишне обобщать с…
  4. Jul 30, 2026Кто виноват в сливе рекламного бюджета? При создании рекламного line item рекламодатель ус…
  5. Jul 13, 2026Покатался на яхте в Американской глубинке После переезда в Калифорнию произошло неожиданно…
  6. Jun 30, 2026Да кто такие эти ваши producer-side A/B-тесты? В своей яндексовской эре работы над рекомен…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →