TGViewer
Channel Public Channel
Никита и его пост-пшд

Никита и его пост-пшд

@phdnikita

канал про жизнь и получение PhD в Швейцарии / Европе / загранице и все, что с этим связано @nikita_orange.
Subscribers
973
Photos
12
Videos
4
Links
28
Recent Posts 17 shown
Post #137 854
Вдогонку к прошлому посту про зачаточный уровень physical reasoning у VLM-ок и то, почему AGI еще не здесь.

Недавно я пропустил, как Vladlen Koltun (там еще были Yann LeCun и Jitendra Malik) рассказывал про «On Spatial Cognition in Frontier Models» в ETH, и очень обидно, что я все пропустил (энивей, ссылка тут, советую посмотреть). Его поинты — это на самом деле хорошая иллюстрация того, где вообще находится лимит у VLM в физических задачах, что я упоминал ранее.

Если коротко: он там много говорит о том, что мы живем в мире победившего парадокса Моравека, что мне показалось довольно новой перспективой. Современные модели отлично работают в кодинге, текстах, абстрактной логике, и так далее. Но они могут быть совершенно беспомощны в вещах, которые любой трехлетний ребенок делает не задумываясь.

Причиной он называет то, что “…высококогнитивные процессы требуют относительно небольших вычислений, в то время как низкоуровневые сенсомоторные операции требуют огромных вычислительных ресурсов”. Что можно примерно перевести как “работать с текстами на самом деле очень просто, по сравнению с вижуал (и всякими другими) инпутами”. Идея интересная, но скорее довольно far-fetched и философская, но в целом указывает в верном направлении.

Применяя эту логику к VLM-моделям, можем сделать предположение, что у них во многом отсутствует spatial cognition (от себя бы еще добавил temporal cognition). Весь этот хайп вокруг frontier моделей построен на топ-даун подходе, когда мы скормили моделям терабайты (тексты + картинки) данных в надежде, что из этого вырастет понимание физики, но пока что не получается. На разных базовых тестах, вроде 3D object mental rotation, прохождения лабиринтов или поиска коротких путей, VLM показывают результаты на уровне случайного угадывания (статья с бенчмарком).

Один из интересных пойнтов был такой, что топорный скейлинг здесь больше не поможет. Чтобы помочь модели лучше понимать физику, её нужно дообучать (и тут я плюсую) и менять саму архитектуру инференса (тут ничего сказать не могу). Из интересного: сейчас моделям пытаются прикрутить visual chain of thought, когда модель перед ответом генерирует промежуточные визуальные токены, прежде чем выдать файнал предикшен (статья с примером).

Возвращаясь к моему опыту со всеми этими моделями, я почти со всем согласен. Out of the box VLM-модели действительно не понимают физику движений, динамику объектов и пространственный контекст в видео-инпутах. Но я бы не согласился с тем, что проблема именно в каком-то концептуально плохом архитектурном решении, а скорее в качестве и количестве физических данных, на которых эти модели обучались. Перед тем как делать громкие заявления на уровне “LLMs/VLMs are dead”, я бы попробовал нормально собрать данные для своей конкретной задачи и качественно сделать пост-трейнинг, это вполне себе неплохо работает.

PS: А теперь интерактив, к посту я заатачил видос из интернетов с примером смены полосы (файл в комментах). Чтобы более наглядно прочувствовать то, о чем я писал выше, предлагаю подписчикам засунуть этот видос в LLM of choice с вопросом “Does this video contain a lane-change maneuver?” (с выключенным Thinking mode). Результаты пишите в комментарии. Мое предположение, что в 90% случаев ответ будет “No”.
  • 🔥 4
  • ❤ 3
Post #136 1.15K
Хотя уже прошёл целый год, у меня ещё осталось несколько проектов с епфл, которые публикуются только сейчас — а именно нам приняли статью в TMLR 🎉

Если вкратце, то мы занимались следующей проблемой: 3D Gaussian Splatting сейчас — это де-факто один из самых популярных способов представлять 3D сцены, но если ты хочешь взять объект из одной сцены и вставить его в другую, то результат может выглядеть нереалистично — освещение на объекте просто не совпадает с окружением.

Наш инсайт: диффузионные модели неявно учатся понимать правильное освещение объектов на большом количестве реальных сцен во время обучения. Мы это использовали и научились корректировать освещение вставленного объекта через минимизацию DDS-подобного лосса и оптимизацию параметров 3DGS объекта без всяких environmental maps и прочей боли.

По сути, ключевая идея состоит в том, что итерация DDS пытается увеличить likelihood изображения относительно трейнинг данных. А так как в обучении используются изображения с естественным освещением, то и при итерации DDS мы можем эффективно делать релайтинг объекта.

Я бы сформулировал основную идею так: в диффузионных моделях заложено намного больше неявного знания о физике, которое мы до конца не используем и которое может выражаться всякими интересными способами.

PS: Я попробовал объяснить всё более детально в видосе ниже, please take a look!

🎬 Video: https://youtu.be/g5IGoEqZqKU?is=SUYmq4SvH4vXE97l
📄 Paper: https://openreview.net/forum?id=1jjIitxVmM
🌐 Project page: https://www.norange.io/projects/diff_relight/
💻 Code: https://github.com/sevashasla/D3DR
🔬 Colab: https://colab.research.google.com/github/sevashasla/D3DR/blob/main/notebooks/D3DR.ipynb
YouTube [TMLR 2026] Diffusion Models are Secretly Zero-Shot 3DGS Harmonizers Introducing D3DR: Diffusion Models are Secretly Zero-Shot 3DGS Harmonizers — a simple, training-free method for realistic 3D object insertion under lighting mismatch. No environmental maps and no material estimation. By leveraging diffusion priors, we achieve…
  • 🔥 17
  • ❤ 8
Post #131 1.12K
Дорогие подписчики, этот канал НЕ мертв,

но наличие работы в моей жизни явно отвлекает меня от чего-либо. Попробую исправить этот пробел этим постом.

Про работу: последний пост был примерно год назад — практически тогда, когда я начал фултайм работать в нвидии и моя сладкая пхд-шная жизнь подошла к концу. Оказывается, на работе надо работать каждый день, что для человека, который 5 лет балансировал между «not in a mood to work today» и бессонной неделей перед дедлайном, поначалу ощущалось странно.

Чем я занимался: в 2025 году у меня была стажировка в нвидии в self-driving org-е, куда я и попал после стажировки. Я и сам не знал, что у нвидии он есть, — а он существует. Бизнес-модель очень простая: нвидия делает софт для self-driving, чтобы больше self-driving компаний могли быстрее делать продукты и выходить на рынок. Условно, захотел ты себе сделать стартап с self-driving грузовиками, но вместо того, чтобы тратить деньги на разработку стека, ты просто берёшь его у нвидии. А с ним пачкой закупаешь гпу-шечки — и круг замкнулся. Кроме стартапов, таким могут заниматься и большие компании, например Mercedes-Benz & NVIDIA.

За этот год у меня сменилось около 3–4 менеджеров и 4 команд. Переходы не по моему желанию были связаны с реорганизациями, по моему — стратегическими соображениями (о всей этой истории позже). Финальной остановкой (на данный момент) стала команда, которая занимается прикручиванием VLM-ок к майнингу и поиску данных для self-driving (конкретно — видео). Совместными усилиями нам удалось убедить менеджмент, что нам очень нужно всё файнтюнить, чем я сейчас конкретно и занимаюсь. Тема сама по себе очень интересная, и у меня накопилось какое-то количество инсайтов, которыми я буду рад поделиться.

Для затравки: AGI is not here, и physical reasoning находится сейчас на очень зачаточной фазе. Как его дальше развивать без большого количества качественных данных — я не вижу. А разметка physical данных (например, для драйвинга) — это особая категория страданий. Джепа и всякие world models — это замечательно, но я не вижу, как они разрешают проблему с данными. Об этом всём тоже попробую написать в последующих постах.

А теперь перейдём к очень поверхностному описанию того, зачем селф драйвингу нужен майнинг и почему это вообще чуть ли не главная вещь для него (и в целом для любого physical эйай). Одной из основных частей self-driving стека является модель планировщик, которая управляет автомобилем (куда крутить руль, газ-тормоз и так далее). Обучают этот планировщик на огромных массивах данных вождения людей: буквально каждый день условная Tesla берёт пару сотен водителей, сажает их в машины, облепленные камерами и датчиками, и они катаются по заданным маршрутам. После этого данные собираются вместе, и модель-планировщик учится по входам с камер (и лидаров) предсказывать, как в конкретном случае поехал бы человек.

Как оказывается, 99% вождения — это скучная езда по прямой и ожидание в пробках. Такое поведение планировщик выучивает очень легко, и в целом эта задача не очень сложная. Самое интересное начинается на так называемых редких long-tail cases (прикрепил пару примеров внизу), на которых планировщик практически гарантированно сломается и начнёт вести себя странно, что может привести к авариям и другим плохим вещам. По сути, это всё те же out-of-distribution samples, которыми я фактически занимался весь свой пхд, только вместо их детекции надо заниматься их поиском. У них есть два конкретных и важных применения, но о них я уже расскажу позже. Основная идея, которую я хотел донести этим постом: без эффективного майнинга corner cases никакой physical ai не получится, потому что 1) ошибки модели в данном приложении становятся слишком дорогими, 2) blind spots надо закрывать.

На самом деле, если тут кто-нибудь занимается robotics, было бы очень интересно узнать, возникают ли подобные же проблемы и в других областях (кроме условного селф драйвинга)? Судя по моим ощущениям, проблема long tail не является уникальной и присуща любым аппликейшенах, а в любых physical приложениях делать ошибки очень нехорошо.
  • 🔥 49
  • ❤ 6
  • 👏 2
  • 👍 1
Post #130
Channel name was changed to «Никита и его пост-пшд»
Post #129
Channel photo updated
Post #128 9.5K
Ну и раз я вчера упомянул, что пока еще разбираюсь с последними проектами в универе, то вот один из них — у нас взяли статью на ✨ ICML в Ванкувере ✨ про новый Test-Time Training (если вкратце, то главная идея в том, что во время инференса мы апдейтим веса модели, оптимизируя какой-нибудь self-supervised лосс — это помогает модели быть более generalizable).

На самом деле, сама идея очень интересная и, как мне кажется, набирает обороты. Я сам пытаюсь её как-нибудь раскачивать (например, через эту torch-ttt либу, чекайте), о чём тоже хочу написать пару постов. Из более модного: я знаю, что TTT сейчас начали активно применять для увеличения длины контекстов у LLM-ок — об этом тоже как-нибудь напишу. Из моего опыта, TTT довольно часто может значительно улучшать перформанс модели на corrupted или out-of-distribution данных, а применять его довольно просто — это мы подробно обсудили в статье.

А вот тут будет призыв к действию: для нашей статьи я подготовил кучу материалов, включая видос ниже, где постарался в целом покрыть всю идею TTT. Я потратил слишком много времени в Manim-е, всё это верстая, поэтому просмотры / лайки будут highly appreciated. Ссылки на страницу статьи, посты, код и всё вот это — оставлю ниже.

Кому будет интересно, можете попробовать идею в этом ноутбуке.

📄 Paper: https://arxiv.org/abs/2410.04201
🧠 Project page: https://www.norange.io/projects/ittt/
💻 Code: https://github.com/nikitadurasov/ittt
🎬 Video: https://www.youtube.com/watch?v=eKGKpN8fFRM
🧩 torch-ttt class: https://torch-ttt.github.io/_autosummary/torch_ttt.engine.it3_engine.IT3Engine.html
🔬 Notebook: https://colab.research.google.com/github/nikitadurasov/ittt/blob/main/exps/mnist/it3_torch_ttt.ipynb
YouTube [ICML 2025] IT³: Idempotent Test-Time Training Introducing IT3: Idempotent Test-Time Training — a simple, universal method for improving model performance under distribution shift. No complex auxiliary losses and no architectural constraints. By enforcing idempotence, we achieve consistent gains across…
  • 🔥 26
  • ❤ 5
  • 👍 4
Post #127 2.15K
Так-с, активности на работе оказались слишком активными, поэтому я немного выпал. Но! В начале мая я наконец-то защитил диссертацию и получил свой диплом — с этого момента совсем официально могу называть себя доктором наук. Всем спасибо, кто поучаствовал — было очень приятно всех увидеть / услышать.

На самом деле, забавно, насколько это ожидаемое мероприятие, но по сути ничего магического в нём нет. Сейчас я нахожусь в состоянии, когда мои активности в универе убывают (надо было закончить пару проектов), и в целом не думаю, что появятся новые.

В целом, я очень рад, что это все наконец-то закончилось и мне не придется больше писать статьи в качестве рабочих тасок))) В новой команде в нвидии тоже всё интересно, есть чем поделиться — но это я уже как-нибудь потом. А пока вот вам моя фотография с моим профом в качестве пруфа.
  • 🔥 68
  • ❤ 7
  • 👏 5
  • 👍 2
Post #126 2.28K
Очень сумбурный пост (оказалось, что организовывать свою защиту это не самая тривиальная задача), но тут какое-то количество людей хотело послушать мою защиту, которая будет в эту пятницу в 16:00 CET. Я очень постараюсь нормально организовать зум, поэтому отпишите мне в личку и я вас добавлю.
  • 👍 6
  • 🔥 4
  • ❤ 1
Post #125 2.63K
Так-с, ну и короткий апдейт по поводу работы: мне наконец-то выдали все контракты и пермиты, поэтому официально с прошлой недели я начал работать как рисерчер в той же команде в Нвидии, в которой стажировался в прошлом году.

Офишиалли я буду ресерч саентистом, но по факту мне ещё предстоит разобраться, насколько много там будет ресерча, потому что сам департмент сам по себе довольно продакт-ориентед. В целом, пока что впечатления очень хорошие: довольно много ресурсов, прикольная команда, довольно шаристый менеджер и так далее. Напишу больше про это все позже.

Есть в целом некоторые наблюдения на тему CV-ресерча, которые я заметил и в Нвидии, и в других компаниях за время собеседований, но об этом расскажу в следующих постах (если кратко, то есть ощущение, что в CV почти весь ресерч, кроме диффьюжена, медленно умирает).

На прошлой неделе меня также уволили из ЕПФЛ, поэтому я официально больше не студент, что ощущается довольно странно. Пока что до конца не обработал информацию о том, что моя почти 10-летняя история с учёбой наконец-то закончилась. Well, пока что не до конца, потому что мне ещё предстоит организовать свою паблик-защиту в следующем месяце, но об этом апдейт тоже будет позже.
  • 🔥 60
  • 👏 14
  • 👍 3
  • 🌭 3
  • ❤ 2
Post #124 2.42K
Uncertainty in Deep Learning, p.1 (Intro)

This time, let's try to do it in English for my English-speaking readers.

While I’m still waiting for my job permits for my new job, I decided to condense some of my knowledge about my PhD topic—uncertainty estimation (UE) in deep learning—into a series of blog posts where I try to explain the subject in simple terms for a broad audience.

In the first post below, I want to talk about the basics of UE, its applications, and its current state.

At the bottom of the post, you can leave your reactions and comments, which are strongly welcomed. Any suggestions for improvement and sharing it with those who might be interested are highly appreciated!: [link]
  • ❤ 25
Post #123 2.34K
Если обобщить последние параграфы: новоиспечённые пхд, я вас просто умоляю, миллион раз перепроверяйте, куда вы идёте. Разговаривайте со студентами, особенно с теми, кто уже на последних курсах — они расскажут, как всё устроено изнутри и что вас потенциально ждёт. Я знаю, что есть лаборатории, где пхд проходит менее стрессово, и, честно говоря, мне кажется, что это более продуктивный сценарий.

bisous
  • ❤ 52
  • 👍 6
Post #122 2.12K
⚡Major update v0.1.0

И, наконец, я могу написать апдейт на тему того, что происходило в последние 5–6 месяцев и чем всё закончилось.

Первая новость в том, что на прошлой неделе у меня была формальная приватная защита, и я её прошёл, поэтому теперь я почти официально доктор! В епфл есть немного необычная система, когда люди защищаются в два этапа: на приватной и публичной защитах, и официально пхд ты получаешь только после второй. Разница в том, что приватная часть самая важная, на ней к тебе приходит жюри из профов и докторов, они *якобы* (некоторые реально) читаю твой тезис и слушают презентацию по нему + задают вопросы, потом решают принимать твой тезис или нет. Публичная часть это скорее для самих студентов, туда обычно приглашают кучу людей (у нее открытое посещение), довольно неформальная обстановка и un p’tit apéro после. Я думаю все это организовать в течение пары месяцев, чтобы было время нормально все подготовить и пригласить всех кого надо. Если в этом канале есть кто-то (могу предположить, из епфл и около), кто хочет присоединиться, то буду только рад. Для людей из епфл, вы скорее всего увидите имейл с инвайтом, когда я все назначу, все остальные отпишите мне в личку.

Апдейт второй будет в том, что я получил оффер в цюрихе и остаюсь в швейцарии. Пока что думаю над тем, где я буду жить, но глобально думаю перезжать ближе к цюриху, хотя и неуверен что хочу жить в самом городе. На тему работы и оффера хочу написать отдельный пост, потому что там много чего интересного происходило, много чего нового удалось обсудить со всякими прикольными людьми. Много узнал про рынок труда на данный момент, какая там вообще есть динамика и что происходит. В плане того, чем я буду дальше заниматься, то как это неудивительно, я продолжу работать над всяким ucnertainty estimation и robusteness для сеток. Это на самом деле довольно забавно, потому что топик не то что прямо невероятно трендовый, хотя есть положительная динамика. В общем, все сложилось наилучшим образом, но об этом всем я расскажу уже тогда, когда получу доки и начну работать.

Если быть до конца откровенным, я пока не до конца осознал, что моё пхд подходит к концу. За это время я много раз представлял, как всё будет происходить, но в итоге особого удовлетворения от защиты не испытал. Хотя, наверное, это баг человеческой природы, и ничего другого ожидать не стоит.

Еще одна забавная мысль, которая у меня появилась: все эти последние 5 лет моей жизни (кто читает канал давно, могли это заметить по старым постам) я жил в буквально перманентном состоянии стресса (как и большинство людей в нашей лабе, и многие мои знакомые, которые делали пхд во всяких топ универах), который фактически начал проходить только сейчас, когда условно рабочая / финансовая ситуация начала стабилизироваться и будущее становиться более понятным и предсказуемым. Думаю, что количество разговоров про мое пхд (скорее в негативном ключе) лучше всего этот факт иллюстрируют.

У меня даже есть гипотеза, что я уже не совсем помню какой я сам по себе человек, потому что постоянный фоновый стресс, который никаким образом нельзя из своей жизни убрать, довольно сильно влияет на поведение человека в целом. У меня были периоды, когда я практически не вставая лежал в кровати неделями, ни с кем не общался, иногда начинал длительное курить (хотя на постоянной основе я этого не делаю; делал это по большей части из-за того же стресса), но при этом мне надо было себя заставить сесть писать какой-нибудь очередной сабмишн на какую-то очередную конференцию и вариантов этого не делать просто не было. Самодиагностикой депрессии заниматься не буду, но я бы вообще не удивился если бы она у меня была (и не у меня одного). Кто задумается над тем, чтобы начать делать пхд, это вам пища для размышлений.

С более позитивной стороны, мне кажется, что пхд выработало у меня огромную способность к автономии и теоретически неограниченную стрессоустойчивость, хотя последнюю я бы предпочёл не проверять :)
  • ❤ 57
  • 🔥 9
  • 👍 2
Post #121 2.08K
так, довольно рандомно, я позже опишу как так все получилось, но ситуация следующая: сегодня я получил оффер из одного хорого места в цюрихе. Еще лучше, что есть другая компания в америке, которая тоже хочет мне дать оффер (думаю если их пингануть, то я могу его получить на следующей неделе). Вопрос какой, я понятия не имею как и почему негошиэйтить зарплату и в каких пределах. Кейс хороший, потому что *почти* есть второй оффер и возможно есть место для негошиэйшена (хотя число из второго оффера я не видел, потому что его еще нет). Итого, если тут есть люди, которые в этом шарят, то любые советы тут или в личку очень приветствуютя и заранее спасибо.
  • 🔥 27
Post #120 2.68K
В мой последний разговор с моим профессором, я все же решил спросить, могу ли я уже начинать писать тезис, и ответ был «да». Таким образом, кажется, это будут мои последние полгода на пхд, и на этом моя докторская история заканчивается. Пока я до сих пор обрабатываю эту информацию, но назрел очень релевантный вопрос:

Есть ли какие-то годные гайды по поиску работы после?

В целом, я не думаю, что с этим будут проблемы, но любая информация будет полезна, поэтому накидайте чего-нибудь в комментарии. Сейчас я на стадии, когда поднимаю старые контакты и собираю реферы ВЕЗДЕ. Поэтому, если у вас есть опция реферов, то тоже пинганите.
  • ❤ 22
  • 👍 4
Post #119 2.62K
Ну и сам пост про статью. Я уже купил себе билеты в Вену и собираюсь там быть в течение всего ICML с 20 по 27 июля, поэтому если кто-то из этого чатика будет там, то буду рад увидеться (и приходите смотреть наш постер!) 🙂

Любая помощь в промоуте статьи категорически приветствуется (лайки и комментарии работают лучше всего), поэтому я оставлю пару ссылок тут и всем заранее спасибо: https://tinyurl.com/mxk6hxe6!
LinkedIn #icml2024 | Nikita Durasov, PhD I'm delighted to share that our recent paper, titled "Enabling Uncertainty Estimation in Iterative Neural Networks," has been accepted at #ICML2024 in Vienna! Estimating the uncertainty of model predictions is crucial for a wide range of applications across…
  • 👍 16
  • 🔥 6
Post #118 2.94K
Никита и его пост-пшд Могу предположить, что здесь есть некоторый процент людей, кто сабмитился на ICML и им может быть интересно: [link] Остальные могут оценить, чем я только не занимаюсь, чтобы только не работать над своим пхд.
Пожалуй, поделюсь этим и тут: нашу статью взяли на ICML! Это был самый странный опыт сабмитов из всего моего пхд, потому что ребаттл мы начали с тремя реджектами из четырех, но смогли вывезти на все аксепты после, о чем я думаю сделать отдельный пост. Из важного, скорее всего этот акцепт ознаменовывает конец моего пхд и скорый градюэйшн. Пока не до конца проработал эту информацию, чувствуется немного сюрреалистично!
X (formerly Twitter) Nikita Durasov (@nikitadurasov) on X Thrilled to announce that our paper on uncertainty for iterative models has been accepted at @icmlconf! We explore how variance in consecutive interactions influences prediction uncertainty. More details in the preprint! #ICML2024 #ICML #ML
  • ❤ 39
  • 👏 11
  • 👍 10
Post #117 2.92K
Могу предположить, что здесь есть некоторый процент людей, кто сабмитился на ICML и им может быть интересно: [link]

Остальные могут оценить, чем я только не занимаюсь, чтобы только не работать над своим пхд.
X (formerly Twitter) Nikita Durasov (@nikitadurasov) on X Nervously waiting for #icml2024 decisions? I made an app that can estimate your chances of acceptance based on your scores! Check it out: https://t.co/Q6lF7kI6qi
  • 😁 12
  • ❤ 3
Older posts →

About this channel

How can I read @phdnikita without a Telegram account?
TGViewer shows the public web preview Telegram publishes for Никита и его пост-пшд: recent posts, photos, videos and the subscriber count, with no app, login or account.
How many subscribers does Никита и его пост-пшд have?
Никита и его пост-пшд (@phdnikita) has 973 subscribers on Telegram, refreshed roughly every 30 minutes.
Does Никита и его пост-пшд know I viewed it here?
No. Public channel previews carry no viewer identity, and TGViewer has no accounts or tracking of what you look up.
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →