TGViewer
Channel Public Channel
Свидетели Градиента

Свидетели Градиента

@gradientwitnesses

Этот канал предназначен для общения и обсуждений среди тех, кто как и я, хочет видеть что происходит под капотом у нейросетей, и старается развивать интуицию об их природе и свойствах.

Для связи: @kraidiky
Subscribers
674
Photos
169
Videos
0
Links
76
Recent Posts 18 shown
Post #429 180
Есть туча хорошо теоретически и эмпирически обоснованных работ (включая мою находящуюся в работе), утверждающих, что оптимальную скорость можно нащупать экспериментируя с разннобразными внутрисетевыми метриками. Практически предалгали использовать годов с 80-ых, а теоретический базис создан начиная со статей 1955-ого года. Интересно, что у modded-nanogpt - мирового чемпиона по скорости обучения на одной эпохе, эти метрики зашкаливающе далеко сидят в области "Слишком большая скорость, угроза коллапса модели".
  • 🔥 2
  • 💯 1
  • 👀 1
Post #428 402
Что вы знаете об унижении...

Я всегда являлся и являюсь сторонником точки зрения, что человек, берущийся руководить чем-то размером больше скворечника должен в прошлом быть скворцом, хотя бы чуть-чуть. Потому что когда менеджерить берутся люди, которые линейными сотрудниками по этой теме ни дня не были, получается вот именно то, что мы видим вокруг. И вот занесла меня нелёгкая на собеседование на котором мне предложили руками без агентов сделать несложную задачку на чтение-запись файлов из потоков асинхронно в некое хранилище на питоне с частью функций синхронной и ограниченной памятью. Для человека, который каждый день сервера пишет это, скорее всего уже на уровне рефлексов. Очень богатая гамма чувств, весьма смешанных. С одной стороны ты себя чувствуешь человеком, которому на собеседовании на роль создателя игр выжживачей дали камень, деверво, и бечёвку с задачей создать каменный топор и срубить им это же дерево, на скорость, желательно. Чрезвычайно поучительно. С другой публичное унижение под запись. С третей даже и не ощущаешь на сколько быстро теряются даже те крохи навыков, которые у тебя были в эпоху ассемблера, и добывания огня трением. Без инструментов и расширителей сознания, хотя бы в виде чатботов, ощущаешь легкую абстиненцию, даже немного не лёгкую. Словно тебе руки поотрубали...
  • 🤝 11
  • 😁 6
  • 🤗 1
Post #426 616
Обнаружил в корпусе автора, опубликовавшего единолично 8 стьатей по теме, 4 в феврале этого года, три в апреле, и ещё одна в мае, а потом автора, видимо, начались каникулы...
При втягивании статей в корпус в них автоматически обнаружилось по 6-8 внутренних несоответствий, но код репозиторий выложен, и по карайней мере часть результатов кажется хоть и проходными но реальными. Страшновато смотреть в новое лицо ресёрча. :))))

P.S. Если у вас нет 8 препринтов до мая, возможно вы отстали от жизни? А уж как я отстал, со своей прекрёстной проверкой и выверением фактов...
Post #425 424
Post #424 579
Есть сильное подозрение, что антропик готовит к выкладке новую модель, потому что модели начали люто тупить, и принудительно обрывать длинные задачи на середине если на них не накричать. ПРошлый раз так было в последнюю неделю перед выкладкой Fable. Ну или вычресурсов бедолагам не хватает. :)
  • 🤔 3
  • 👍 2
Post #423 933
https://github.com/kraidiky/grokking-conceptual-review — концептуальный обзор литературы по теме гроккинга. Чуть больше сотни статей, чуть больше полусотни ключевых понятий. Собрано агентом с человеком внутри цикла. Можно знакомиться в браузере, а можно скачать себе и открыть, например, в Obsidian — ссылки работают. Что важно:

1) Это именно обзор существующей в научном обороте литературы. Там есть взаимные противоречия, что-то из этого неверно или не воспроизводится — я сознательно воздерживался от исправлений и оценок: это именно авторское мнение, чутка саммаризированное.

2) Очень многое (но не всё), что я считал своей интересной находкой, оказывается, описано в статьях — но очень часто не так и не с теми нюансами, которые заметил я и которые, возможно, заметите вы. Вот на эти маленькие различия нужно обращать внимание. Как говорится: «Что для одного — ошибка эксперимента, то для другого — начальные данные». И даже специалисты, пишущие в этой области, обо многом уже опубликованном ни сном ни духом.

3) В обзоре существуют ошибки, неточности цитирования, неправильности понимания и всё вот это. Всех, кто читает и заметил ошибку, я призываю писать мне или создавать ишью, чтобы я исправил и дополнил скрипты, собирающие этот корпус:

- Например, вы, сравнивая саммаризацию с цитатой или всей статьёй, заметили, что в саммаризации написано не то, что имел в виду автор.
- Или обрезка цитаты искажает смысл
- Или какая-то статья отнесена или не отнесена к корпусу незаслуженно.
- Или какой-то важный тезис или наблюдение пропущены при саммаризации — например, заслуживают отдельной карточки концепта, но отсутствуют в соответствующем списке.
- Или просто сеть пропустила какое-то важное наблюдение и свела его к «общепринятому» способу понимания. (Это самый важный тип ошибок, который хотелось бы научиться ловить.)
- Обычные ошибки с разметкой, форматом, искажёнными формулами, потерявшимися картинками и тому подобное.
- Можно сделать карточки удобнее или отформатировать, или добавить какую-то важную информацию — например, репозиторий, если он был выпущен вместе со статьёй. Любые идеи и предложения.

4) Мне интересны отзывы самого разного уровня: и человека, просидевшего над темой пару лет, и человека, недавно вкатившегося в DL и сейчас укладывающего всё это в своей голове. Я надеюсь, что такая форма подачи поможет большему количеству людей расширить и углубить кругозор и снизит порог, мешающий начать погружаться в тему на произвольную глубину.

5) Распространяйте. Ставьте звёздочки, репостите, скидывайте знакомым самого разного уровня, помогайте собирать обратную связь.

6) Вообще-то это начиналось как автоматизированный литобзор к научной статье и именно в этом качестве может быть полезно в будущем, когда каждый такую штуку будет собирать для своей работы.

7) Доклад о том, как делать такие обзоры, будет на осеннем ДатаФесте в Новосибирске — он стоит того, чтобы туда лететь.
GitHub GitHub - kraidiky/grokking-conceptual-review: Conceptual Literature Review по гроккингу: карточная вики из >100 карточек статей… Conceptual Literature Review по гроккингу: карточная вики из >100 карточек статей и >50 карточек понятий, с переводами и разборами. Некоммерческий образовательный проект. - kraidiky/g...
  • 🔥 10
  • 👍 6
  • 🤔 1
  • 🙏 1
Post #420 833
https://vkvideo.ru/video-164555658_456242070?list=ln-SRWG8Clhu1ThoJBdvu Дождался!!! Наконец-то выложен мой доклад на весеннем датафесте. И, что удивительно, он почти не устарел.
Хотел добавить мысль, которая ан масс проходит мимо слушателей, как выяснилось: Этот же инструмент позволяет вам для инференса даже весьма специфических сетей получать ядра, прицельно оптимизированные именно под вашу задачу, именно для вашего оборудования, и именно на тех матрицах и тех режимах, которые вам нужны. Презентация по ссылке: https://t.me/GradientWitnesses/376

P.S. Если уже посмотрели и понравилось - репостите!
VK Видео Владислав Голощапов | Как стадо агентов делает ресерч и немножко авторесерча Спикер: Владислав Голощапов, Независимый исследователь Data Fest 2026: https://ods.ai/events/datafest2026 Презентацию к докладу Вы можете скачать в треке секции Agentic LLM ______ Наши соц.сети: Telegram: https://t.me/datafest Вконтакте: https://vk.com/datafest…
  • 🔥 3
  • ❤ 2
  • 👍 1
  • 🙏 1
Post #419 597
Я тут копошусь по корпусам тектостов статей и вижу зияющее подтверждение того о чём говрил раньше - придумать механизм и сделать чтобы сообщество его заметило - две очень разные вещи.
Помнится на на датафесте год назад я рассказывал про то, что локальных минимумов, не счуществует, а ландшафт на самом деле каньон в котором оптимизатор мечется между стенками.
Позже выяснилось, что статья о том, что локальных минимумов не существует, вероятно, написал в 2016-ом году сам Ян Гудфелоу, его статья по GAN-ы имеет больше 10 тысяч цитирований. Но даже на его статью мало кто обратил внимание. Он, конечно, показал это не так строго как я , но всёж таки товарищь заметный. А концепцию что ландшафт это узкая долина, и оптимизатор мечется между стенками придумали Xing и др. 2018 Они, конечно показали это не так красиво как я, но зато изобрели ту самую угловую метрику, которую. я позже переизобрёл и везде пользуюсь.
И так сплошняком. Почти все изобретатели правильных алгоритмических идей оказываются незамечены, пока лет через десять-двадцать кто-то не скажет "О! Я кажется придумал! Смотрите какой крутой результат, как это никто раньше то не догадался..."

Делитесь своими идеями, вдруг они сделают кого-нибудь знаменитым.
  • ❤ 7
Post #418 668
Ту самую гроккинговую задачку я уже знаю как облупленную. Подумал я тут на досуге, а что если дать той же сетке задачку посложнее, и дал. Три оппернда в обратной польской записи, все возможные операции, то есть 16 вариантов операций в общей сложности. Модуль взял 47, потому что размеры датасета получились, как куб от модуля - эпохи по 10 секунд. Как обычно 50% в валидейшене. В общем-то я ожидал любого разхвития ситуации, но такого даже я не ожидал...
  • 😁 6
Post #417 705
Что бы такого замутить на юбилей? И на сколько это что-то должно быть заумное. Пишите в комментариях.
  • ❤ 1
Post #416 589
А вы раньше знали, что для достижения лучшего validation loss ваше расписание lr иногда должно его не уменьшать, а увеличивать?
  • 🤯 5
Post #415 831
Если вы занимаетесь агентской автоматизацией, и ещё не знаете с какой вероятностью LLM полностью крэшит вашу работу, значит вы ещё не до конца разобрались в агентской автоматизации...
  • 😁 6
  • 🔥 4
Post #414 713
И вот уже бенчмарк Fable снова наливается соком и актуальностью. :))))
  • 👍 2
  • 🎉 2
Post #412 829
Гроккинг другим способом, без weight_decay, кстати, ранг матриц после гроккинга не меняет, уже не использующиеся веса и связи так и продолжают лежать в матрице балластом.
  • 🔥 5
Post #410 611
Вот это гроккинг на 750-ой эпохе, а вот это - как меняются ранги матриц после гроккинга. После гроккинга значительная часть матриц становится попросту не нужна, и спокойненько деградирует в 2-5 раз. Так что киньте тапочком в того, кто скажет, что современные модели оптимальны, и реально нуждаются в том количестве параметров, которые им необходимы до того, как они правильно решат задачу.
  • 👍 5
  • 🔥 3
Post #409 658
Сегодня обсуждали интересную возникшую петлю отрицательной обратной связи, для большинства метрикой успеха ИИ является принятое количество мердж реквестов, и исправлений, но их проверкой занимаются те же люди которые делают внедрение. Получается, чем менее качественно они свою работу по проверке того, что им натворил ИИ, тем выше оценка его полезности.

В голову приходят радикальные меры, типа мы не принимаем ваш результат агентской автоматизации пока вы не скажете где он лажает, потому что если вы этого не можете сказать, значит просто недостаточно проверили его работу. Или ещё менее продаваемое: Любой завайбкоженый прототип считать хорошей документацией на задачу, по которой её потом можно будет сделать нормально.

В общем получается, что в магии вайбкодинга есть два уровня. На первом вы вооружившись агентами чувствуете своё всесилие, и способность автоматизхировать всё или почти всё. На втором уровне мага вы понгимаете где у ЛЛМ-ок слепые зоны и где не справляются и где и как типично лажают. Третий уровень тоже есть.
  • 👍 1
  • 😁 1
  • 🤔 1
Post #408 605
Только что Клод собрал мне валидную научную статью, соответствующую формальным ограничениям, и общепринятому здравому смыслу с одного четёрехстрочного промпта. Конечно при этом ему было доступна более крупная версия моей статьи, включающая ту же тему, доступно было две папки результатов тестовых прогонов, под двести штук, папка с текстами 67 статей по связанным темам, и беглый анализ совпадающих и не совпадающих тезисов с моими предыдущими работами, короче материалов завались.

И какого вердикта вы ожидаете от человека, пропагандинрующего авторесерч как инструмент?

Полная фигня! Везде где требуется суждение или оценка результатов она неправильноая! Общепринятая, но неправильная, не смотря на то, что все нужные данные из которых всё очевидно перед глазами, но ни один очевидный но не общепринятый вывод не сделан. Пока Хьюмен ин зе луп, который понимает предметную область и имеет её некоторую интуитивную трактовку незаменим.

В этом месяце...
  • 😁 7
  • 🤔 1
Older posts →

About this channel

How can I read @gradientwitnesses without a Telegram account?
TGViewer shows the public web preview Telegram publishes for Свидетели Градиента: recent posts, photos, videos and the subscriber count, with no app, login or account.
How many subscribers does Свидетели Градиента have?
Свидетели Градиента (@gradientwitnesses) has 674 subscribers on Telegram, refreshed roughly every 30 minutes.
Does Свидетели Градиента know I viewed it here?
No. Public channel previews carry no viewer identity, and TGViewer has no accounts or tracking of what you look up.
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →