Про всякое - спонтанно, нерегулярно, как на душу ляжет.
Про работу, программирование, кино, игры про все подряд.
Post #455
442


Интересное, конечно, золотая макось для M5 весит почти в 2 раза больше чем для М4🤔
ЗА @laxcity_lead



go-exhaustruct v5.2.0 с поддержкой go1.27 и дополнительно вкрутил возможность игнора blank-assignments (часто полезно для ситуаций проверки соответствия интерфейсу). Теперь останется дождаться нового патча golangci-lint и можно будет пользоваться.golangci-lint доступна как exhaustruct_v5.
go-exhaustruct 5.1.go-no-shadow в golangci-lint (ставлю против себя, потому что мне тупо лень).
git-nexus и codebase-memory-mcp. Цели у туловины немного другие, но в агентской разрабоке оочень помогает. С черновиком я работаю уже 2 месяца и наверное это один из самых полезных mcp в арсенале. А еще оно на расте 🤦♂️ Ну нельзя отиндексироват граф зависимостей из 400к файлов на 6х языках за 20 секунд, оставаясь на гошке (учитывая что триситтер вообе на сях).Anton's eXtensible Prompt или `AXP`– по существу, смесь упрощенных CommonMark и XML с целью потребления модельками и, как вы поняли, удобства мейнтейнинга. Аж сразу в трех язках будет выпускаться: раст, го и тс.
Заметки лида-раздолбая А новый The Ghost In The Shell ничотак. Весьма доставляет рисовка - она очень близко повторяет рисовку исходной манги. Вы здесь совершенно точно не увидите ни экзистенциальных кризисов из аниме 1995го, ни "взрослого" прагматизма синдрома одиночки 2002-2005х.…
learning_rate не держат постоянным от начала до конца. Чаще всего, на старте идёт прогрев — шаг плавно увеличивают с около-нулевых значений, чтобы первыми же резкими движениями не разнести и без того едва живую инициализацию. Ближе к финалу наоборот: шаг плавно сбрасывают почти в ноль, чтобы модель аккуратно осела в найденную низину, а не проскочила её. А в 2025–2026 в моду вошёл другой подход: шаг держат постоянным почти весь прогон, а резко роняют почти в ноль лишь под самый конец — на финальной порции самых качественных данных.параметр = параметр − learning_rate × градиент. По существу — мы двигаем каждое число чуть-чуть против его градиента, то есть в сторону, где ошибка меньше. Здесь у нас новый термин — learning_rate, длина шага.learning_rate на все миллиарды параметров — это компромисс: у одних параметров градиенты крупные, у других еле заметные, и одна ставка шага на всех всегда кому-то да выйдет боком. Задерёшь повыше — крупные пойдут вразнос; прижмёшь — мелкие будут ползти как улитки. Хочется, чтобы у каждого параметра был свой, персональный шаг. Так и появился AdamW — де-факто стандарт обучения LLM аж с 2017 года.1, а всем остальным — 0. Из выдачи модели вычитаем эталонное распределение и получаем исходный градиент.NaN, и весь прогон обучения можно сразу завершать и списывать в убытки.−log(p), где p — вероятность, которую модель дала правильному токену. p = 0.9 даёт около 0.1, а p = 0.01 — уже 4.6.0.1 — модель отличная, около 5 — не понимает ничего. Но loss живёт на логарифмической шкале, и на глаз по ней тяжело понять, насколько всё плохо. Поэтому её часто переводят в перплексию — возводят e в степень loss. Читается это число просто: из скольких равновероятных вариантов следующего токена модель будто выбирает наугад. Если loss 0.1 перплексия будет примерно 1.1, ну а если loss 5 - примерно 150. Сравнивать перплексию и соответственно loss между моделями бесполезно, т.к. на неё напрямую влияет токенизатор и корпус обучения, а они у всех разные.