TGViewer
Channel Public Channel
То шо нейросети

То шо нейросети

@toshoseti

На пальцах, местами с матом, местами с претензией на юмор, но познавательно.
Subscribers
1.41K
Photos
660
Videos
198
Links
1K
Recent Posts 19 shown
Post #2049 224
На Уране нет урана. Живите с этим, а то че я один.
  • 🤯 6
  • 😁 2
  • 😱 1
Post #2048 183

Forwarded from NLP Wanderer

Halo: почти год моей работы в White Circle теперь в опенсорсе

Почти год я веду в White Circle разработку Halo - фреймворка для тренировки LLM, на котором мы учим все свои модели. Внутри он работал давно как замена Мегатрона, но до публичного релиза пришлось догнать transformers, TRL и vLLM, добавить модели и упростить адопшен - образы, CLI, документация. Подробный блогпост - на сайте White Circle (https://whitecircle.com/research/halo).

Если вы файнтюните открытые модели, то наверняка упирались в: модель уже не лезет в TRL и обычный FSDP, но связываться с Megatron и конвертацией чекпоинтов еще рано или просто не хочется. С MoE все еще хуже, без Expert Parallelism их по большому счету не потренировать. Halo добавляет EP, Context, Tensor и Expert-Tensor Parallelism прямо поверх обычных классов HuggingFace: на вход HF модель, на выходе HF модель. Новое MoE семейство подключается оберткой меньше 140 строк (у Megatron-Bridge на то же самое уходит 600-1900), сейчас их 15.

Немного цифр, все на B300, воспроизводимы из репо:
- 2.3-2.8x throughput относительно стокового TRL на gpt-oss-20b при тех же кернелах, loss совпадает в пределах ~1%.
- Gemma 4 26B-A4B на 2 GPU: 7.2k tok/s против 3.2-5.0k у NeMo AutoModel, Axolotl, Megatron Bridge, MS-SWIFT и Unsloth.
- Оптимизатор целиком в bf16 со стохастическим округлением: 120 GB состояния вместо 240 для 20B.

Все это првоерялось на реальных кластерах B300/B200/H200/H100 а топология заложена вплоть до NVL72: невалидные раскладки отбрасываются еще на этапе конфига. Запускается через torchrun, accelerate или halo CLI, в репо есть рецепты под SLURM, SkyPilot, RunPod и Nomad. Большая часть года ушла на то, чтобы все это не разваливалось на всех комбинациях моделей и параллелизмов - тестов в репозитории больше, чем кода. При этом работать будет также и на современных консьюмерских GPU.

Отдельная моя гордость - Async RL. vLLM или SGLang живут в отдельном контейнере, роллауты идут асинхронно через Ray, веса уезжают по NCCL (по EFA 53-80 GB/s, gpt-oss-120b обновляется за 3-4 секунды), а генерации во время синка не обрываются. Внутри routing replay, importance sampling с масками, обучение на токенах, которые насэмплил движок, и 11 встроенных сред - от code contests и SWE до тулов через MCP. По механикам это сопоставимо с verl и Miles, только на HF-моделях и без Megatron.

Для студентов и тех, кто только начинает, Halo, мне кажется, хорошая точка входа. Все запускается из одного docker-образа: halo launch sft config.yaml, а QLoRA Qwen3-4B занимает 7.9 GB и должна работать на 3090/4090. Документации больше 170 страниц, отдельно советую прочитать лекцию GPU Training Theory: база того как работают такие фреймворки, почему эксперты в MoE упираются в память, а не в compute, и почему в EP-шаге 88% времени - это all-to-all. Там же честно написано, что не помогает и что тихо ломает, например TF32 по умолчанию в NGC-образе, портящий RoPE после 2048 токенов.

Выложили и модель - GLM-4.7-Flash-Coder, 30B MoE под агентские скаффолды: SFT на 7.8k успешных траекторий GLM-5.1, на SWE-rebench-V2 pass@1 вырос с 33.2% до 41.7%, а модель сама научилась вызывать тулы параллельно. Она уже слегка устарела, но как гайд по агентскому SFT актуальна.

Код мы пишем с агентными скаффолдами и сильными моделями вроде Claude Fable и Opus, репозиторий под это спроектирован. Контрибьт приветствуется, но через фильтр: сначала issue и approve мейнтейнера, потом PR. Главное правило - понимать свой код: с AI писать можно, но это нужно раскрыть, а тесты должны падать, когда ломается поведение.

Дальше больше: Pipeline Parallelism (все уже в коде, но докатим после полных тестов) и серия блогов про тренировку, например про async RL для code contests. Лицензия Apache 2.0.

P.S. Если помните такую вещь как SMPO из времен Vikhr, то он теперь тоже живет там, но уже с EP и CP и улучшениями.
  • 🔥 4
Post #2047 262
  • 😁 11
  • 👏 1
Post #2045 266
Sir Arthur C. Clarke , BBC’s Horizon, 1964
Post #2040 326

Forwarded from Futuris (Anton)

🤯😱PrismML выкатила Ternary Bonsai 2 27B, модель уровня Qwen3.8 27B, ужатую с 54 до 5,9 ГБ. Большинство её весов сведено всего к трём значениям: −1, 0 и +1, благодаря чему 27-миллиардную модель теперь потенциально можно запустить локально на видеокарте с 8 ГБ памяти. По тестам разработчиков, она сохраняет 98,2% среднего качества оригинала🤯
В X её называют локальной моделью сильнее GPT-5.6 Luna, Claude Opus 4.6 и Gemini 3.1 Pro

КАЧАЮ
  • 🤔 1
Post #2036 349

Forwarded from Machinelearning

🐠Sakana AI представила PC-ALM - метод обучения глубоких нейросетей без классического обратного распространения ошибки.

Главный результат: PC-ALM смог обучать нейросети глубиной до 1000 слоёв, используя только локальные взаимодействия между соседними слоями.

Обычное глубокое обучение почти полностью опирается на backpropagation: ошибка считается на выходе сети, после чего градиенты передаются назад через все слои.

PC-ALM работает иначе.

Каждый слой рассматривается как локальная динамическая система, которая пытается уменьшить собственную ошибку предсказания. Вместо глобального прохода градиента используются:

- локальные ошибки предсказания
- множители Лагранжа
- расширенный лагранжиан
- локальная динамика состояний
- PI-регуляция внутри каждого слоя

Метод вырос из predictive coding — подхода, популярного в NeuroAI. В predictive coding каждый слой постепенно корректирует своё состояние так, чтобы уменьшать рассогласование с соседними слоями.

Проблема в том, что в очень глубоких сетях такие сигналы плохо распространяются: информация об ошибке с выхода сети затухает раньше, чем достигает внутренних слоёв.

PC-ALM добавляет специальные двойственные переменные — по сути дополнительные нейроны, представляющие множители Лагранжа. Они помогают передавать сигнал ошибки через большое число слоёв.

Авторы связывают этот подход с классической работой Яна Лекуна 1988 года, где множители Лагранжа для многослойной сети можно связать с градиентами функции потерь.

В результате получается обучение, где глобальная задача оптимизации раскладывается на множество локальных динамических процессов.

Особенно хорошо PC-ALM показал себя на очень глубоких и узких сетях, где обычный predictive coding начинает ломаться.

Помимо NeuroAI, подход может быть интересен для нейроморфного железа: там локальные вычисления и физическая динамика потенциально дешевле классического backpropagation на GPU.

Блог: https://pub.sakana.ai/pc-alm/

Статья: https://arxiv.org/abs/2605.31022

Код: https://github.com/SakanaAI/pc-alm
  • 🔥 5
Post #2033 490
Anthropic: китайские ИИ-лаборатории тайно гнали запросы своих пользователей в Claude
10 сентября Anthropic опубликовала отчёт «Detecting and countering misuse of AI: September 2026» — о злоупотреблениях Claude за период декабрь 2025 — август 2026. Один из семи разделов посвящён «нелегальной дистилляции», в ней обвиняют семь китайских лабораторий.
▪️ Moonshot (Kimi) «молча перенаправляла запросы клиентов в Claude вместо обработки через Kimi». За 10 дней — около 300 тысяч запросов через 5380 фиктивных аккаунтов (в основном Сингапур и Япония), преимущественно на Opus. Всего за май–июль компании приписывают более 23 млн обменов.
▪️ DeepSeek — свыше 12 млн попыток дистилляции за 14 дней июля. Перенаправление затрагивало тех, кто работал с моделями DeepSeek через Claude Code, Agent SDK и OpenCode.
▪️ Alibaba — крупнейшая кампания, которую Anthropic вообще фиксировала: 151 млн обменов за май–июль, пик почти 3 млн в сутки, более 3500 аккаунтов. Цель — обучение моделей Qwen.
Ответы Claude сохраняли и использовали как обучающий материал, вытягивая цепочки рассуждений. В перенаправленных сессиях, по данным Anthropic, оказывались имена, почты, внутренний код и рабочие учётные данные компаний.
Важно: это выводы внутреннего расследования Anthropic, независимо они не проверены. Moonshot отказалась комментировать, DeepSeek и Alibaba на запросы журналистов не ответили.
Источники: 🔗 CNBC 🔗 TechCrunch 🔗
CNBC Chinese AI labs secretly used millions of Claude exchanges to train their models, Anthropic says Anthropic said it detected unauthorized efforts by China-based AI labs including Alibaba and Moonshot AI to use its Claude models to help improve their own AI systems.
  • 😁 5
  • 😱 1
Post #2031 433
  • 😁 11
  • 👍 2
Older posts →

About this channel

How can I read @toshoseti without a Telegram account?
TGViewer shows the public web preview Telegram publishes for То шо нейросети: recent posts, photos, videos and the subscriber count, with no app, login or account.
How many subscribers does То шо нейросети have?
То шо нейросети (@toshoseti) has 1.41K subscribers on Telegram, refreshed roughly every 30 minutes.
Does То шо нейросети know I viewed it here?
No. Public channel previews carry no viewer identity, and TGViewer has no accounts or tracking of what you look up.
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →