TGViewer
Грустный Киберпанк Грустный Киберпанк @korolevsnotes · 6.41K subscribers
Post #3238 1.4K
В то время, как большие нейросети продолжают жечь мегаватты на фермах GPU, у нас появился небольшой, но довольно символичный артефакт из параллельной ветки будущего.

Команда Comexp Research Lab вытащила на свет TAPe+ML v2 — модель компьютерного зрения, у которой параметров меньше, чем у средней GPT‑подписи в Telegram, но которая по качеству не уступает и местами догрызает взрослых SOTA‑монстров.

Менее 100 тысяч параметров против сотен миллионов и миллиардов у привычных YOLO, ViT, DETR и прочих — и это не игрушечный датасет, а нормальные взрослые бенчмарки. На COCO она показывает 84% «нашла объект» и 62% «нашла и обвела достаточно точно» (mAP50 / mAP50–95), оставаясь на уровне тяжёлой RF‑DETR 2XL, но занимая в тысячу раз меньше места. На ImageNet‑1k — около 86.6% угадывания правильного класса, когда рядом стоят DINO‑образные модели с 1.1B, 200M и 7B параметров.

То есть взяли классический сценарий: там, где обычно нужен аккуратный дата‑центр и несколько ящиков с NVIDIA‑железом, сделали штуку, которую можно гонять на обычном CPU‑сервере, включая отечественные платформы на РЕД ОС. Такой маленький акт саботажа против идеи, что компьютерное зрение — это всегда «для корпораций».


Отдельная линия киберпанка — промышленный кейс. На конвейерной ленте, где руда идет по камере как есть, TAPe+ML v2 научили автоматически находить засорения. В реальных условиях, с неидеальными камерами и малым количеством исходных данных, модель дает 96% попаданий, 90% по «нашла объект» и 85% по «нашла и обвела нормально». Базовая YOLO на том же объеме данных просто не справилась, даже после расширения датасета тяжелая конфигурация проиграла по качеству при большем числе параметров и картинок.

Внутри — ноу-хау, TAPe‑слой и собственная архитектура восприятия: вместо того, чтобы копировать очередной ViT, ребята переформатировали само представление изображения и логику обучения. Одна и та же «голова» смотрит на детекцию, классификацию, сегментацию и авторазметку, без зоопарка backbone‑ов под каждую задачу.

Поверх этого они собрали ML‑стенд: можно просто дообучить верхний слой под свои классы, можно постепенно адаптировать все ядро под новый домен, можно стартовать с нуля. Прямо в браузере есть режим авторазметки: человек кликает по объектам, модель тут же подстраивается под его правки и через пару итераций сама начинает размечать большую часть кадра. Минуты человеческого внимания превращаются в обученный компактный «глаз» для конкретного участка реальности.

На уровне лозунга это звучит так: «компьютерное зрение перестает быть привилегией тех, у кого есть деньги на кластер», — как говорят в Comexp. На уровне практики — это история не только «для маленьких команд», а потенциально для всех, кто строит сервисы вокруг машинного восприятия — от промки и ритейла до городских камер и распределенных систем. Если архитектура TAPe+ML v2 закрепится, сама логика рынка меняется: доступ к качественному CV перестает быть функцией бюджета на железо и объем размеченных датасетов.

Может быть это тихая революция откуда не ждали: без громких заявлений про «конец эпохи больших моделей», но с очень простым вопросом к индустрии — зачем нам миллиарды параметров и мегаватты, если те же задачи начинают решаться сотней тысяч параметров на обычном CPU.

Грустный киберпанк тем и хорош, что будущее не всегда выглядит как сияющий дата‑центр; иногда оно помещается в сто тысяч параметров и пару строк конфига. В то время как мир спорит, сколько еще миллиардов параметров имеет смысл навешивать на следующую LLM, кто‑то в России аккуратно встраивает небольшой, экономный модуль восприятия в конвейер, камеры и браузер.

Подписывайтесь на «ГК» в Telegram|на SponsrMAX
  • 🔥 16
  • ❤ 6
More from @korolevsnotes
  1. Sep 23, 2026Ребятки, кто в конце девяностых просиживал ночи в «Героях меча и магии 3», помнит это ощущ…
  2. Sep 22, 2026Post #3328
  3. Sep 22, 2026Post #3327
  4. Sep 21, 2026Post #3326
  5. Sep 16, 2026Подытожим происходящее в ИИ-среде в последние дни, эксперты
  6. Sep 16, 2026Post #3324
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →