⚡️ Robbyant выложили LingBot-Vision - self-supervised ViT-бэкбоны для плотного пространственного восприятия.
Идея не в обычном “понимании картинки”, а в том, чтобы модель лучше видела:
* границы объектов
* формы
* геометрию сцены
* переходы между регионами
* структуру пространства
Флагманская версия - ViT-g/16 на 1.1B параметров. Также есть distilled-варианты: Large, Base и Small.
https://github.com/robbyant/lingbot-vision
Post #3444
2.2K

- ❤ 3
- 👍 1
- 🔥 1