Бояться восстания машин от роботов в том виде, в котором они сегодня существуют, не стоит. Проблема не в том, что роботы не умеют стрелять или самостоятельно подзаряжать свои батареи. Проблема в их забывчивости.
Раскрою мысль. Сегодня на роль «мозгов» для разных робототехнических устройств стало модным брать так называемые VLA-модели (Vision‑Language‑Action), которые представляют собой архитектуру трансформер — да, ту самую, что в LLM. Это здорово работает, когда вся нужная информация для робота доступна прямо сейчас: объект виден, инструкция дана, и тот должен немедленно совершить действие.
Но в тот момент, когда нужная информация роботу больше не доступна (нужный предмет лежит в ящике, который сейчас закрыт, или цель объявили ранее), приходится полагаться память робота, которая в трансформерах живёт в контекстном окне: всё, что робот видел, слышал и чувствовал, должно быть упаковано туда. Трудность в том, что механизм внимания имеет квадратичную сложность по длине последовательности, а значит долгосрочная память для робота будет обходиться слишком дорого, если пытаться наивно увеличивать размер контекста.
Решить эту проблему могли бы новые архитектурные решения. Одно из них придумали и опубликовали мои коллеги из команды «Воплощенные агенты» AIRI. Подробнее о нём рассказывает свежая статья в институтском блоге на Хабре.
Post #895
522

- ❤ 8
- 👍 7
- 🤡 1
- 🍓 1