TGViewer
Synaptic Garden Synaptic Garden @synaptic_garden · 538 subscribers
Post #1350 164
Решил я поиграться с новой хайповой моделью Jev и возникла идея научить ее проходить нашу игру для Скейла. Эта модель интересна тем, что она понимает входные текстовые данные по смыслу как обычная LLM, но вот ответить связным текстом не может – вместо этого она ранжирует варианты ответов на вопросы, которые ей подаются на вход, выдавая степень уверенности для каждого ответа. Фишка в том, что делает она это в десятки раз быстрее и дешевле обычных языковых моделей. Фактически это очень умный и быстрый универсальный классификатор, который может решать задачи типа распознавания спама или мошеннических транзакций.

Как я приспособил модель для игры. Довольно просто - в качестве фактов модели подается текстовое описание текущего экрана игры: где стоит робот, где находятся платформы, стены и препятствия. Вариантами ответов являются действия, которые может выполнить робот - пойти в какую-либо сторону, прыгнуть, прыгнуть при беге, двойной прыжок и тд. Движок бота выбирает ответ модели с наибольшей степенью уверенности и подает соответствующие команды роботу, нажимая на кнопки. На видео в панели лога справа можно видеть, что, к примеру, когда робот находится ровно под тайлом выхода из уровня, модель отвечает почти со 100% уверенностью, что надо прыгать вверх, а в не таких однозначных позициях даже самый уверенный ответ может быть в районе 20-30%.

Чтобы научить модель проходить уровни, я проделал много экспериментов по подбору оптимального представления состояния игры. У модели довольно туго с арифметикой, поэтому описывать ей объекты с их координатами в лоб оказалось неэффективно. Вместо этого сцена описывается словами, а так же добавляется история ее предыдущих ходов, что помогает модели не застрять в цикле ошибок. Это похоже как если бы вам надо было пройти лабиринт с закрытыми глазами, а напарник описывал бы словами, что видно вокруг.
More from @synaptic_garden
  1. Sep 25, 2026Claude Code теперь при достижении 5-часового лимита будет определять разумный момент для о…
  2. Sep 25, 2026DeepSeek выпустили десктоп-версию своего харнесса. До этого была только веб-версия, требую…
  3. Sep 25, 2026Сама игра доступна по ссылке
  4. Sep 25, 2026video post
  5. Sep 25, 2026Что именно получает модель на каждом шаге: - Робот и опора. «standing_on: a floor 14 tiles…
  6. Sep 25, 2026OpenAI готовит к анонсу новый план ChatGPT Pro Max за $500 (+ налог $100). Предположительн…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →