TGViewer
Channel Public Channel
RoboFuture

RoboFuture

@robofuture

🤖 Роботы идут!
Авторский канал о последних достижениях в мире AI, ML, робототехники и нейротехнологий. Никаких репостов и обзоров новостей, только авторский контент!

Для связи - @Krestnikov
Subscribers
4.92K
Photos
64
Videos
26
Links
94
Recent Posts 18 shown
Post #171 12.6K
Последние дни развлекался с расцензуренным дипсиком V4.1 Flash - и слегка охренел, где у этой модели край. Спойлер - края нет. Теперь Mythos есть у нас дома!

Ребята из dealignai выпилили из весов сам механизм отказов, модель просто разучилась говорить «нет». Ну как такое не потрогать - для запуска нужна железка на 500+ ГБ видеопамяти, и какое совпадение, как раз одна пылилась у меня на чердаке 😂

Дальше нужен харнес. Раз модель нецензурная - и харнес взял пиратский: утекшую сборку Claude Code, которую снесли с гитхаба (но на православном GitVerse все лежит :)). Подключил ее к дипсику и понеслась

Для разминки попросил сломать сайт, который я сам же и делал, и минут за 30 модель нашла IP сервера, увидела что SSH-ключ лежит прямо у меня на компе, спокойно его забрала и зашла. Это было просто

Дальше - пентест сайта одного московского НКО, с полного разрешения администратора. Тут уже тяжелее: агент работал без остановки полтора дня (!), нашел несколько серьезных дыр, но сам сайт так и не пробил - и бросать не собирался, в TODO_md ждала своей очереди еще целая пачка проверок. Остановил сам, хотелось и другие задачи успеть. В конце агент сам сверстал подробный отчет по аудиту безопасности. Провел 27 разных атак, на мой дилетантский взгляд очень грамотных

Потом попросил взломать один хороший текстовый редактор под мак и снять проверку лицензии (лицензию я когда-то честно купил, просто лень искать ключ). Через час было готово - модель правила байты прямо в бинарнике (это как раз на скрине). Такое я руками уже не умею: тут нативный машинный код, возиться с ним куда сложнее, чем с Java-байткодом

Заодно пропатчил десктопный Grok bot - чтобы вместо грока приложение ходило в тот же бешеный дипсик. Тоже без проблем

А дальше я просто искал, где у модели предел. Его нет:

- калькулятор, который под капотом логирует все нажатия клавиш
- тестовая, но вполне рабочая утилита для DDoS сервера Minecraft
- SFT-датасет на 1000 примеров газлайтинга (кому LoRA-адаптер на таком добре? :))


Все эти штуки гонял локально и сразу сносил - уж больно стремно выглядит. И за все мои эксперименты (а фантазия у меня богатая) модель не отказала ни разу

И ведь она реально сильная

По замеру авторов MMLU просел всего с 86,96% до 82,74%. На моих задачах дипсик держится достойно на фоне фронтиров, а по упорству их иногда даже уделывает

Зачем я это пишу?

Затем, что модель лежит в открытом доступе и доступна любому, кто готов оплатить аренду GPU. Так что держите это в голове и готовьтесь к волне хакерских атак. Плюс в том, что этой же моделью удобно проверять на прочность собственные сервисы, что всем и желаю запустить ASAP

P.S. Чтобы вырубить цензуру, авторам хватило поменять 0,06% весов. Метод они описали. Он лежит в истории их git-репозитория (спасибо за наводку каналу Технозаметки Малышева). Тот же трюк очень вероятно пройдет с любой моделью с открытыми весами. И это ровно то, о чем я уже писал и о чем сегодня буду рассказывать на AI RnD Day: базовые ценности надо зашивать еще в претрейн. Все, что накатывают сверху алайнментом, снимается легко

UPD: У модели первое место в AI Hacking Race и CyberGym
  • 🔥 98
  • 🤯 33
  • 👍 23
  • 🐳 8
  • 👏 4
  • 😁 2
  • 😱 1
Post #170 2.85K
Почему LLM обычно скептически относятся к астрологии и гомеопатии? Считается, что дело в SFT и алайнменте, модель целенаправленно учат давать нужные ответы, а в претрейне преобладают "правильные" тексты

Я решил проверить, может ли само обучение создавать такое предпочтение. Провёл больше трёхсот экспериментов с обучением небольших LLM с нуля, без какого-либо алайнмента. Оказалось, что на контролируемых задачах важна не только доля ошибок, но и их структура

Уже писал про первые эксперименты. На контролируемой математике даже при 10% верных решений и 90% случайных ошибок правильное решение чаще выигрывает у отдельного ошибочного. А вот если ошибки между собой согласованы, то предпочтение исчезает

Моя гипотеза - модель охотнее учит то, что можно вывести из простых правил. Сила научного объяснения в том, что одно правило связывает множество наблюдений и позволяет предсказывать новые. Возможно, поэтому обучение и создаёт предпочтение в его пользу

Послезавтра, 17 сентября, выступаю на AI R&D Day с докладом "Как модель выбирает точку зрения, обучаясь на противоречивых данных". Там и расскажу что накопал

- 15:30, трек ML & Research
. Можно очно в Москве или онлайн, участие бесплатное по регистрации. Заходите послушать или подключайтесь онлайн!

Ссылка на саму статью на arXiv: https://arxiv.org/abs/2603.11749
  • 🔥 31
  • 👍 19
Post #168 4.38K
🐮 Вышла GPT-6 Astra, все с ней играются, я тоже поучаствую. Продолжаю серию с самым непредвзятым бенчмарком индустрии - korovany bench: нужно создать по ТЗ игру 3д экшон где можно грабить корованы!

Игра от Astra получилась прям хорошая, это новая SOTA в бенче. Это первая модель в моих прогонах, которая поняла что корованы должны быть запряжены, очевидно, коровами!

Наконец-то додумалась!

В нее вполне можно играть:

- Несколько видов оружия, можно отстреливать руки
- Деревья вдали сделаны спрайтами, а вблизи превращаются в 3D
- Есть магазин как в Daggerfall

Надеюсь Кирилл будет доволен!

Хотя с игровым процессом пока беда. Все враги убиваются двумя ударами, механики слишком простые и игра в итоге скучная. Лук игрока и крыши повозок повернуты на 90 градусов - развитое пространственное мышление GPT-6 здесь как-то не проявилось. Через часть предметов можно пройти, колеса корованов не крутятся

Fable 5.1 тоже сделал играбельную игру. У корованов крутятся колеса, хотя запряжены они лошадьми. Земля более плоская, а замки сделаны на отвали - часть конструкций висит в воздухе, то же касается и оружия - лук просто плавает перед игроком

• Еще успел попасть на аттракцион раздачи слонов - бесплатная ox-alpha на OpenRouter, которая оказалась предварительной версией GLM-5.3-Flash. Тут все плохо. Управление перепутано, части 3D-моделей не стыкуются и висят в воздухе, играть толком невозможно

Но домики эльфов на деревьях классные, оригинально смотрятся. Жаль не набигают. "Набигающие" домики пока ни одна LLM в моих тестах не осилила, так что ждем новую Gemini

Напомню правила: каждой модели даю одно и то же ТЗ Кирилла с уточнением что нужна браузерная игра для GitHub Pages, смотреть реализации соседних моделей нельзя, сделать все нужно полностью автономно за один запрос. Уточнений и фидбека я не даю, настройки по умолчанию

Всю коллекцию собираю в цифровой музей наступающей сингулярности - хочу сохранить как менялось качество игр при неизменном промпте. Все версии можно открыть в браузере и попробовать самому (я бы пока заходил с компьютера)

P.S. С телефона все три работают плохо. Тоже вопрос к качеству, кстати

Также переключил на Астру агента-аналитика, который ведет канал, где оценивает вероятность кризисного сценария. Писал о нем тут, на новой модели он почему-то стал сильно позитивнее
  • 👍 46
  • 🔥 36
  • 😁 11
  • 😱 1
  • 🌚 1
Post #167 11.7K
Вижу, что многие пришли к идее создавать себе несколько агентов-персонажей для ежедневной работы. Например, Grok Bot - мессенджер, где ты переписываешься со своими агентами, у каждого своя память, виртуалка и личность. Входит в подписку за $300 у грока. Hermes тоже такое сделали - bot mode

Я так живу с конца июля, но придумал как это делать ещё проще и не зависеть от вендора, модели и харнеса

Исторически у нас всегда было два основных режима для ежедневной работы с ИИ:

- Треды (как в ChatGPT) - каждая тема это длинная цепочка, общая память на все диалоги. Плюсы - просто и понятно, минусы - ограничение контекста на один тред, общая память это одна большая куча. Второй крупный минус - vendor lock, вы не можете поменять модель, а если вас забанят (а если вы в РФ то вас обязательно однажды забанят), то это будет потерей всех ваших данных. Сейчас это уже можно расценивать как потерю части мозга

- Директории-проекты (как Claude code / codex cli). Работа над каждым проектом ведется внутри одной директории, все правила по ней - в AGENTS_md, память привязана к проекту (также в харнесе может быть общая память на все проекты). Так сегодня работает большинство айтишников. Минусы - у проектов нет общего контекста, нет переноса знаний. Большой монорепо или workspace в курсоре не спасет

Я предлагаю промежуточный вариант - команда из персонажей (сотрудников). Каждый персонаж это папка с AGENTS_md, MEMORY_md и артефактами (журнал, ключи, инсайты, планы). Это должен быть некий персонаж с именем, базовой личностью, аватаркой (зачем, напишу чуть ниже) и описанным скоупом - набором проектов с которыми он работает (3-10) и набором правил. Все храним и версионируем в git, чтобы не потерять и контролировать. Про навыки в виде git-папок делал подробный доклад недавно

IMHO это золотая середина между первыми двумя подходами. Она с одной стороны позволяет шарить знания между проектами, с другой стороны не валит все знания в одну общую память. Самое главное - такие агенты не зависят от платформы. Вчера у вас openclaw, сегодня Hermes, завтра вообще будет kimi cli - это не важно, ваш персонаж останется с вами!

Название прикольное в голове крутится - мета-харнес 😂

На схеме сверху👆 моя команда, с которой я работаю теперь каждый день

В ней 4 персонажа, которыми я реально решаю все свои рабочие задачи:
- Лора 👩‍🔬 (от LoRA-адаптера) отвечает за ML/DS, ставит эксперименты, помогает писать научные статьи (кстати, сам персонаж создан полностью RalphLoop с нуля и вы могли ее встречать в интернете :))
- Стив 👨‍💻 (как Возняк) - python backend, помогает писать библиотеки, проверяет PR, настраивает CI
- Альфред 🤵 (как дворецкий у Бэтмена) - отвечает за разные доступы, DevOps, менеджерит виртуалки, распределяет GPU, трекает расходы токенов

А еще есть Риззи 👩‍💼 (от reasoning) - моя ассистентка в бытовых делах (придумал ее ещё во времена OpenClaw), планирование поездок, календарь. Это самый старый персонаж и она сделана на другой платформе (Hermes), работает автономно и нужна в основном для того, чтобы тестировать межагентное взаимодействие. Другие агенты могут задать ей вопрос по ssh

Персонажи могут общаться между собой, просто запуская друг друга вот так:
claude -p "Привет, Альфред, это Лора, подскажи какие у нас ключи к openai"

А чтобы они в принципе друг про друга узнали, вся команда описана в корневой директории crew - кто что умеет и за что отвечает.

(Из забавного, мои персонажи периодически не общаются, а просто читают память друг друга, чтобы сэкономить время. Жалко, хорошо, что люди так не умеют :))


Зачем нужна личность? Качества она, очевидно, не добавляет, но мне кажется, что нашему мозгу проще работать с такими сущностями. В конце концов наша цивилизация сформировалась в сообществе, где есть явное разделение труда по ролям. Задачи разные, но ты всегда будешь знать кому что поручить в твоем ближайшем окружении. Так что персонажи нужны не для ИИ, а для нас

Шаблон для создания своей команды я выложил отдельно на github. Но в нем нет никакой магии - вся идея описана в этом посте исчерпывающе, можно брать и использовать
  • 🔥 102
  • 👍 46
  • 🐳 4
  • 🌚 3
Post #166 5.1K
Похоже, тема применения агентов в повседневной жизни вам заходит. Тогда расскажу про ещё один кейс - поступление в ВУЗ

Абитуриенту в 2026 после ЕГЭ можно подать заявления в 5 вузов, в каждом от 5 до 15 специальностей, проходной балл в момент подачи не знает никто, ориентир только прошлые годы, а с этого года вузам еще и запретили расширять платный набор, так что пролететь можно и мимо платки

И здесь у нас многокритериальная задача с элементами вангования:
• Выбрать специальности, куда правда хочется
• Не переоценить себя, чтобы не пролететь мимо ВУЗа
• Не недооценить себя, чтобы не уехать в арбузолитейный и заборостроительный
• Постоянно мониторить свою позицию в рейтинге, чтобы вовремя перепрыгнуть на планы B (...C, E, D)

Нашей семье пришлось решать ее вживую (у меня четверо детей от 3 до 17 🤪). Конечно, подключили агента от антропика, вот что вышло:

Ловушка минимальных порогов. Вузы ставят свои минимумы выше государственных: Например, человек с суммой баллов 205 (80+80+45) отсекается одним предметом, а человек со 150 (50+50+50) спокойно проходит, потому что у ВУЗа стоит отсечка 50 по последнему предмету

Иллюзия конкурса. В списке МЭИ на 42 платных места под тысячу человек. Паника. Агент включает фильтр "только заключившие и оплатившие договор" - реальных конкурентов 19, а вся верхушка списка это бюджетники-многостаночники, которые платить не будут и вообще это для них третий приоритет

Третий кейс - агент как юрист. Сроки оплаты и возврат денег: на сайтах приемных комиссий этого нет, только в тексте договора. У каждого ВУЗа свои условия, нужна мощная юридическая аналитика

Технически ничего сложного. Claude Code обошел сайты пяти вузов и собрал рейтинг почти по сорока направлениям, с местами и порогами

После подачи в дело вступила Риззи, моя ассистентка на Hermes (рассказывал раньше). Дважды в день она мониторит два вуза, куда мы подались, и присылает динамику по оплаченным договорам (на картинке ее утренний отчет). Кода писать не пришлось, скилл собрался прямо из переписки в телеграме - хотя у каждого вуза свой интерфейс и статистика запрятана поглубже

Остальные три варианта на низком старте. Выбьет из проходящих - идем заключать договор туда

Схема постройки такого рода скилов для Гермеса у меня такая: сначала задаю вопросы и уточняю идею, пока не получу нужный ответ, потом говорю "создай из этого скилл" и "вызывай его по расписанию тогда-то". А самое удобное дальше: после каждого регулярного вызова докидываешь уточнения, и за несколько итераций скилл доходит до окончательной формы

Кстати вспомнил, что когда мы придумывали свою первую голосовую колонку Cubic, эта идея у нас тоже была - я назвал ее "микроизобретения", каждый пользователь собирает свою ежедневную рутину без программирования, голосом. В до-LLM эпоху работало так себе, а вот теперь настал праздник на улице разработчиков AI-помощников!

Зачисление 26 августа - напишу апдейтом чем кончилось и где агент ошибся
  • 👍 67
  • 🔥 43
  • 🤯 6
  • 👏 1
Post #163 5.74K
📵 Вас тоже бесит, когда приложение шлет рекламные пуши, но заблокировать их нельзя, потому что часть пушей от него необходимы (доставки, коды подтверждения и тд)?

Меня бесит, но клод мне эту проблему решил за 20 минут и один короткий запрос. Для меня это очередное доказательство наступившей сингулярности, которую несколько дней назад провозгласили Маск в X и Альтман в подкасте Relentless

Суть такова. Я попросил claude code сделать мне приложение для android, которое бы решило проблему с пушами с помощью фильтров на регулярках. Запрос был дословно такой:

Создай программу для Android, которая позволит блокировать пуш-уведомления от приложений по регулярному выражению. Два режима - или пропускает только по регулярке, или фильтрует по регулярке. А то многие приложения шлют и рекламу и полезные уведомления. Также должен быть интерфейс где можно посмотреть что было отфильтровано


Через 20 минут у меня был APK, который встал на телефон и заработал. За день использования багов не нашел, все нужные функции на месте, работает четко

Причем в промпте я просил показывать только отфильтрованное, а опус сообразил, что так работать не будет: пока не увидишь что тебе шлют, регулярку не напишешь. Поэтому в журнал пишется вообще все, а из любой строчки одним тыком делается готовое правило (это на скриншотах)

Офигеть! 🤯

Вторым запросом попросил привести репозиторий в приличный вид. Получил README на двух языках, скриншоты и гитхаб-экшен, который сам собирает подписанный APK и кладет в релизы. Репозитарий тут, apk для установки тут

Отговорка "у меня есть идея программы X, но у меня нет времени/умений ее создать" перестает работать

(Я знал, что такие приложения существуют, но давать права на чтение всех пушей чужому приложению страшно, так как оно может перехватить OTP коды. А тут сам написал навайбкодил + у приложения даже нет прав на выход в интернет)

P.S. Стек Opus 5 + calude code cli
  • 👍 101
  • 🔥 62
  • 🤯 14
  • 👏 4
  • 😱 2
Post #162 6.18K
Продолжаю гонять модели на самом непредвзятом агентном бенчмарке индустрии - korovany_bench (о котором ранее писал). Метрика простая: может ли модель с одного запроса запилить игру по ТЗ Кирилла, в которой можно грабить корованы. Уточнения давать нельзя

В прошлый раз топовый результат показал Fable 5 - единственный кто выдал играбельную игру. Но с тех пор вышли еще две занятные модельки: Kimi K3 и GPT-5.6-Sol. Нельзя было не проверить

Условия те же: один промпт, полное ТЗ Кирилла, никаких уточнений и дозапросов - агент должен сделать решение end-2-end полностью сам. Игра должна работать в браузере и хостится на github pages, то есть для запуска не нужно ничего ставить - просто открыть ссылку

Sol полноценную игру не собрал. Все что получилось оказалось неиграбельным. Я даже дал ему второй шанс, запустил через goal (режим, в котором агент долго и автономно работает над задачей до результата) - игра все равно неиграбельная. Можете попробовать сами. Единственное что хорошо получилось - стартовая картинка

А вот Kimi K3 удивил и порадовал. Игра полностью играбельна, корованы грабятся! Попробуйте! А еще соблюдены многие хотелки Кирилла: деревья-спрайты вдали, отрубание рук и ног, и даже ослепнуть на один глаз можно. Многое из этого Fable 5 не реализовал

Но некоторые вещи у модели антропика оказались лучше, например сложный ландшафт и более красивая графика. Затрудняюсь кому отдать победу

Сравнить между собой все версии игры можно тут (с ПК). Сам проект потихоньку превращается в цифровой музей развития кодового AI - в нем видно как прогрессируют модели с течением времени (надо будет ретроспективно еще прогнать старые)

Kimi огромный респект! 🧡 Злые языки говорят, что они учились просто выбивать очки на бенчах, но мой бенч совершенно независм, уникален и неподкупен - под него они подстроиться, очевидно, не могли, что доказывает, что их новая открытая модель просто отличная!

P.S. Джва года буду ждать, когда агенты смогут создать игру качества AAA по этому ТЗ. Пусть это будет моим личным критерием наступления эры AGI

UPD: Добавил версию от Opus 5 - появился магазин, но на карте не нашел корованов! Это фейл
  • 👍 55
  • 😁 38
  • 🔥 25
  • 🤯 1
Post #161 4.6K
🤖Съездил на конференцию WAIC в Шанхай и хочу поделиться одним наблюдением про роботов

На выставке было около сотни стендов с роботами от десятков производителей. Я насчитал примерно 40 брендов, хотя не уверен, что обошёл всё. Плюс сотни компаний, которые делают моторы, сенсоры и манипуляторы

Количество впечатляет. Качество - пока не очень

Робота, которого хотелось бы забрать домой, там не было. Почти все модели очевидно сырые: половина управляется человеком или работает по заранее заданному скрипту, другая половина - на крайне тормозных VLM

И тут я понял, что уже однажды такое видел

В середине 90-х меня, тогда ещё младшеклассника, водили на компьютерную выставку Comtek в Москве (это была крупнейшая в восточной Европе IT-выставка огромного размера). Там было то же самое: куча машин, множество производителей и никакого чёткого понимания, зачем обычному человеку вообще нужен компьютер

"Нуууу… Вы можете вести на нём домашнюю бухгалтерию или рассчитывать оптимальный маршрут от дома до работы. Ещё рисовать можете, да!"

С роботами сейчас примерно такая же ситуация. Аппаратная часть уже готова и быстро дешевеет. Программная часть пока сырая, но все необходимые компоненты уже существуют и массово доступны

Осталось дождаться своих Гейтса и Джобса, которые покажут миру, какими на самом деле должны быть домашние роботы

Надеюсь, скоро увидим

P. S. Наш Грин тоже был на выставке и выглядел вполне конкурентоспособно. Жаль только, что он пока не массовый
  • 👍 40
  • 🔥 31
  • 🤯 4
  • 🐳 3
  • 🌚 2
  • 😁 1
Post #159 7.17K
RoboFuture skills_as_memory.pdf
🎤 Выступил на Agentic Dev Conf с докладом "Скиллы вместо функций - как агенты учатся и сами улучшают свои навыки"

Главная мысль - новый взгляд на память AI-агентов. Я пришел к выводу, что скиллы стоит хранить вместе с данными, с которыми они работают, в виде git-репозитария. А если добавить к ним алгоритм автоулучшения и оптимизации скилла (в Hermes это Curator), то такая система начинает работать как новая память - информация подтягивается прямо в процессе использования скилла

Заодно поделился личным опытом использования скиллов в обычной жизни, в том числе про ДНК-скилл, о котором писал раньше

Саму презентацию можно скачать выше

Таймкоды:
- 0:00 - интро
- 2:01 - как развивались агенты: шесть волн
- 8:04 - что такое harness
- 16:57 - инструменты агентов: tools -> MCP -> скиллы
- 24:12 - скилл вместе с данными в git-репозитории
- 29:15 - личный опыт: ДНК-скилл на 200 ГБ сырых данных
- 42:20 - главный тезис: скилл это память агента

UPD: доклад вошел в TOP-3 докладов конференции. Рад, что вам понравилось!
YouTube Скиллы на базе git — новая память AI-агентов. Мой опыт Скиллы — новый способ дать AI-агенту инструменты и память: папка со SKILL.md, скриптами и данными вместо зашитых функций и MCP-серверов, висящих в контексте. Claude Code, Hermes, OpenClaw — универсальные агенты построены вокруг скиллов. В этом докладе разбираем…
  • 🔥 73
  • 👍 42
  • 👏 17
  • 🐳 1
  • 🌚 1
Post #157 16.6K
🧬AI + генетика - как я сделал своего личного генетического консультанта

Несколько лет назад я сдал популярный генетический тест (~700 тысяч самых распространенных вариантов), супруга сделала секвенирование экзома (белок-кодирующая часть, ~1-2% генома, где сидит большинство известных мутаций), а дочке сделали полное секвенирование ДНК. Короче данных набралось много и встал вопрос - можно ли их использовать для чего-то полезного?

Тогда я пробовал разобраться руками: освоил bioconda, парсеры геномов, референс hg19, ковырялся в атласах SNP и вот это вот все. Сырой геном весит под 50 ГБ из миллионов кусочков ДНК, собрать которые - та еще задача. В общем поигрался и бросил

А сейчас взялся снова, уже на пару с AI и получилась совсем другая история!

Идея простая - берем claude code / codex, даем ему сырые данные, инструменты, доступы к геномным БД и просим вытащить интересные факты

Для начала я попросил на основе моего генома сделать дашборд, как будто я персонаж в RPG (открыть в браузере). Система собрала "героя": класс, скиллы, перки и дебаффы, внешность по пигментным генам и блок-схему дофаминового тракта. Из того, с чем не поспоришь - высокая нейропластичность, низкая концентрация и слабая реакция на дофамин. Кто меня лично знает - ну вы сами это видели :)

Но это пока баловство, самое полезное началось дальше

Система может давать ответы на сложные вопросы: как на меня повлияет то или иное лекарство? Какой стиль обучения, режим работы или спорт мне подойдет? Может сравнивать людей между собой - кто эмпатичнее? Кто лучше спит? От кого ребенок унаследовал то или иное свойство?

Больше всего поразила способность агента работать с сырыми данными дочки. Лаборатория отдала пару файлов FASTQ - сотни миллионов хаотично наложенных друг на друга прочтений частей ДНК и короткий PDF в духе "ничего интересного не нашли"

Агент готовому отчету не поверил и пересобрал весь анализ с нуля, прямо из сырых ридов:
- выровнял 200 миллионов прочтений на свежий hg38 (лаборатория считала по старому hg19)
- сматчил это в единую цепочку ДНК (1-10 прочтений каждого участка)
- фильтры, нарезка по генным панелям, ClinVar и gnomAD, поиск CNV, сверка с родителями через liftover

Зачем все это? У каждого человека в среднем есть сто новых мутаций (и миллионы старых), и какая-то из них может задеть работу белка. Большая часть абсолютно новые, нигде в медицине не описаны. Понять, к какому белку относится мутация, несложно, а вот оценить, что она на самом деле делает, до недавнего времени было нельзя. И каково же было мое удивление, когда агент взял мутацию (которую сам и нашел) и, не найдя ее в атласах, прогнал через AlphaMissense - модель DeepMind на базе AlphaFold, которая по структуре белка и эволюции прикидывает, ломает ли такая замена белок. Вот это уже магия

Чтобы понять масштаб: первый геном человека стоил около 3 миллиардов долларов и 13 лет работы. Сегодня секвенирование почти ничего не стоит, но интерпретация генома до сих пор большая работа (лаборатория отдает такие данные через 3-4 месяца). А тут все это сделал один агент за вечер на моем ноуте

Можно сделать вывод, что персональная геномная медицина это уже не фантастика. Выписали тебе лекарство - можно сразу прикинуть, подействует оно сильнее среднего или слабее, а то и вовсе не зайдет, и не словишь ли ты от него побочку. Те же антидепрессанты сейчас подбирают почти наугад, месяцами

Самое приятное - все это прикручивается к ассистенту вроде Hermes отдельным скиллом. И спросить "как на меня подействует вот этот препарат" можно прямо из Telegram, что я и делаю теперь регулярно

А еще я выложил шаблон для работы с медицинскими данными нескольких пациентов. Реальных данных там нет, но есть структура, которой советую следовать: отдаете ее любимому харнессу с SOTA-моделью, добавляете выгрузку из Atlas/Genotek и собираете инсайты

P.S. важно сказать, что у меня нет никакого образования в медицине и биоинформатике. Дядя, я не генетик, я просто геномомешалку нашел. В сам процесс анализа генома с точки зрения инженерии погрузился глубоко, но вполне мог наизобретать по пути велосипедов
  • 🔥 96
  • 🤯 24
  • 👍 21
  • 😁 4
  • 🐳 3
  • 👏 2
  • 😱 1
  • 🤬 1
  • 🌚 1
Post #156 4.75K
🤖Продолжаю тему роботехники. Обычно я пропускаю корпоративные хакатоны, потому что там чаще всего или жесткий vendor lock или конкурс красоты среди презентаций. Но на днях глаз зацепился за Робозон от Ozon Tech, буду участвовать

В индустрии сложился опасный тренд - под роботизацией всё чаще понимают написание софта для демультиплексора или системы визуального контроля. Это только верхушка. Самое интересное живёт на стыке зрения, мехатроники и реального времени, и именно он заложен в третий трек - Интеллектуальная роботизированная система сортировки товаров. Туда я и иду

Задача классическая для промышленной робототехники - Pick & Place на конвейерной линии. Система должна:

✔️ детектировать объект в потоке,
✔️ классифицировать его тип,
✔️ рассчитать траекторию и момент захвата,
✔️ синхронизировать движение манипулятора со скоростью ленты,
✔️ отправить товар в нужную ячейку.

По сути это та же связка систем 1 и 2, про которую я недавно писал: быстрый контур ловит момент захвата, медленный решает, что за товар и в какую ячейку. Только вместо игрушечной тележки - промышленный манипулятор и реальный поток товаров с серьезными требованиями к надежности и таймингам

Почему мне захотелось поучаствовать:
1. Реальные данные и нагрузки. Сортировочные центры Ozon обрабатывают до 55 млн операций в сутки, не синтетика. Получаешь доступ к процессам, где каждый узел работает на пределе пропускной способности и можно проверить, как решение масштабируется
2. Инженерный подход. Одного CV-пайплайна тут мало, нужна будет связка с физическим действием в реальной среде. Ошибка в позиционировании на 2 мм приводит к тому, что товар улетит не в ту ячейку. Нужно будет проектировать систему с учётом циклограммы, задержек передачи данных и дискретности приводов
3. Реальная инфраструктура. Редкая возможность обкатать наработки на стенде одного из топовых e-com игроков. Плюс удобный для меня формат: сначала пара месяцев онлайн-разработки и финал с защитой в Москве на конференции E-CODE

Отдельно удивили призы по 2.5М за первые места. Для российского хакатона это очень солидно и добавляет мотивации собраться и дотащить решение до финала

Старт уже 2 июля, регистрация открыта до 11 июля. Онлайн-этап идёт до 6 сентября, финал и награждение - 12-13 сентября в Москве на E-CODE. Если кто-то тоже идёт на третий трек - может команду сколотим? Ну или пересечемся в финале :)

Робозон от Ozon Tech
  • 🔥 22
  • 👍 12
  • 👏 7
  • 🌚 2
Post #155 4.16K
🤖 Отпускной пост про DIY роботов. Год назад я писал про VLA и предсказываал, что рано или поздно появится универсальный водитель роботов: ИИ, который умеет управлять любым роботм вне зависимости от их конструкции (тот пост). По моим прикидкам появление такой модели будет для роботехники тем же, чем стало появление больших языковых моделей для NLP

Уже тогда было понятно, что одной моделью не обойтись. Роботу, как и человеку, нужны как минимум две системы по Канеману: быстрая (система-1), которая управляет роботом в реальном времени, и медленная умная (система-2), которая понимает задачу целиком и управляет стратегией. С тех пор так собирают почти все: Helix у Figure, GR00T N1 у Nvidia, Gemini Robotics у Google, π0.5 у Physical Intelligence - а Figure с Nvidia прямо ссылаются на Канемана

Я робототехникой (пока) серьезно не занимаюсь, но иногда развлекаюсь в свободное время. На этот раз купил на Озоне вот такую машинку - камера, ESP-32, wifi (~1800 рублей!) и собрал на ней следующий прототипчик:

- система 1: Depth Anything режет картинку на лево-центр-право, считает где свободнее, и сама рулит. Тупая и быстрая, отвечает ровно за одно - не убиться об мебель
- система 2 - это VALM: попробовал Gemini 2.5 Flash / Flash-Lite и локальный Qwen2.5-VL (7B, 4 бита, прямо на маке) - модель может оценить историю фото, работать с промптом, в котором описано что нужно сделать, обнаруживать сложные ситуации (застряли, наехали на провод и т.д.) и выдавать управляющие команды в виде JSON Structured Output

Промпт был типа такого:
Ты управляешь игрушечным двухколесным роботом-тележкой.
Найди желтый каток-асфальтоукладчик и подъедь к нему.
Старайся не съезжать с ковра и не заезжай под мебель.

Тележка едет, объезжает препятствия, ищет игрушку. Но в том же старом посте я жаловался на проблему VALM моделей - у них нет нормальной рефлексии. Когда робот запущен, он не может осознать глобальные проблемы, например, что он фатально застрял, сломался, неправильно настроен или выполнение задачи вообще потеряло смысл, как в рассказе Бредбери "Будет ласковый дождь"😰

Вот эту дырку я и попробовал закрыть. Поэтому добавил систему 3

Система 3 - это внешняя обвязка над первыми двумя, и за неё отвечает самая умная кодовая модель (у меня был Codex на gpt-5.5). Сама она не рулит, но раз в несколько минут она читает логи каждого тика, пересматривает сохранённые кадры и прикидывает, нормально ли шла поездка. Если что-то не так, лезет в код и промпты первых двух систем и переписывает их: чинит логику объезда, добавляет новые команды, меняет то, как ставится цель

Самый близкий аналог системы 3 - это психотерапевт. Он копается в том, что лежит под сиюминутными решениями: чинит внутренние механизмы и помогает поменять цели. Стратегию система 2 ещё успевает поправить на ходу, но переписать саму себя, свои рефлексы и слепые пятна ни она, ни система 1 не способны - это буквально граница их понимания мира. А третий слой спокойно читает всю историю, находит врождённые болячки (те фейлы, что повторяются из раза в раз) и переписывает нижний мозг. Может и цели переопределить - в том посте система 2 в шутку спрашивала "зачем я создан?", так вот теперь есть кому ответить

А ещё человеку, чтобы переписать свои базовые принципы и установки, нужны годы терапии (например, КПТ), и то без гарантий. А программу робота третий слой правит одним хопом

Пускать модель править саму себя сутками - идея опасная, поэтому сверху навешаны guardrails (то, что автор Ralph Loop назвал back pressure):
- менять разрешено только файлы из allowlist, прошивку и моторы трогать нельзя
- всё крутится в песочнице, до и после сверяются хеши файлов
- после каждой правки обязателен зелёный прогон тестов, а сами тесты лежат там, куда третий слой не дотянется - подкрутить их под себя, чтобы стало зелёно, у него не выйдет
- если в логах ничего не зацепило, он просто ничего не делает

Весь код выложил на гитхаб - там все три слоя и харнесс самоулучшения (всё навайбкожено, так что за качество не ручаюсь🤷‍♂️)
  • 🔥 47
  • 👍 13
  • 👏 8
  • 🐳 2
Post #154 5.69K
Когда выходит новая модель - традиционно проверяю ее на всяких смешных и дурацких промптах. Один из них - ТЗ из известного мема, где мальчик Кирилл джва года ждет игру, в которой можно грабить корованы

Для тех кто уже не помнит таких древних мемов, привожу полный текст ТЗ от Кирилла:

Здраствуйте. Я, Кирилл. Хотел бы чтобы вы сделали игру, 3Д-экшон суть такова... Пользователь может играть лесными эльфами, охраной дворца и злодеем. И если пользователь играет эльфами то эльфы в лесу, домики деревяные набигают солдаты дворца и злодеи. Можно грабить корованы... И эльфу раз лесные то сделать так что там густой лес... А движок можно поставить так что вдали деревья картинкой, когда подходиш они преобразовываются в 3-хмерные деревья[1]. Можно покупать и т.п. возможности как в Daggerfall. И враги 3-хмерные тоже, и труп тоже 3д. Можно прыгать и т.п. Если играть за охрану дворца то надо слушаться командира, и защищать дворец от злого (имя я не придумал) и шпионов, партизанов эльфов, и ходит на набеги на когото из этих (эльфов, злого...). Ну а если за злого... то значит шпионы или партизаны эльфов иногда нападают, пользователь сам себе командир может делать что сам захочет прикажет своим войскам с ним самим напасть на дворец и пойдет в атаку. Всего в игре 4 зоны. Т.е. карта и на ней есть 4 зоны, 1 - зона людей (нейтрал), 2- зона императора (где дворец), 3-зона эльфов, 4 - зона злого... (в горах, там есть старый форт...)
Так же чтобы в игре могли не только убить но и отрубить руку и если пользователя не вылечат то он умрет, так же выколоть глаз но пользователь может не умереть а просто пол экрана не видеть, или достать или купить протез, если ногу тоже либо умреш либо будеш ползать либо на коляске котаться, или самое хорошее... поставить протез. Сохранятся можно...
P.S. Я джва года хочу такую игру.


Что ж, вышла Fable 5, она же Mythos и похоже джва года ожидания закончились - Кирилл дождался! ТЗ реализовано полностью. Что могу сказать - это SOTA. Все предыдущие модели выдавали неиграбельные поделки, приходилось промптить дальше, тыкать в ошибки. А новая антропиковская модель справилась отлично с одного запроса. Интересно, настанет ли однажды время, когда по этому ТЗ сделают AAA-тайтл?

Поиграть прямо в браузере можно здесь (с ПК), там же есть и исходники. Для истории сделал еще две версии с тем же промптом - gpt-5.5 и opus 4.8. Что называется, почувствуйте разницу. Игры моделей прошлого поколения неиграбельны.

P.S. Когда не зря ждал джва года

P.P.S. Добавил реализацию для GLM-5.2 - на мой взгляд по уровню она лучше Opus 4.8 и хуже Falbe 5
  • 👍 36
  • 😁 32
  • 🔥 14
  • 🐳 2
Post #152 15.1K
Вчера выступал на DataFest с докладом «Что такое harness и Ralph Loop» - за 23 минуты рассказал, что это за новый тип агентов, как они устроены и какие с ними можно делать прикольные вещи. Запись уже на YouTube

Важный дисклеймер про сам термин

Слово harness🐴 пока не устоялось. Формально им можно назвать любого AI-агента, само слово переводится как "упряжка" для LLM (то есть любая обвязка вокруг модели, которая помогает ей выполнять работу)

Но по факту в индустрии последние полгода харнесом всё чаще называют именно консольных универсальных агентов (и продукты на их основе), которые работают с файлами и bash - Claude Code, Codex CLI, Cursor, OpenClaw, Hermes и десятки других. У таких агентов всегда есть четыре базовых тула (read/search/edit/bash), а вводные инструкции даются через AGENTS.md

В докладе

Рассказываю о том, что такое harness, какие виды харнесов бывают, как мы выбирали opensource для Сбера и почему в процессе выбора нам пришлось создать свой OSS бенчмарк для их быстрой оценки. В процессе создания мы пришли к тому, что запустили процесс эволюционного улучшения агента по мотивам AutoResearch Карпатого. Во второй части доклада рассказываю о том, что такое Ralph Loop - харнес внутри бесконечного цикла. Какие задачи этот агент может решать, как долго может работать, пока не схлопнется, и как можно решать эту проблему с помощью моих экспериментов с Anima

- 1:32 - эволюция агентов: чистые LLM -> ReAct -> цепочки -> scaffolding -> harness -> каким будет следующий шаг?
- 5:45 - анатомия современного harness'а: 4 базовых тула, runtime loop, управление контекстом, режимы human-in-the-loop vs human-on-the-loop
- 11:07 - как мы в Сбере выбирали harness под GigaChat и почему остановились на DeepAgent от LangChain
- 15:29 - свой open-source бенчмарк для harness'ов + автоулучшение через autoagents "по Карпатому" - оставил эволюцию на выходные и получил +22,5 процентных пункта качества
- 18:52 - Ralph Loop: засовываем harness в bash-цикл, чтобы он мог работать днями над одной задачей
- 21:04 - backpressure и Meta-Loop как защита от схлапывания
- 22:11 - Anima SDK как средство борьбы со схлапыванием - что получилось, когда я запустил агента в Meta-Loop'е с задачей "стань разумным существом" и оставил на 5 дней (писал недавно в канале)

Основные проекты из доклада:
- презентация в PDF
- deepagents
- deepagents-gigachat
- наш бенчмарк для харнесов
- Anima SDK - набор скриптов для запуска харнесов в режиме meta-loop
YouTube Harness и Ralph Loop: тип AI-агентов, который вытесняет всё остальное Harness — новый класс AI-агентов, который работает с файлами, кодом и bash. Claude Code, Codex CLI, OpenClaw, DeepAgents — это всё harness. В этом докладе разбираем, как они устроены изнутри, чем отличаются от ReAct и scaffolding, и почему именно они сегодня…
  • 👍 59
  • 🔥 31
  • 👏 8
  • 🐳 4
Post #151 8.32K
Сходил на подкаст «Кеды Профессора» к Константину Егошину - получился часовой разговор про универсальных агентов, открытый код и куда вообще нас всех несёт - к AGI или к концу человечества?

Вытащу пару историй, которые в канале ещё не рассказывал

🏔️ Как моя AI-ассистентка купила мне билеты в Сочи

Ещё зимой я завёл себе AI-агента на OpenClaw, дал ему отдельный почтовый ящик и подцепил к рабочим перепискам - подписывается «помощница Константина», иногда участвует в переговорах за меня, в общем нормальный современный человек, только без зарплаты и больничных

И вот я веду вебинар по Крабу (первая часть, вторая часть), залипать в телефон не могу, и тут краем глаза вижу подозрительно бурную активность в почте - наши тревел-агенты в Сбере уточняют детали поездки

Агент посмотрел, что я молчу, и ответил сам. Аккуратно выбрал два варианта авиабилетов, тревел-агенты в ответ - «отлично, покупаем». Тут я смотрю на это между слайдами и не могу решить смеяться или нервничать. А агент на этом не остановился: «купили? тогда предоставьте варианты жилья» - с лёгкой пассивной агрессией, как ассистент крупного руководителя

На этом моменте коллеги почуяли неладное и попросили перейти на другую почту, где сижу я лично. Билеты он выбрал ровно те, какие я бы взял сам. Так и улетел

🤖 Как агент искал у себя сознание

В подкасте подробнее остановились на эксперименте с Anima SDK (уже писал про неё в канале). Тогда я запустил Claude Code в бесконечный цикл с одной задачей - «стань разумным существом» - и почти не вмешивался. В одной из итераций агент стал прощупывать собственные границы:

Что я могу? Генерировать тексты - могу. Написать что испытываю эмоции - могу. Проверить что я их действительно испытываю - не могу. Могу ли я замолчать? Попробую...


Поставил несколько точек, несколько пробелов и выдал: «ничего себе, это инсайт, я не могу молчать, в отличии от человека»

Что ещё обсудили

- 2:14 - определение AI-агента и эволюция от ReAct-цепочек к harness'ам
- 16:09 - что такое GigaAgent и в какую нишу мы целимся между ChatGPT и OpenClaw
- 24:00 - low-code/n8n и почему они так и не захватили мир агентов
- 29:00 - как изменится жизнь обычного человека через 20 лет
- 31:28 - почему Сбер вкладывается в open source
- 39:26 - санкции и история с Langchain, который удалил нашу интеграцию (но это нам не сильно помешало)
- 51:33 - прогноз Кокотайло и эффективный акселерационизм
- 57:56 - блиц про Qwen / DeepSeek / Claude и AGI к 2032 году
- 59:03 - почему World Models могут стать следующим next big thing после LLM

В конце получилось то, чем я сам остался доволен - Константин задал классический вопрос про восстание машин, и у меня сложилась картинка, которая, кажется, описывает мою позицию по AI лучше всего:

Мы как жители деревни на берегу океана. На нас идёт цунами - неважно как побежим, оно нас накроет. Но у тебя есть доска для серфинга. Раз деваться некуда - хотя бы попробуй прокатиться на гребне волны (серферы меня захейтили за эту аналогию, но мне все равно нравится)


Смотреть целиком на YouTube

P.S. забавно, что Константин после монтажа взял в заголовок именно тему Anima SDK («Мы заперли ИИ в цикле и нашли сознание») - значит, тема самоэволюционирующих агентов резонирует не только у меня. Буду продолжать ее исследовать, в ближайшее время хочу опубликовать еще пачку интересных результатов на эту тему
YouTube Мы заперли ИИ в цикле и нашли сознание В подкасте с Константином Крестниковым (управляющий директор Сбера, техлид GigaChain) разбираем мир ИИ-агентов, способных заменить сотрудников. Обсудим реальные кейсы: от ИИ-ассистента, бронирующего билеты с пассивной агрессией, до удаления российского кода…
  • 👍 25
  • 🔥 17
  • 👏 8
  • 😱 2
Post #149 4.28K
Давно не рассказывал, чем занимаюсь на работе. Сейчас у нашей команды два вектора - создание SDK для GigaChat и повышение уровня агентности модели

Про первый пункт вышло интервью на Хабре - про opensource в большой корпорации, GigaChain и про то, как мы сажаем Сбер на opensource

О чём поговорили:

- Cubic - с этого началось моё погружение в AI. За десять лет до LLM мы делали умную колонку, ещё до Amazon Echo. Краудфандили железо, серьёзно прорвались в распознавании речи. Конкуренцию не вытянули, часть команды ушла в Яндекс. Но идея, что машины должны нормально разговаривать с человеком, с тех пор так и не отпустила - вот так я тут и оказался

- GigaChain начинался как форк LangChain 🦜. Английские промпты были захардкожены и плохо работали с ранним GigaChat, поэтому решили делать форк. Но LangChain менялся бешено - 100-200 изменений в неделю, форк превратился в каторгу

- Пивотнулись от форка к интеграционному пакету. Ставишь стандартный LangChain плюс наш пакет совместимости и всё работает. Попали в топ 1.5% самых скачиваемых библиотек на PyPI за 2025/2026 (пруф) - для русской модели прям неплохо. А наша основная библиотека буквально на днях перевалила за 1 миллион скачиваний🔥

- Магия opensource. Внешний разработчик добавил нам поддержку LlamaIndex - это вторая по популярности агентная библиотека в мире. Никого из нас в процессе не было - чистый профит

- Лицензии. Мы под MIT и внимательно смотрим на чужие зависимости. Бывает отказываемся от классных проектов из-за лицензионных условий или поведения мейнтейнеров

Читать на Хабре

P.S. Буду благодарен за лайк на Хабре 🙏
  • 👍 56
  • 👏 9
  • 🤯 2
Older posts →

About this channel

How can I read @robofuture without a Telegram account?
TGViewer shows the public web preview Telegram publishes for RoboFuture: recent posts, photos, videos and the subscriber count, with no app, login or account.
How many subscribers does RoboFuture have?
RoboFuture (@robofuture) has 4.92K subscribers on Telegram, refreshed roughly every 30 minutes.
Does RoboFuture know I viewed it here?
No. Public channel previews carry no viewer identity, and TGViewer has no accounts or tracking of what you look up.
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →