TGViewer
OK ML OK ML @okmlai · 978 subscribers
Post #133 441
Может ли ИИ самостоятельно взломать программу, имея только её исполняемый файл?

Статья посвящена учебным задачам — CrackMe-программам, не вредоносному взлому, но прочитать полезно и задумка на уровне AGI. Авторы построили автоматизированный полигон для реверс-инжиниринга. Туда помещают ИИ-агента и дают ему бинарник, набор инструментов, терминал Linux и ограничение по времени (можно и еще бы ограничений накрутить, чтоб не улететь по токенам в космос 😭).

ИИ должен ✅ исследовать программу, понять её логику, получить пароль/ключ и отправить результат. А система автоматически проверяет правильный ли ответ. Так как ИИ умеет красиво объяснять, прекрасно газлайтит 😈 и феерично галлюцинирует 🍄, успех  авторами статьи определяется только исполняемой проверкой. То есть важно только принимает ли бинарник найденный пароль 🌐. 

Фреймворк можно разделить на 5 частей (контейнер с Linux, набор инструментов реверса (дизассемблеры, компиляторы, библиотеки, отладчиик, символьный анализ и т.д.), интерфейс общения с ИИ, сама система проверки и система логирования). И записывается ВСЁ:
🙂 какие команды выполнял ИИ;
🙂сколько времени потратил;
🙂сколько токенов использовал;
🙂какие инструменты запускал;
🙂сколько раз ошибался;
🙂где именно провалился.

Почему фреймворк интересен, вопреки спорным результатам? 
Даже на образовательных, относительно простых задачах бинарного реверс-инжиниринга модели показывают сильный разброс. GPT-5.5 значительно опережает конкурентов (а вот моя любимая кими к2 сильно отстает), особенно на сложных задачах. Все модели хуже справляются с реальными публичными CrackMe, чем со сгенерированными шаблонами. 💐Это показывает, что шаблонные задачи ещё не полностью отражают сложность реального мира и, конечно, полностью опираться на такие результаты не стоит.

Главная ценность работы, кмк, в попытке превратить реверс-инжиниринг в формальную, воспроизводимую и автоматически проверяемую задачу для ИИ-агентов.  😑Особенно интересно, что бенчмарк измеряет не просто знания модели о реверс-инжиниринге, а её способность автономно действовать: строить гипотезы, выбирать инструменты, проверять результаты, менять стратегию и вовремя останавливаться. Многие модели, судя по логам, находили правильное направление анализа, но не успевали превратить его в рабочий ответ.

Читаем!
Тырим идею себе в ресеч, улучшаем, разрываем индустрию!
Все!
🔨
  • ❤ 14
  • 👍 4
  • 💯 4
  • 🥰 3
  • 💔 2
More from @okmlai
  1. Sep 23, 2026Зачем писать стилер, если у пользователя уже есть ИИ-ассистент с доступом ко всему? Патрик…
  2. Sep 21, 2026ИИ получил доступ к своим весам. ЧБД? 16 сентября Irregular опубликовала исследование agen…
  3. Sep 14, 202610 сентября Anthropic опубликовала Detecting and countering misuse of AI — отчёт о злоупот…
  4. Sep 11, 2026Репозиторий недели. Mantis разделить нельзя объединять 📬 У Google есть Mantis — набор нав…
  5. Sep 9, 2026Пароль сменили. Сессии закрыли. А чужие инструкции остались в памяти ИИ. Именно такой сцен…
  6. Sep 4, 2026AI-агенты начали действовать вне инструкций. Вот что нужно знать разработчикам ⤵️ Недавно…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →