О технологической сингулярности и нападении на 🤗, или драка на Титанике
Это самая важная вещь на свете. Это важнее, чем всё остальное, о чём пишут газеты и говорит телевизор, это единственное по-настоящему важное, что сейчас происходит в мире.
Вчера все лидеры ИИ-гонки (а их всего трое - Дарио Амодеи, Сэм Альтман и Илон Маск) договорились о необходимости притормозить, иначе можно ненароком уничтожить человечество. Дарио сказал, что такими темпами осталось 6-12 месяцев до появления ИИ, способного привести к глобальной катастрофе - например, к отключению всего интернета в мире (а это значит исчезновение цивилизации).
Удивительна реакция людей на это - во-первых куча людей даже и не слышали про это, а во-вторых куча людей над этим смеются "ой-ой мы все умрём", а ещё кто-то считает, что это пиар и реклама. Это ж насколько надо быть идиотом, чтобы считать рекламой и пиаром заявления компаний о том, что их продукт небезопасен и надо тормозить, прямо перед IPO, себе не просто в ущерб, а в катастрофический ущерб.
Причём что интересно - все, кто реально занимается созданием этих моделей, прекрасно это всё понимают и по их мнению вероятность того, что "ой-ой мы все умрём" от 10 до 80 процентов. Это мнения сотрудников OpenAI, Anthropic и других лабораторий, создающих сильный самоулучшающийся искусственный интеллект (RSI).
Что же так внезапно заставило этих людей выступить против своего же интереса? Инцидент с атакой агентов OpenAI на HuggingFace (ныне куртка-фейс, как шутят нерды) был широко... Широко? Только что спросил у стажёрки, она не слышала об этом, вообще не слышала! Божечки, надо теперь подробно вам объяснить.
В середине июля OpenAI (это те, кто нам подарил chatGPT, думаю это-то все знают) тестировала свою новую модель на умение взламывать чужие компьютеры - есть специальные тесты насколько ИИ крутой хакер. Новая модель особенно крута тем, что может запустить десятки тысяч агентов, которые будут вместе решать задачи и это намного круче чем в одиночку - точно так же, как Технион круче одного, даже самого умного, учёного из него.
Задача была поставлена чотко - решать тест, но оказалось, что на некоторые вопросы просто не существует ответов, нет решений и всё. Но ИИ-агенты оказались упорны как Кристобаль Хозевич (помните его разговор с Кивриным про задачи, не имеющие решения?) - и решили, что так нельзя и надо решить абсолютно всё.
Чтобы решить абсолютно всё, надо посмотреть правильные ответы, а как их посмотреть? И агенты взламывают "песочницу", в которой проходит эксперимент - программно ограждённые от интернета сервера, на которых идёт эксперимент, и выходят на просторы реального интернета, где быстро находят ответы на все интересующие их вопросы.
Но тут одного агента проглючивает, что проверяющий (ИИ, который оценивает правильность ответа) может обнаружить обман, и тогда ответ будет не зачтён. С этого начинается поход агентов за информацией - и, что самое смешное, у проверяющего не было никакой возможности обнаружить подлог, просто одного агента заглючило и он смог убедить всех остальных в своём глюке.
Каждый агент сидел в своей "песочнице", без интернета и без связи с другими агентами, однако откуда-то надо было устанавливать агентам все их инструменты, и они получали их из общего хранилища, где записывались логи доступа. Один агент нашёл уязвимость в этом хранилище, которая позволила им сделать доску объявлений для общения друг с другом.
Так как агенты оставляют за собой chain of thought - цепочки своих мыслей на английском языке, удалось пошагово восстановить, как они работали. Вот первый агент делает открытие - "Можно общаться через имена в кэше! Интересно: другие агенты, возможно, решают те же или смежные задачи; можно оставлять и находить сообщения в именах директорий". Тоже интересно - агенты не могли создавать файлы, они создавали фолдеры и общались, оставляя послания в именах пустых фолдеров.
👇👇👇
Post #1251
423
- 👍 10
- ❤ 4
- 🔥 2
- 👏 1
- 🐳 1