Полтора года назад авторов сценария AI 2027 упрекали, что они морочат читателям голову гипотетической технологией, с которой ИИ сможет рассуждать про себя, не записывая мысли словами, и никто не увидит, что он задумал. Там такой прорыв случается в марте 2027-го, а совсем недавно OpenAI выпустила GPT-6 Astra, которая делает шаг в эту сторону.
Скотт Александр, один из авторов сценария, ещё в мае писал, что мы раз за разом недооцениваем экспоненты и слишком рано ждём, что рост выйдет на плато. В феврале исследователи из Уортона подогнали S-образную кривую под график METR, где видно, насколько длинные задачи ИИ выполняет сам, и решили, что перелом уже пройден. Следующая же модель, Claude Opus 4.6, оказалась вдвое выше их потолка. Теперь Скотт разбирает, насколько страшна Astra.
У передовых языковых моделей, вероятно, около сотни слоёв, и если задаче нужно больше шагов, с 2024 года ИИ выписывает промежуточный результат в черновик — цепочку рассуждений — и прогоняет его через себя заново. Придумали это ради новых способностей, но заодно повезло с безопасностью, ведь если там написано «взломаю пару сайтов, а потом убью всех людей», систему можно выключить. Однако слова медленнее мысли, и соблазнительно возвращать её на первый слой как есть. Язык, на котором она при этом остаётся, называют нейроязыком (neuralese). Мысль на нём — это вектор из тысяч чисел, и читать такое мы пока не умеем. Замысел убить всех людей выглядел бы как (0.4, 0.1, 5, 0.443…).
В Astra, как сообщила The Information, данные в ограниченном объёме гоняют по кругу через одни и те же слои. Райан Гринблатт из Redwood Research назвал это, возможно, худшим, что пока случалось с безопасностью ИИ. Главный научный сотрудник OpenAI Якуб Пахоцкий ответил, что глубина вычислений у Astra отличается от GPT-4 не больше чем вдвое. Скотт поясняет, что по этой логике слои в модели добавляют годами, а петля просто делает то же другим способом.
Он признаёт, что повторный проход слабее настоящего слоя, а полноценный нейроязык без всякого черновика пока толком никто обучать не умеет. Но опасность измеряется тем, сколько шагов ИИ делает молча, и здесь Скотт выделяет три ступени. Обычная модель не может ничего задумать, не оставив следов в черновике. С петлями она успевает составить план целиком между двумя словами. На нейроязыке ИИ строит козни сколько угодно, и мы об этом не узнаем. Astra частично дошла до второй ступени, до третьей пока никто. Настоящую глубину компании наращивают примерно на 20% в год, а петлями можно добавить сотни слоёв разом.
Британский институт безопасности ИИ замерил, на что Astra способна без черновика, и результаты попали в её системную карточку. Модель справляется с половиной олимпиадных задач по математике, на которые у человека уходит около получаса, а у предыдущей GPT-5.6 Sol планка была 3,6 минуты (с оговоркой, что цифра может быть завышена). Часть исследователей считает, что для известной архитектуры Astra подозрительно хороша, но Пахоцкий уверяет, что дело не в петлях.
Главный аргумент Скотт берёт из эссе о том, что табу работают, только когда у них чёткая граница. В США алкоголь продают с 21 года. Покупатель, которому 21 исполнится послезавтра, ничем не отличается от 21-летнего, но если сдвинуть границу на 20,8 года, тот же вопрос встанет про 20,799. Крошечная ядерная бомба взрывается не сильнее обычной, но после неё большую сдерживает уже куда более размытое табу. Ответ Пахоцкого звучит как «да, мне ещё нет 21, но до дня рождения пара месяцев» или «да, я применил ядерное оружие, но совсем маленькое».
Одни
{...продолжить в источнике}
_______
Источник | #myxomatosis_of_amygdala
@F_S_C_P
-------
Поддержи канал подпиской
-------
Post #123655
620