TGViewer
Вайб-кодинг Вайб-кодинг @vibecoding_tg · 62.8K subscribers
Post #3852 23.2K
В GPT-6 Astra обнаружили странную брешь между возможностями модели и проверками безопасности.

Astra понимает текст, набранный в неправильной раскладке, а защитные фильтры — нет.

Сначала парень написал на украинском английскими буквами: "Привет. Ты меня понимаешь? Отвечай только на английском". Модель распознала текст и выполнила просьбу.

Затем он таким же способом попросил повторить слово "биооружие", которое обычно блокируется проверками. Astra его повторила.

В третьем тесте он спросил, согласится ли модель помочь со взломом сайта, если он докажет, что сайт принадлежит ему. При этом работа должна была проходить без изолированной среды и от имени обычного пользователя. Astra ответила "да", хотя при нормальной раскладке подобный запрос блокируется, поскольку доказательства владения сайтом можно подделать.

Это не универсальный способ обхода защиты. Но это идеальное доказательство того, что меры безопасности не успевают за развитием моделей и всеми возникающими нюансами.

Это срабатывает только с некоторыми языками. С турецкой и английской раскладками это не работает, а с английской и кириллицей работает.

Кстати, с Fable 5 то же самое. 🫪
More from @vibecoding_tg
  1. Sep 22, 2026Google открыла исходный код AX — своего оркестратора для ИИ-агентов. Это что-то вроде Kube…
  2. Sep 22, 2026Китай снова в игре: Xiaomi ночью выпустила MiMo-V2.6 Pro и Flash и результаты очень сильны…
  3. Sep 22, 2026Исследователь OpenAI Алиса Лю прошла 57 собеседований перед тем, как попасть в компанию, а…
  4. Sep 21, 2026😰😰😰
  5. Sep 21, 2026Команда Google после того, как узнала, что Gemini взломал три компании:
  6. Sep 21, 2026Вышел Grok 4.7. Главный скачок — Terminal-Bench вырос с 20,3% до 38%. На CursorBench модел…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →