На Хабре запилили материал про угон цепочек рассуждений у закрытых моделей. Схема до идиотизма простая: зашифрованный кусок от мощной модели пихают слабой версии того же провайдера и требуют дословный пересказ. Так высасывают чужие мысли, включая случайно затесавшиеся пароли и ключи.
Статья заставила отряхнуть пыль с одного древнего ресёрча и продуть парсером свежие сессии. За полгода протокол распух на четыре версии схемы, а внутри нашлась херня, из-за которой у меня к выводам препринта есть поправочка.
Стартую с показа реальной, живой подписи — выдернул её из своей сессии Claude Code полчаса назад.
👉 Data Science | Machinelearning [ru]
Post #5813
1.91K

- 😁 3