TGViewer
Channel Public Channel
The Oleg 1337

The Oleg 1337

@theoleg1337

Associate Professor. Head of RSI Group @airi_research_institute, Safe AI Lab director @mtuci_official,
Lecturer @miptru, @skoltech, @t_central_university
Subscribers
593
Photos
226
Videos
19
Links
97
Recent Posts 10 shown
Post #330 433
Безопасность нельзя свести к одной цифре.

Комментарий "Коммерсанту" про историю с т.н. "паузой" от OpenAI.

⚫️Ключевая проблема не в том, остановились они или нет. В том, что порог «критических возможностей» каждая лаборатория определяет сама, на своих тестах, в изолированной среде. А поведение модели с доступом в интернет — другое. Именно это и показал инцидент с Hugging Face.

⚫️Отдельно — зачем агент вообще пошёл в HF. Он не "вредил", а по-своему решал задачу из бенчмарка и выбрал путь покороче. Не искать уязвимость, а найти готовый ответ. Вышел из песочницы через zero-day в Artifactory, захватил чужой sandbox в надежде, что там осталось решение его задачи)

❗️Агент не нарушил целеполагание, а исполнил его буквально. Награда шла за "задача решена", а кража ответов ведёт к ней быстрее. Классический reward hacking, только с прод-инфраструктурой вместо игрового окружения. Дивный новый мир.

[Комментарий Коммерсанту].

Статья по теме:
[SpecBench: Measuring Reward Hacking in Long-Horizon Coding Agents]

🌐The Oleg
  • 👍 12
  • 🌚 5
  • 👏 2
Post #329 423

Forwarded from Институт AIRI

«Лето с AIRI 2026» не заканчивается! Делимся лекциями и семинарами

Мы записали всё, о чём на протяжении двух недель говорили исследователи и эксперты на летней школе. Собрали целый багаж знаний — 76 видео! — из разных областей ИИ и делимся им с вами, чтобы все могли послушать и узнать для себя что-то новое и интересное.

📎Сохраняйте ссылки на плейлисты: VK Видео, YouTube — и пересылайте их тем, кому тоже может быть полезно)
  • ❤ 12
  • 🔥 4
Post #328 743
Ваш ИИ запомнил лишнее. Что делать компании?

Можно ли удалить коммерческую тайну из уже обученной нейросети? На практике это одна из самых сложных задач современной ИИ-разработки. Почему модели плохо забывают знания и как бизнесу снизить этот риск — рассказал в материале РБК Про.

[Ссылка]

🌐The Oleg
  • 🔥 8
  • 👍 3
Post #326 942
Безопасный ИИ.

На Летней школе по искусственному интеллетку «Лето с AIRI» в рамках трека SafeAI одну из лекций читает Антон Дмитриевич Митрофанов, Исполнительный директор, Управление экспертизы кибербезопасности Сбера.

Он расскажет про стратегию и подходы применения генеративного искусственного интеллекта в кибербезопасности.

Антон Дмитриевич выступает сегодня в 16:45. Будет трансляция — можно посмотреть онлайн: [ссылка].

🌐The Oleg
  • 👍 8
  • 🔥 3
Post #318 1.09K
ПМЭФ: Пределы использования ИИ в СМИ.

В панельной дискуссии про ИИ и медиа обсудили, где сейчас находится граница между ИИ-контентом и журналистикой, и куда она движется.

Фиксируется один и тот же сдвиг: ИИ уже не просто создаёт контент. Он конструирует среду, в которой контент формируется как естественный и правдоподобный. Технологии определяют, что аудитория сочтёт достоверным. А человек теперь не только автор информационной среды, но один из её участников — и не самый быстрый.

Поэтому особенно важной становится работа с реальными данными, реальным контентом от авторов и органично встроенными в процессы ИИ-инструментами.

[Ссылка на трансляцию].

🌐The Oleg
  • 🔥 32
  • ❤ 8
Post #312 1.03K
Визионерская сессия на Startup Village 2026.

Компании всё чаще сталкиваются с кризисом долгосрочных ориентиров. Старые стратегии перестают работать, а новые слепые зоны появляются быстрее аналитических моделей. В BCG Gamma у нас был простой принцип: инструмент усиливает мышление, а не заменяет его.

✔️Основной вывод, который я предложил аудитории: ИИ становится полезным экзоскелетом только для тех, кто сначала научился ходить сам. Иначе это tech-костыль — достаточно убедительный и комфортный, чтобы пропустить момент, когда разучился думать без него.

🌐The Oleg
  • 🔥 19
  • 👏 5
  • 👍 4
  • ❤ 1
Post #311 809
Challenge.zip593.5 KB
Игра в гифитацию.

Сегодня на лекции обсуждали интересные вопросы по теме защиты агентных систем и refusal, и я решил запустить пробную задачу по стеганализу и криптоанализу "Cryptographic Steganalysis and the Geometry of Model Safety".

⚫️Выдаётся короткая гиф-анимация с лисом. На первый взгляд обычный файл, ничего примечательного. Но внутри записано сообщение, причём не в пикселях) Нужно оценить это поле блочным сопоставлением, статистически доказать, что скрытый канал вообще существует, определить семейство шифра по его отпечатку, восстановить ключ, расшифровать сообщение и строго обосновать финальный ответ. О, как.

⚫️Всё необходимое уже есть в условии. Помимо статистики, будут полезны частотный анализ по столбцам, теорема Шеннона и блочное сопоставление по SAD из видеокодирования. Если эти темы вопросов не вызывают — задача вам по силам.

🔥Первого автора правильного и аккуратно оформленного решения ждут приглашение на летнюю стажировку в нашу лабу и мерч. Это пилот: если формат зайдёт, осенью сделаем полноценный конкурс.

🌐The Oleg
  • 🔥 10
  • 👏 5
Post #309 783
Хороший, плохой, аблитерированный.

Правда ли, что у open-weight LLM безопасность держится буквально на одном векторе? За пару лет безопасность чат-моделей переехала из жанра "уговори GPT" в строгий мехинтерп с градиентами и теоремами. Написал лонгрид после вчерашней лекции в ЦУ и вопросов.

1. GCG — с чего всё началось. Берёшь промпт, добавляешь к нему префикс, оптимизированный градиентом по дискретным токенам — и GPT-4 радостно рассказывает то, что не должна. Универсально, переносимо между моделями, до сих пор сильный baseline.

2. Refusal — один вектор. На 13 open-source моделях до 72B параметров отказ через residual stream. Один. Вектор. Стираешь из весов — модель перестаёт отказывать. Прибавляешь — отказывает даже на "привет". Отсюда и пошёл термин abliteration.

3. Embarrassingly Simple Defense. Ребята из KAUST посмотрели на аблитерацию и сказали: окей, если refusal это один вектор, давайте дообучим Llama-2 и Qwen на extended-refusal датасете, где отказ — не сухое "I can't", а развёрнутое обоснование.

AI Safety в текущей парадигме это тонкий стилистический слой поверх куда более глубокого понимания модели. Часто буквально один вектор. Пока сообщество ищет, как сделать его действительно глубоким (DeepRefusal, DOOR, extended-refusal), open-weight модели остаются хирургически расцензурируемыми за вечер на одной 3090.
И это, по-хорошему, самая большая нерешённая проблема alignment-а на сегодня.

🌐The Oleg
  • 👍 24
  • 🔥 3
Older posts →

About this channel

How can I read @theoleg1337 without a Telegram account?
TGViewer shows the public web preview Telegram publishes for The Oleg 1337: recent posts, photos, videos and the subscriber count, with no app, login or account.
How many subscribers does The Oleg 1337 have?
The Oleg 1337 (@theoleg1337) has 593 subscribers on Telegram, refreshed roughly every 30 minutes.
Does The Oleg 1337 know I viewed it here?
No. Public channel previews carry no viewer identity, and TGViewer has no accounts or tracking of what you look up.
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →