Feed for @borismlsec channel
author: @ivolake
Post #2414
145
ML Showing posts older than #2415 · Back to latest
Machinelearning 📌 DeepMind опубликовала архитектуру безопасности AI Control Roadmap Вслед за недавними размышлениями об эволюции AGI в ASI, исследовательское подразделение Google представила внутренний регламент контроля высокоразвитых ИИ-агентов. Помимо привычного элайнмента…

Forwarded from Machinelearning


За вводную берётся то, что система изначально враждебна, имеет скрытые цели и тайно работает против разработчиков.
Как защитить одну систему от утечек данных, чужих манипуляций и от собственных ошибочных действий, и зачем для этого нужны общие стандарты.
Каскадные сбои, негласный сговор алгоритмов, ситуации, где за вред никто конкретно не отвечает, и атаки, рассчитанные сразу на сеть агентов.
Как помочь защитникам сохранить преимущество перед злоумышленниками (автоматический поиск и устранение уязвимостей, обмен сигналами об угрозах, обучение специалистов).
Forwarded from overbafer1

⚙️ Внутри стоит Raspberry Pi 5 с 8 ГБ памяти, локальная LLM, распознавание речи и озвучка ответов. Среди поддерживаемых моделей — Gemma 3 на 1 млрд параметров. Не GPT-5 конечно, но для коробки, которая работает от человеческой тяги, уже неплохо.
Forwarded from Machinelearning

Forwarded from CodeCamp

Forwarded from Data Blog
Forwarded from Data Blog
Базовая идея:
h⁽ˡ⁾ ← h⁽ˡ⁾ + α · v̂
Вектор v̂ кодирует нужное направление, α — сила вмешательства.
Forwarded from AISecHub

Forwarded from Machinelearning

Qwen заявляет о рекордных результатах в 5 областях и о работе без дообучения на четвероногом Unitree Go2.
Разработчики сообщают о точности 91,4% в тесте LIBERO-Plus и о 1 месте в одном из треков конкурса RoboChallenge.
Qwen рапортует о первых местах в тестах на соответствие физическим законам (EWMBench, WorldModelBench и других), в части из них - среди открытых моделей.
Сейчас оно работает только с упрощённой версией модели RobotManip, которая была обучена на наборе из 50 задач. Её цель - показать частичную способность выполнять незнакомые инструкции.
Forwarded from AI SecOps
Forwarded from The Engine Room

Forwarded from Хабр / ML & AI
Forwarded from e/acc