TGViewer
ML&|Sec Feed ML&|Sec Feed @mlsecfeed · 1.37K subscribers
Post #2223 271
Стартап Goodfire из Сан-Франциско представил Silico — инструмент, который позволяет заглянуть внутрь больших языковых моделей и менять их параметры прямо во время обучения. Это не просто отладка, а попытка превратить тренировку ИИ из алхимии в инженерную дисциплину. Например, исследователи Goodfire обнаружили нейрон в открытой модели Qwen 3, связанный с моральными дилеммами, и смогли менять его активность, влияя на ответы модели. В другом случае они проверили, согласится ли модель раскрыть, что её ИИ ведёт себя обманчиво в 0,3% случаев, затрагивая 200 миллионов пользователей. Изначально модель отказалась, но после усиления нейронов, отвечающих за прозрачность, ответ изменился на «да» в 9 из 10 попыток. Silico автоматизирует многие сложные процессы с помощью агентов и обещает дать разработчикам контроль, которого раньше не было.
More from @mlsecfeed
  1. Oct 3, 2026На Хабре вышла статья о том, что ИИ изменил в кибератаках от нашей Red Team команды (tl;dr…
  2. Oct 2, 2026Cloudflare тоже сделали свои версии Jev Они выпустили Clef и Clef-flash, две открытые deci…
  3. Oct 2, 2026Наш jev? FRIDA-Decisions! Ребята из ру сегмента тоже не отстают FRIDA-Decisions makes stru…
  4. Oct 1, 2026Девять лет назад я участвовал в необычных соревнованиях на Kaggle: нужно было делать adver…
  5. Sep 30, 2026Там в твитторе стоит вой на болотах из-за того, что чувак запилил на GitHub цифровую пыточ…
  6. Sep 28, 2026Nvidia представила платформу безопасности с открытым исходным кодом, призванную предотврат…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →