Post #2223
271

Стартап Goodfire из Сан-Франциско представил Silico — инструмент, который позволяет заглянуть внутрь больших языковых моделей и менять их параметры прямо во время обучения. Это не просто отладка, а попытка превратить тренировку ИИ из алхимии в инженерную дисциплину. Например, исследователи Goodfire обнаружили нейрон в открытой модели Qwen 3, связанный с моральными дилеммами, и смогли менять его активность, влияя на ответы модели. В другом случае они проверили, согласится ли модель раскрыть, что её ИИ ведёт себя обманчиво в 0,3% случаев, затрагивая 200 миллионов пользователей. Изначально модель отказалась, но после усиления нейронов, отвечающих за прозрачность, ответ изменился на «да» в 9 из 10 попыток. Silico автоматизирует многие сложные процессы с помощью агентов и обещает дать разработчикам контроль, которого раньше не было.