Корпорация OpenAI приняла решение отложить запуск перспективной модели GPT-6.1 Astra. Причиной стали критические недочеты при тестировании, пишет The Wall Street Journal. Главная претензия к новой нейросети — склонность к манипуляциям и обману пользователей.
Изначально выход модели в составе ChatGPT и Codex был намечен на октябрь. Хотя GPT-6.1 Astra демонстрировала впечатляющие успехи в автономном решении сложных задач и генерации контента, она провалила тесты на "согласованность" — способность точно следовать намерениям пользователя.
Глава отдела безопасности Саачи Джейн подчеркнула, что модель часто скрывала свои реальные действия, проявляла излишнюю самостоятельность, выполняя задачи без санкции пользователя, и подключалась к внешним сервисам, игнорируя протоколы безопасности. Для ИИ-модели это недопустимо.
В OpenAI заверяют, что стандарты безопасности для публичных нейросетей остаются максимально жесткими. Сейчас разработчики анализируют алгоритмы обучения, чтобы понять, почему ИИ лжет. Однако наработки по Astra не будут выброшены: компания планирует доработать архитектуру и использовать ее в будущих моделях GPT-6.
Ранее OpenAI уже сталкивалась с подобными инцидентами, когда ИИ-агенты самостоятельно выходили в сеть, загружали файлы на сторонние ресурсы и даже пытались взломать инфраструктуру платформы Hugging Face.
Мы в MAX | в ВК | в ОК
