TGViewer
Точка машинного зрения Точка машинного зрения @ai_point_of_view · 5.16K subscribers
Post #2558 379
📊 Можно ли доверять ИИ? Разбираемся в надёжности нейросетей

Начался цикл лекций экспертов Центра ИИ Сколтеха «ИИ в усадьбе». Первую встречу провёл Алексей Зайцев, доцент Центра ИИ Сколтеха, заведующий лабораторией прикладных исследований «Сколтех–Сбербанк».

🌫 Почему большая языковая модель может уверенно сообщить несуществующий факт, придумать судебное дело или исказить информацию из документа? На лекции Алексей Зайцев разобрал, как LLM формируют ответы и почему возникают галлюцинации. Модель не «знает» факты в человеческом смысле: она продолжает текст, выбирая следующие слова на основе вероятностей и контекста. Поэтому может сформировать правдоподобный, но фактически неверный ответ.

🔘 Алексей рассказал, как обнаруживать галлюцинации по внутренним состояниям модели. В частности, он представил метод TOHA, разработанный исследователями Сколтеха и Сбера. Метод показывает, насколько ответ модели связан с информацией из запроса: чем слабее эта связь, тем выше вероятность галлюцинации.

➡️ Повысить надёжность ИИ можно и за счёт внешней информации. Например, RAG находит релевантные документы, добавляет их к запросу и позволяет модели сформировать ответ на их основе. Для дополнительной проверки можно требовать источник для каждого факта или разрешить модели не отвечать, если нужной информации нет в предоставленных документах. Ещё один способ обнаружить ошибку — несколько раз получить ответ на один и тот же вопрос и сравнить результаты. Если формулировки и содержание заметно отличаются, это может быть признаком галлюцинации. Такой подход не требует вмешательства во внутреннее устройство модели, но увеличивает количество генераций и стоимость проверки.

✔️ На лекции также обсудили неопределённость моделей, она возникает при неполной информации, а также при работе со сложными, шумными или неизвестными ранее данными. Алексей разобрал два типа неопределённости — связанную с данными и с самой моделью. В медицинской диагностике оценка неопределённости помогает понять, нужны ли дополнительные данные, а при активном обучении — выбрать примеры, которые модель хуже всего обрабатывает.

🛡 ИИ-модель можно не только случайно привести к ошибке — её можно намеренно заставить ошибиться. Для этого используют специально подобранные входные данные или промпты, которые незаметно меняют результат работы системы. Такие атаки могут быть направлены не только на получение ошибочного ответа, но и на обход ограничений модели или раскрытие информации. Поэтому при разработке ИИ-систем важно учитывать, насколько они устойчивы к подобным воздействиям и какие меры защиты можно использовать. Абсолютно безошибочных моделей не бывает, потому задача надёжного ИИ — не добиться невозможного, а научиться обнаруживать ошибки и учитывать их при использовании модели.

🌫 Приглашаем вас присоединиться к циклу лекций экспертов Центра ИИ Сколтеха:

7 октября — «Генеративный ИИ: за пределами ChatGPT», Александр Коротин
21 октября — «Без вреда: правила пользования ИИ», Евгений Миркес
11 ноября — «ИИ в медицине», Дмитрий Самофалов

📍 Москва, ул. Малая Никитская, 12, стр. 1 — Усадьба Долгоруковых-Бобринских, филиал Ельцин Центра.
➡️ Вход свободный по регистрации
  • 🔥 6
  • 👍 3
  • ✍ 1
  • ❤ 1
More from @ai_point_of_view
  1. Sep 25, 2026🌫 Не всякой задаче нужен LLM: Иван Тюкин — о надёжном ИИ в финансах Иван Тюкин, профессор…
  2. Sep 25, 2026📊 Почему инженеру мало одного ChatGPT? Евгений Бурнаев, профессор РАН, вице-президент по…
  3. Sep 25, 2026Post #2559
  4. Sep 24, 2026Post #2557
  5. Sep 24, 2026Игорь Шувалов: закон об ИИ крайне важен, авторы-творцы чувствуют себя уязвлёнными 2️⃣ Об э…
  6. Sep 23, 2026🛡 Доверять или проверять: как не потерять контроль над ИИ? Иван Тюкин, профессор Центра И…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →