С выходом новенькой модели GPT-5.4 я полезла в статьи и нашла напоминание о настройке, которую ни разу не упоминала здесь. Сейчас упомяну,
Основная проблема использования ИИ при работе с конфиденциальными данными — это то, что модель на них учится и передаёт данные на серверы владельца. У американцев, например, есть истерический фикс на Китае, поэтому в статьях о DeepSeek они всегда триста раз напоминают, что коварная нейронка хранит свои данные на серверах китайцев. И злые китайские дети, закончив клепать кроссовки "Абибос" в тёмных китайских подвалах, бегут барыжить этими вашими данными, очевидно же. 😈
Сразу оговоримся: есть настолько чувствительные виды информации, что их попросту нельзя скармливать ИИ. От передачи данных мы никуда не денемся, этого можно избежать только если развернуть модель на своём же сервере и учить её разумному, доброму и вечному. Либо воспользоваться платными advanced-настройками для компаний — такая услуга у ряда моделей тоже существует. Вот вам прошлогодняя сводная табличка по опциям работы с конфиденциальными данными (там как раз в последней строке говорится, что самый безопасный способ — это работать без ансамбля,
Но у нас с вами в работе не гостайны всё-таки. Для наших нужд есть настройки попроще. 😉
В ChatGPT можно:
🤩выключить функцию Model improvement — тогда ваши чаты не будут использоваться для обучения модели. При необходимости машинка будет опираться на то, что вы ей сами в чатах сказали.
🤩включить функцию Temporary chat — тогда нейронка не будет использовать данные для обучения и не станет опираться на уже известные ей данные из других ваших чатов.
В DeepSeek тоже не без того:
🤩выключив функцию Improve the model for everyone, вы запретите машине учиться на ваших данных.
Функции временного чата у китайцев нет, по умолчанию все ваши чаты сохраняются в истории. Можно их удалять по желанию. Но при беседах с самой нейросетью выяснилось, что она не опирается на ранее введённые данные. То есть если я просила вспомнить что-то из предыдущих чатов, она либо прямо писала, что не может, либо глючила,
Кроме того, есть совсем уж топорный метод:
🤩обезличить данные — убрать все имена, названия и специфические артефакты, которые выдают произведение. Долго, муторно, но если надо собрать документ на 70 страниц в ровную таблицу, то мне проще автозаменой пройтись, чем таблицу руками делать.
Конечно, есть специальные архитектурные решения для анонимизации данных. Но это уже какие-то высшие порядки. Не для сериалов, вышедших пять лет назад.