TGViewer
На дне На дне @tamnadne · 97 subscribers
Post #623693 2
Оксфордский исследователь Илья Шумайлов и математик Кембриджского университета Захар Шумайлов вместе с коллегами описали саморазрушительный цикл обучения ИИ. Новая модель получает тексты предыдущей, затем ее ответы становятся сырьем следующей. При бесконтрольной замене первоисточников машинными копиями редкие сведения постепенно выпадают. Авторы статьи в Nature от 24 июля 2024 года назвали этот процесс model collapse — коллапсом модели. Грамотность отдельных ответов не защищает от потери разнообразия.

Первой жертвой становится малочисленный материал. В конечный набор сгенерированных примеров редкий тип может просто не попасть. Если следующая модель воспроизводит частоты только этого набора, отсутствие превращается в нулевую вероятность дальнейшего появления. Наиболее распространенные варианты переживают переписывание легче. Возникает отбор в пользу привычных сочетаний, при котором необычная формулировка или редкий случай теряют место в учебной базе.

Условный расчет отделяет случайность от ее наследования. При частоте редкого типа 1 на 10 тысяч в выборке из 10 тысяч независимых примеров вероятность его полного отсутствия равна примерно 36,8%. Следующее копирование эмпирических частот закрепляет потерю. Этот процент относится к заданному примеру, без претензии измерить забывчивость коммерческих нейросетей. Вывод касается самого способа передачи: размножение оставшихся записей не возвращает отсутствующую запись.

Исследование охватывает языковые модели и другие генеративные системы, включая вариационные автоэнкодеры и гауссовские смеси. В эксперименте с OPT-125m, обучавшейся на WikiText-2 и затем на ответах предшественников, 9-е поколение превратило продолжение текста об архитектуре в перечисление разноцветных зайцев. Попытка подавить повторы дополнительным штрафом ухудшила результат. Стилистическое разнообразие не исправило утрату исходного содержания: машине можно запретить повторять слова, не предоставив ей недостающих сведений.

Искажения трудно обратить внутри замкнутой цепочки. Сведения о том, что было отброшено, в ней уже могут отсутствовать. Возвращение исходного архива меняет условия задачи. Исследователь Маттиас Герстграссер и соавторы в работе 2024 года сохраняли первоначальные реальные данные и добавляли к ним все последующие синтетические наборы. В испытанных режимах накопление позволило избежать коллапса, возникавшего при замене. Производитель, уничтожающий старую базу ради удобства обновления, тем самым отказывается от проверенного способа ограничить наследование ошибок.

Сохраненный архив решает задачу передачи уже известного. Обновление знаний требует независимого поступления сведений: старые ответы не содержат наблюдений за событиями, случившимися после их создания. Поэтому человеческие тексты и фотографии имеют ценность как связь с внешним миром. По мере заполнения доступных массивов машинными публикациями растет значение происхождения каждой новой партии. Миллион пересказов одного сообщения не становится миллионом независимых свидетельств.

Google уже договорилась о регулярном получении такого потока у Reddit. Соглашение от 22 февраля 2024 года дало ей доступ к обновляемым публикациям и комментариям через интерфейс данных, в том числе для обучения моделей. Вице-президент Google Раджан Патель отдельно отметил человеческие разговоры и опыт пользователей. Это подтвержденный спрос на доступ к живому источнику, хотя договор не удостоверяет авторство каждого сообщения.

Для Google полезность такого доступа зависит от того, сумеет ли она сохранить первоисточники и отделить новые человеческие свидетельства от машинных пересказов. Если пользователи начнут массово возвращать на Reddit ответы нейросетей, обновляемый поток сможет замкнуться на прежних моделях. Тогда компания будет получать свежую дату публикации без соответствующего притока независимых сведений. Сокращать эту зависимость придется через проверку происхождения материала и сохранение оригиналов, которые сама генерация восстановить не может.

ex_trakt

https://t.me/ex_trakt/1053
Telegram Экстракт Оксфордский исследователь Илья Шумайлов и математик Кембриджского университета Захар Шумайлов вместе с коллегами описали саморазрушительный цикл обучения ИИ. Новая модель получает тексты предыдущей, затем ее ответы становятся сырьем следующей. При бесконтрольной…
More from @tamnadne
  1. Oct 2, 2026Трамп заявил, что США не будут вводить запрет на экспорт дизеля.
  2. Oct 2, 2026Во ФСИН опровергли данные о якобы бунте в перевозившем заключенных вагоне.
  3. Oct 2, 2026Reuters: фонд США и Украины заключил первую сделку по добыче полезных ископаемых. Как сооб…
  4. Oct 2, 2026Минздрав представил новый порядок медосвидетельствования водителей. Медзаключения будут фо…
  5. Oct 2, 2026Петербург Ньюс https://t.me/peterburgnovosti
  6. Oct 2, 2026Прокуратура требует сменить формулировку увольнения бывшего мэра Липецка. Ведомство добива…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →