Почему LLM обычно скептически относятся к астрологии и гомеопатии? Считается, что дело в SFT и алайнменте, модель целенаправленно учат давать нужные ответы, а в претрейне преобладают "правильные" тексты
Я решил проверить, может ли само обучение создавать такое предпочтение. Провёл больше трёхсот экспериментов с обучением небольших LLM с нуля, без какого-либо алайнмента. Оказалось, что на контролируемых задачах важна не только доля ошибок, но и их структура
Уже писал про первые эксперименты. На контролируемой математике даже при 10% верных решений и 90% случайных ошибок правильное решение чаще выигрывает у отдельного ошибочного. А вот если ошибки между собой согласованы, то предпочтение исчезает
Моя гипотеза - модель охотнее учит то, что можно вывести из простых правил. Сила научного объяснения в том, что одно правило связывает множество наблюдений и позволяет предсказывать новые. Возможно, поэтому обучение и создаёт предпочтение в его пользу
Послезавтра, 17 сентября, выступаю на AI R&D Day с докладом "Как модель выбирает точку зрения, обучаясь на противоречивых данных". Там и расскажу что накопал
- 15:30, трек ML & Research. Можно очно в Москве или онлайн, участие бесплатное по регистрации. Заходите послушать или подключайтесь онлайн!
Ссылка на саму статью на arXiv: https://arxiv.org/abs/2603.11749
Post #170
2.85K

- 🔥 31
- 👍 19