Post #112
139

Дело за малым – раскодировать предложения. Хотя исследователи замечают, что тут неплохо подошли бы старые советские марковские цепи, разумеется, они берут датасет UltraChat, превращают его в пары «последовательность длин токенов -> фраза» и файнтюнят T5 решать эту задачу. При этом они файнтюнят две LLM (A и B), одна из которых умеет предсказывать первое предложение ответа, а вторая – последующие по предыдущему контексту. Сделано это потому, что первую тренировать немного проще – чатботы часто отвечают типовыми фразами (“As an AI language model” или “Sure, I can” и так далее), поэтому можно отдельно собрать соответствующий датасет. Для обучения используется скромная одна A6000.