Обратите внимание на новую волну моделей System One, если вы создаёте собственные harness-системы.
Сначала Jev. Теперь Contrastive Language Model (CLM).
CLM работает в 9 раз быстрее, чем Jev.
Похоже, что CLM лучше справляется с ролью верификатора, особенно в задачах с длинным горизонтом выполнения.
Чем отличаются Jev и CLM?
CLM использует контрастное обучение, а Jev обучается с помощью Reinforcement Learning for Calibrated Decisions (RLCD).
Jev получает ситуацию вместе с заранее определёнными вопросами и возвращает типизированные решения с вероятностями.
CLM кодирует ситуацию и возможные действия в эмбеддинги, сравнивает их сходство, а затем ранжирует или выбирает наиболее подходящий вариант.
Суть в том, что существует несколько способов решать эту задачу, и это действительно интересно.
Код и веса опубликованы под Apache 2.0. 🚬
Post #3949
11.7K