Пилишь собственные harness-системы? Тогда не пролистывай мимо свежей пачки моделей System One.
Поначалу был Jev. А теперь — Contrastive Language Model (CLM). И работает он шустрее Jev аж в 9 раз. Похоже, что с ролью верификатора CLM справляется лучше, особенно когда задача растянута на длинный горизонт выполнения.
В чём вообще разница между Jev и CLM? CLM учится контрастно, а Jev — через Reinforcement Learning for Calibrated Decisions (RLCD). Jev берёт ситуацию вместе с заранее заданными вопросами и на выходе отдаёт типизированные решения с вероятностями. CLM устроен иначе: загоняет ситуацию и возможные действия в эмбеддинги, меряет их сходство, а дальше ранжирует или вытаскивает самый подходящий вариант. Смысл в том, что решить эту задачу можно несколькими путями, и это правда любопытно. Код и веса выложили под Apache 2.0.
👉 About Python
Post #3175
140