🧪Эксперименты
TRM валидируют на Sudoku-Extreme, Maze-Hard и ARC-AGI 1 / 2. TRM, оказывается стабильно лучше HRM. На ARC-AGI метрики оказываются на уровне ведущих reasoning моделей (несколько уступая Grok 4).
Для обучения TRM используется train set, к которому применяются всевозможные аугментации, определяемые симметриями задач. TRM-MLP-Mixer хорош на Sudoku, но уступает TRM-Attn на остальных задачах.
💡 Выводы
Выходит, что в определенных нишах небольшие специализированные модельки все еще способны конкурировать с массивными general-purpose. С практической точки зрения интересно, возможно ли отмасштабировать такую или подобную архитектуру на real-world задачи. Концепция итеративного обновления решения близка к диффузионным моделям, можно ли это рассматривать как некоторое обобщение?
Post #559
1.46K
- ❤ 3