TGViewer
КПД КПД @quant_prune_distill · 3.49K subscribers
Post #559 1.46K
🧪Эксперименты

TRM валидируют на Sudoku-Extreme, Maze-Hard и ARC-AGI 1 / 2. TRM, оказывается стабильно лучше HRM. На ARC-AGI метрики оказываются на уровне ведущих reasoning моделей (несколько уступая Grok 4).

Для обучения TRM используется train set, к которому применяются всевозможные аугментации, определяемые симметриями задач. TRM-MLP-Mixer хорош на Sudoku, но уступает TRM-Attn на остальных задачах.

💡 Выводы

Выходит, что в определенных нишах небольшие специализированные модельки все еще способны конкурировать с массивными general-purpose. С практической точки зрения интересно, возможно ли отмасштабировать такую или подобную архитектуру на real-world задачи. Концепция итеративного обновления решения близка к диффузионным моделям, можно ли это рассматривать как некоторое обобщение?
  • ❤ 3
More from @quant_prune_distill
  1. Oct 7, 2026А еще есть красивая демка
  2. Oct 7, 2026⚙️ Метод MMD есть мера различия между двумя распределениями P, Q. Задается некоторый полож…
  3. Oct 7, 2026🧠 Representation-Space MMD for Diffusion Language Models 📄 Статья Первое, что приходит в…
  4. Oct 7, 2026А вообще, можно энкодить все на языке brainfuck и иметь Тьюринг-полную систему.
  5. Oct 7, 2026Jev не генеративен, потому что он не выбирает следующий токен, а выбирает один из варианто…
  6. Oct 6, 2026Совпадение? Не думаю!
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →