TGViewer
Все о блокчейн/мозге/space/WEB 3.0 в России и мире Все о блокчейн/мозге/space/WEB 3.0 в России и мире @blockchainrf · 20.5K subscribers
Post #13323 2.29K
ИИ научился сам придумывать себе тренировочные среды

Self-play после AlphaGo наконец добрался и до языковых моделей.

Новая работа SPADE - это, возможно, первый пример, когда self-play по-настоящему заработал для общих рассуждений у LLM.

Одна модель теперь:
1. сама пишет себе полноценные многоходовые среды на Python

2. сама в них учится

3. сама поднимает планку сложности под свой уровень.

Больше не нужен человек, который вручную создаёт и подбирает задачи.

Модель генерирует себе бесконечный, всё более сложный учебный план прямо на границе своих возможностей.

Один из последних ручных этапов пост-тренинга автоматизирован.
SPADE SPADE: Self-Play in Adaptive Synthetic Executable Environments SPADE trains a single LLM to design its own long-horizon, multi-turn training environments as executable Python and improve by acting in them.
  • 🔥 8
  • ❤ 6
  • 👍 4
  • 🤔 1
  • 🤩 1
More from @blockchainrf
  1. Sep 25, 2026Свежее от #DeepSeek:они показали,как выглядит фабрика обучения ИИ-агентов изнутри Команда…
  2. Sep 25, 2026Но всех рвет Джефф Дин, ex-Google, его стартап инвесторы оценивают в $50млрд, и это не пре…
  3. Sep 25, 2026Это какое-то безумие, инвесторы оценивают разработчика Jev в $10млрд Мы недавно писали про…
  4. Sep 25, 2026Anthropic разобрали как создать ИИ-агентов для торговли и сами рынки для агентов Команда р…
  5. Sep 24, 2026Google DeepMind говорят, что безусловного дохода недостаточно для счастливого будущего с И…
  6. Sep 24, 2026Шмидхубер стал Chief Scientific Advisor в Sakana AI 🙂
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →