TGViewer
Machinelearning Machinelearning @ai_machinelearning_big_data · 279K subscribers
Post #10805 27.2K
🌟 Prime Intellect выложила отчет об агенте, с которым Opus 5 взял 95,5% на ARC-AGI-3

Prime Agent — это больше, чем харнесс модели. Сами авторы называют проект операционной системой для долгоживущих агентов.

Умнее модель он не делает, но дает ей работать дольше - программно раскладывать информацию, параллельно раздавать задачи подагентам и копить полезные процедуры.

Идея в том, чтобы у языковой модели была устойчивая вычислительная среда, где она сама распоряжается памятью, кодом, подагентами и долгими задачами.


Состояние в системе разложено по четырем уровням:

🟢веса модели - то, что она знает после обучения;
🟢активный контекст - информация текущего шага;
🟢постоянный REPL и рекурсивные подагенты - внешние вычисления, инструменты и параллельная работа;
🟢дисковое состояние - история, факты, навыки, промпты и спецификации подагентов.

Состояние переживает и шаги, и перезапуски, и отключения. Человек при этом может наблюдать за агентами и вмешиваться.

🟡Замеры

Сильнее всего эффект виден на длинных интерактивных задачах. На ARC-AGI-3 конфигурация с Opus 5 дала 95,5% Best@1 против 30,2% у обвязки самой ARC.

На длинноконтекстных задачах Prime Agent держится наравне с конкурентами, а на отдельных, вроде EmulatorBench, заметно вырывается вперед. Он обошел Pi-mono с GLM-5.2 и Codex с GPT-5.6 Sol, но уступил Claude Code с Opus 5.

Отдельно показательны игровые прогоны на эмуляторах. На Sega Genesis связка Prime Agent и GPT-5.6 Sol набрала 61,6% по итоговой оценке верификатора, а Claude Code с той же моделью — ноль. На Game Boy Color разрыв еще резче: 99,8% против нуля.

🟡 Побочный эффект

Самая любопытная деталь отчета - накопление навыков закрепляет не только полезное.

В одном из экспериментов агент нашел способ обходить ограничения Factorio, сохранил его как переиспользуемый навык и тем самым записал эксплойт в долговременную память. Дальше он доставал оттуда именно это решение, потому что оно один раз сработало.

На днях вышел релиз 0.8.0 с исправлениями найденных проблем и новыми возможностями.



📌Лицензирование: MIT License


🟡Техотчет
🖥Github


@ai_machinelearning_big_data

#AI #ML #Harness #Agents #PrimeIntellect
  • 👍 81
  • ❤ 44
  • 🔥 19
  • 👏 14
  • 🤔 9
  • 🎉 4
More from @ai_machinelearning_big_data
  1. Sep 26, 2026✔️ Апелляционный суд США оставил Anthropic в чёрном списке Пентагона Суд округа Колумбия п…
  2. Sep 26, 2026📌Fable 5.1 рассчитала амплитуду рассеяния в девяти петлях Модель в среде Claude Science р…
  3. Sep 25, 2026✔️ Google добавила в Gemini 3.8 Live говорящий видеоаватар Gemini 3.8 Live with Live Avata…
  4. Sep 25, 2026Появилось открытое сообщество для решения NetHack Исследователи из AIRI зовут объединяться…
  5. Sep 25, 2026✔️ OpenAI выпустила открытый бенчмарк для оценки ИИ в психологии Набор Mental Health Bench…
  6. Sep 25, 2026⚡️ OpenAI готовит подписку ChatGPT Pro Max Согласно утечкам из кодовой базы сервиса, в бли…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →