TGViewer
Кисель в АйТи | AI и технологии Кисель в АйТи | AI и технологии @kisel_it · 4.34K subscribers
Post #297 1.17K
Вышло любопытное исследование SkillsBench. Они протестировали кучу LLM-агентов (от Claude 4.5 до Gemini 3 и GPT-5.2) на то, как они решают задачи с использованием Skills и без них.

Главный инсайт: грамотно написанные скилы могут помочь даже младшим моделям обойти старших. Младшие и дешевые модели (например, быстрая Gemini Flash или Haiku) с правильной «обвязкой» в виде Skills обходят тяжеловесов (Pro/Opus), которые пытаются решить задачу без скилов. Прирост успешных решений с готовыми скиллами в среднем составил +16,2%.

Но есть нюансы.
1. Самогенерация не работает. Как только модели предлагают сгенерировать Skills для себя, их результативность падает.
2. Больше — не значит лучше. Оптимальный объем для агента — 2–3 скилла (дает прирост +18,6%). Если напихать 4 и более, эффективность резко падает. Если закинуть агенту полную и подробную документацию, он в ней буквально тонет, и результат уходит в минус (–2,9%).

Ссылочки:
https://www.skillsbench.ai/
https://arxiv.org/pdf/2602.12670
  • 👍 7
More from @kisel_it
  1. Oct 5, 2026Кажется, я нашёл, где можно нормально проверить своих ИИ-агентов в бою 😅 Сегодня зарегист…
  2. Oct 3, 2026Кажется, OpenAI тихо докрутили multi-agent режим на декстопе в ChatGPT. Сегодня дал ему за…
  3. Oct 2, 2026Как получать офферы на 250к+ на стагнирующем backend-рынке в 2026? Для начала — знать реал…
  4. Oct 2, 2026Антропики настолько переживают за будущее человечества и неконтролируемую гонку ИИ, что ре…
  5. Oct 1, 2026Я уже давно хотел завести рубрику про дни рождения людей, которые сильно повлияли на прогр…
  6. Sep 30, 2026Так, ну этим я точно не могу не поделиться. Dot для себя сгенерировал целый пак анимаций п…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →