⚡️ WORLD INTEL BRIEF
• 🆕 infra-bench — открытый набор тестов надёжности AI-агентов на реальных инфраструктурных задачах; первый датасет охватывает простые, средние и сложные сценарии в Kubernetes. Telegram:@learnkubenews
• 🔬 В DrivingBench модели через MCP управляли настоящей Toyota Corolla: GPT-6 Astra после разбора первой неудачи прошла всю трассу, тогда как Claude Fable 5.1 преодолела 45%, Grok 4.6 — 11%, GPT-5.6 Sol — 6%. Telegram:@neuralshit
↳ Самоанализ между попытками превратил частичный результат Astra в полностью выполненную физическую задачу.
—
📡 @azalio_tech_summary
Post #9593
12