🤫120 выдуманных ссылок против 8: как мы побороли галлюцинации ИИ в строительных нормах
Можно ли доверять нейросети, когда на кону безопасность здания, сроки проекта и замечания госэкспертизы? Мы решили провести жесткий контрольный эксперимент. Результаты и полный разбор методологии — в нашей новой статье на Хабр.
Что мы сделали.
📎Взяли 100 реальных сложных запросов от инженеров. 📎📎Прогнали их через 6 систем, включая топовые GPT-5.5, Claude Opus и наш SP-AI.
📎Организовали 3000 слепых оценок от 5 независимых LLM-судей с обязательной перекрестной проверкой каждой ссылки по корпусу нормативов.
🔵 Главный инсайт: Мы сравнили одну и ту же модель (DeepSeek V4-Pro) в двух режимах: «соло» (по своей памяти) и в связке с нашим агентным поисковым контуром.
Результат говорит сам за себя: модель без контура — 120 пометок о выдуманных ссылках. Та же модель в архитектуре SP-AI: всего 8 пометок. Мы обошли универсальные модели по ключевым «доказательным» осям: фактической корректности, достоверности ссылок и безопасности инженерных рекомендаций. Секрет не в размере модели, а в архитектуре.
Читайте полный разбор данных, статистику и ответы на вопрос, почему классический RAG ломается на таблицах и нормах.
Post #12
222
- ❤ 4
- 🔥 3
- ⚡ 2



