🧠 Как превратить терабайты неструктурированного текста в точные аналитические знания?
Казалось бы, сегодня большая языковая модель может решить любую текстовую задачу. Однако на практике разработчики сталкиваются с серьезными ограничениями: от галлюцинаций и лимитов контекста до низкой скорости работы на больших потоках данных и рисков утечки конфиденциальной информации.
На Data Day Андрей Буланов из компании «Айкумен ИБС» поделится практическим опытом создания эффективных гибридных систем, сочетающих различные нейросетевые модели и сложные алгоритмы обработки текстов.
Вы узнаете:
✅ почему классический RAG на основе векторного поиска не дает качественного результата и как научить систему умного поиска работать со сложной структурой документов, таблицами, изображениями и различными версиями файлов;
✅ как организовать работу без передачи конфиденциальной информации во внешние LLM;
✅ как выстроить потоковую классификацию огромного массива коротких документов (от обращений граждан до новостей СМИ и соцсетей), когда большие LLM не обеспечивают нужную скорость работы, а маленькие — не дают требуемой точности;
✅ как анализировать тысячи документов одновременно, если их объем превышает лимиты контекста модели, и получать аналитические отчеты строго на основе исходных текстов без галлюцинаций ИИ.
Андрей Буланов — генеральный директор АО «Айкумен ИБС», российского разработчика AI‑сервисов и решений на базе Big Data и платформы IQPLATFORM для интеллектуального анализа разнородных данных и построения поисково‑аналитических систем для государственного и корпоративного сектора. Преподаватель МГТУ им. Н. Э. Баумана, эксперт в области информационной безопасности.
👉 Сайт и программа Data Day
—
😁 Канал Data Day в MAX
Post #188
580

- 👍 2
- 🔥 2