Личный ассистент, Cursor и все остальное
Бомбит меня уже неделю, и я ждал окончание запуска модуля, чтобы поделиться с вами своей работой.
Около месяца назад я решил написать своего собственного ассистента для аудита смарт контрактов: скачать модель LLM, обучить ее нужным мне материалам и затем использовать в работе.
P.S. Отмечу, что это планируется именно как ассистент, а не как анализатор кода, который сам может находить баги.
Для ускорения процесса я решил использовать Cursor с Claude 4 и ChatGPT для написания Python скриптов, так как полагал, что огромное количество информации в сети, обилие библиотек и решений на stackoverflow по этому языку, должны помочь создавать код быстро и сразу.
Одной из задач было выделение текстовой информации из PDF файлов. И это именно то, что заставляет меня сейчас писать этот пост!
Сколько существует формат pdf? Сколько python? Какого уровня достигли AI?
Это вообще ничего не значит, если тебе надо просто взять текст из PDF, в которых могут быть представлены примеры кода Solidity. 99% решений, скриптов, библиотек оказываются абсолютно не подходящими для выполнения задач!
Я испробовал: pymupdf, pdfplumber, pdftotext, pdf2image, pdfminer. С каждой из этих библиотек нейронки божились, что это лучшее решение на рынке и оно точно сработает. И ничего!
Последней каплей со скриптами было pdf2htmlex. ChatGPT уверял, что это лучшее решение. Даже лучше предыдущих! А когда я узнал, что поддержка библиотеки была прекращена еще в 2018 году и написал об этом в чат, знаете, что модель мне выдала: "Ой, да вы правы, это устаревшее и не сработает...". Ну, вот нельзя ли было сразу об этом написать?!
Но я же упорный! Мне нужно перевести файлы из PDF в markdown, я искал другие варианты...
По рекомендации тех же "умных" ИИ я пошел качать Donut, PaddleOCR, TrOCR, Tesseract с их навороченным OCR-подходом.
И снова мимо! Текст еще более-менее распознают, но с Solidity кодом просто беда! Пропущенные типы данных, скобки, области видимости и т.д. Код получается абсолютно не читаемым!
И это блин современные решения!
Далее были одни из самых продвинутых подходом: MarkedItDown, Markdown и еще пара. И я... просто пока не знаю, что делать!
Простая идея с конвертированием pdf становится камнем преткновения...
К чему я это все рассказываю?
Не говоря уже о Solidity, нейронные сети еще долго не смогут заменить программистов и создавать 100% работающие решения.
Они могут создавать фронтенд сайтов. Но таких сайтов, какие они сами знают. Попробуйте отредактировать их результат или объяснить им, что вы хотите. И тут вы потратите гораздо больше времени, чем если бы писали код сами.
А бекенд? Простые решения для записи данных в mysql и запуск простого сервера еще куда не шло. Но более сложные запросы ставят их в ступор.
И самое плохое то, что они вообще не гарантируют и сами не знают, будет ли их код работать в рамках вашего проекта.
Сети обучаются на на выполнении конкретных задач, а на паттернах языкового кода. А вот хороший этот код или нет, мы не знаем.
Кроме того, они обучены предлагать самые популярные библиотеки и решения. И не важно, поддерживаются они еще или нет.
Все это делает разработку "без знаний" абсолютно не рабочим процессом.
Вам реально самим нужно контролировать работу нейронок и понимать, когда они делают то, что нужно, а когда их несет в противоположную сторону.
Будьте аккуратны в своих проектах при использовании сетей. Изучайте проблему сами и ищите решения сами, прежде, чем будете консультироваться с нейронками по поводу кода.
#offtop
Post #1416
1.1K
- 🔥 11
- ❤ 4
- 👍 1