У меня была папка "Разобрать" в базе знаний с полутора тысячами документов.
Подзавалило немношк.
Конечно, разбирать вручную этот объём — безумие. Но я нашёл решение.
300 рублей, модель claude-opus и я получил классификатор для своей базы знаний на python. И он запустился, и он работает так как ожидалось.
Софтина работает в трёх режимах:
• автоматическая классификация папки "Разобрать" с помощью LLM по заданным категориям
• классификация силами человека через телеграм-бота (такое ещё называют "human-in-the-loop")
• автоматическая экстракция полезных сведений из статей с созданием новых статей на основании экстрагированных данных
1500 документов при стоимости запроса к LLM-ке хотя бы в 7 рублей — это больше 10 тысяч рублей за один прогон. Не готов к таким тратам. Поэтому для этой задачи взята ollama с локальной моделью. Ноутбук не потянул deepseek-r1:14b, пришлось взять llama3.1:8b — и её, как ни удивительно, оказалось достаточно.
Раскидал-а llama... Ну где-то с 70% точностью. Что неплохо на заявленных объёмах, и реально дало изначальный импульс для причёсывания базы знаний. Потом прошёлся, поудалял то, что скрипт решил, что полезно, а на самом деле является устаревшим мусором — но тут уж, объективно, только человеческое чувство прекрасного могло бы с этим справиться.
В очередной раз убедился, что LLM-ки убрали из программирования всю скучную часть и оставили только интересное: аналитику, продуктовую работу и получение результатов.
Post #635
1.62K
- 👍 14
- 🔥 8